{"id":"https://openalex.org/W7128610987","doi":"https://doi.org/10.48550/arxiv.2602.09207","title":"CausalGDP: Causality-Guided Diffusion Policies for Reinforcement Learning","display_name":"CausalGDP: Causality-Guided Diffusion Policies for Reinforcement Learning","publication_year":2026,"publication_date":"2026-02-09","ids":{"openalex":"https://openalex.org/W7128610987","doi":"https://doi.org/10.48550/arxiv.2602.09207"},"language":null,"primary_location":{"id":"pmh:doi:10.48550/arxiv.2602.09207","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"public-domain","license_id":"https://openalex.org/licenses/public-domain","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"type":"article","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":null,"any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5039526559","display_name":"Xiaofeng Xiao","orcid":"https://orcid.org/0009-0004-1001-4761"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xiao, Xiaofeng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5125640647","display_name":"Xiao Hu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Hu, Xiao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5085383839","display_name":"Yang Ye","orcid":"https://orcid.org/0000-0003-0101-5290"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ye, Yang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5125679180","display_name":"Xubo Yue","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yue, Xubo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.17656313,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8090000152587891,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8090000152587891,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10982","display_name":"Motor Control and Adaptation","score":0.014000000432133675,"subfield":{"id":"https://openalex.org/subfields/2805","display_name":"Cognitive Neuroscience"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},{"id":"https://openalex.org/T10784","display_name":"Muscle activation and electromyography studies","score":0.010999999940395355,"subfield":{"id":"https://openalex.org/subfields/2204","display_name":"Biomedical Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/causality","display_name":"Causality (physics)","score":0.7203999757766724},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6940000057220459},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.6057999730110168},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.5946000218391418},{"id":"https://openalex.org/keywords/causal-model","display_name":"Causal model","score":0.4553000032901764},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.42489999532699585},{"id":"https://openalex.org/keywords/limiting","display_name":"Limiting","score":0.4244000017642975},{"id":"https://openalex.org/keywords/range","display_name":"Range (aeronautics)","score":0.40450000762939453}],"concepts":[{"id":"https://openalex.org/C64357122","wikidata":"https://www.wikidata.org/wiki/Q1149766","display_name":"Causality (physics)","level":2,"score":0.7203999757766724},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6940000057220459},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6406999826431274},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.6057999730110168},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.5946000218391418},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.46639999747276306},{"id":"https://openalex.org/C11671645","wikidata":"https://www.wikidata.org/wiki/Q5054567","display_name":"Causal model","level":2,"score":0.4553000032901764},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.42489999532699585},{"id":"https://openalex.org/C188198153","wikidata":"https://www.wikidata.org/wiki/Q1613840","display_name":"Limiting","level":2,"score":0.4244000017642975},{"id":"https://openalex.org/C204323151","wikidata":"https://www.wikidata.org/wiki/Q905424","display_name":"Range (aeronautics)","level":2,"score":0.40450000762939453},{"id":"https://openalex.org/C69357855","wikidata":"https://www.wikidata.org/wiki/Q163214","display_name":"Diffusion","level":2,"score":0.3871000111103058},{"id":"https://openalex.org/C2779843651","wikidata":"https://www.wikidata.org/wiki/Q7390335","display_name":"SIGNAL (programming language)","level":2,"score":0.335099995136261},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3287999927997589},{"id":"https://openalex.org/C42058472","wikidata":"https://www.wikidata.org/wiki/Q810214","display_name":"Base (topology)","level":2,"score":0.3231000006198883},{"id":"https://openalex.org/C68710425","wikidata":"https://www.wikidata.org/wiki/Q5275442","display_name":"Diffusion process","level":3,"score":0.3199000060558319},{"id":"https://openalex.org/C115086926","wikidata":"https://www.wikidata.org/wiki/Q17004651","display_name":"Causal reasoning","level":3,"score":0.31709998846054077},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.29919999837875366},{"id":"https://openalex.org/C77405623","wikidata":"https://www.wikidata.org/wiki/Q598451","display_name":"System dynamics","level":2,"score":0.27320000529289246},{"id":"https://openalex.org/C4554734","wikidata":"https://www.wikidata.org/wiki/Q593744","display_name":"Knowledge base","level":2,"score":0.27160000801086426},{"id":"https://openalex.org/C158600405","wikidata":"https://www.wikidata.org/wiki/Q5054566","display_name":"Causal inference","level":2,"score":0.2671000063419342},{"id":"https://openalex.org/C136197465","wikidata":"https://www.wikidata.org/wiki/Q1729295","display_name":"Variety (cybernetics)","level":2,"score":0.26030001044273376},{"id":"https://openalex.org/C163504300","wikidata":"https://www.wikidata.org/wiki/Q2364925","display_name":"Causal structure","level":2,"score":0.2596000134944916},{"id":"https://openalex.org/C129824826","wikidata":"https://www.wikidata.org/wiki/Q2630107","display_name":"Granger causality","level":2,"score":0.2540000081062317}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:doi:10.48550/arxiv.2602.09207","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"public-domain","license_id":"https://openalex.org/licenses/public-domain","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},{"id":"doi:10.48550/arxiv.2602.09207","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2602.09207","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"public-domain","license_id":"https://openalex.org/licenses/public-domain","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:doi:10.48550/arxiv.2602.09207","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"public-domain","license_id":"https://openalex.org/licenses/public-domain","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/16","display_name":"Peace, Justice and strong institutions","score":0.817129909992218}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1],"(RL)":[2],"has":[3],"achieved":[4],"remarkable":[5],"success":[6],"in":[7,170],"a":[8,70,83,116],"wide":[9],"range":[10],"of":[11],"sequential":[12],"decision-making":[13],"problems.":[14],"Recent":[15],"diffusion-based":[16,78,164],"policies":[17,30],"further":[18],"improve":[19],"RL":[20,167],"by":[21],"modeling":[22],"complex,":[23,171],"high-dimensional":[24,172],"action":[25,55,144],"distributions.":[26],"However,":[27],"existing":[28],"diffusion":[29,85,122],"primarily":[31],"rely":[32],"on":[33,143],"statistical":[34],"associations":[35],"and":[36,47,87,102,113,131,165],"fail":[37],"to":[38,52,119],"explicitly":[39,134],"account":[40],"for":[41],"causal":[42,75,90,97,108],"relationships":[43],"among":[44,99],"states,":[45,100],"actions,":[46,101],"rewards,":[48],"limiting":[49],"their":[50],"ability":[51],"identify":[53],"which":[54],"components":[56,145],"truly":[57],"cause":[58],"high":[59],"returns.":[60],"In":[61],"this":[62],"paper,":[63],"we":[64],"propose":[65],"Causality-guided":[66],"Diffusion":[67],"Policy":[68],"(CausalGDP),":[69],"unified":[71],"framework":[72],"that":[73,126,146,154],"integrates":[74],"reasoning":[76],"into":[77],"RL.":[79],"CausalGDP":[80,139,155],"first":[81],"learns":[82],"base":[84],"policy":[86,141],"an":[88],"initial":[89],"dynamical":[91],"model":[92],"from":[93],"offline":[94,166],"data,":[95],"capturing":[96],"dependencies":[98],"rewards.":[103,132],"During":[104],"real-time":[105],"interaction,":[106],"the":[107,121],"information":[109],"is":[110],"continuously":[111],"updated":[112],"incorporated":[114],"as":[115],"guidance":[117],"signal":[118],"steer":[120],"process":[123],"toward":[124],"actions":[125],"causally":[127],"influence":[128],"future":[129],"states":[130],"By":[133],"considering":[135],"causality":[136],"beyond":[137],"association,":[138],"focuses":[140],"optimization":[142],"genuinely":[147],"drive":[148],"performance":[149,161],"improvements.":[150],"Experimental":[151],"results":[152],"demonstrate":[153],"consistently":[156],"achieves":[157],"competitive":[158],"or":[159],"superior":[160],"over":[162],"state-of-the-art":[163],"methods,":[168],"especially":[169],"control":[173],"tasks.":[174]},"counts_by_year":[],"updated_date":"2026-07-15T18:14:33.161393","created_date":"2026-02-12T00:00:00"}
