{"id":"https://openalex.org/W7161028815","doi":"https://doi.org/10.48550/arxiv.2605.12312","title":"Transferable Delay-Aware Reinforcement Learning via Implicit Causal Graph Modeling","display_name":"Transferable Delay-Aware Reinforcement Learning via Implicit Causal Graph Modeling","publication_year":2026,"publication_date":"2026-05-12","ids":{"openalex":"https://openalex.org/W7161028815","doi":"https://doi.org/10.48550/arxiv.2605.12312"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.12312","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.12312","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.12312","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5016270698","display_name":"Chenran Zhao","orcid":"https://orcid.org/0009-0008-6261-9585"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhao, Chenran","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5019758816","display_name":"Dianxi Shi","orcid":"https://orcid.org/0000-0002-8112-371X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shi, Dianxi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5100677019","display_name":"Yaowen Zhang","orcid":"https://orcid.org/0000-0002-1379-2639"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Yaowen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136020545","display_name":"Chunping Qiu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Qiu, Chunping","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5136075431","display_name":"Shaowu Yang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yang, Shaowu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.5656999945640564,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.5656999945640564,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T13553","display_name":"Age of Information Optimization","score":0.11840000003576279,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.03819999843835831,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6629999876022339},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.5253000259399414},{"id":"https://openalex.org/keywords/graph","display_name":"Graph","score":0.475600004196167},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.44769999384880066},{"id":"https://openalex.org/keywords/encoder","display_name":"Encoder","score":0.4431000053882599},{"id":"https://openalex.org/keywords/task-analysis","display_name":"Task analysis","score":0.40299999713897705},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.3544999957084656},{"id":"https://openalex.org/keywords/multi-task-learning","display_name":"Multi-task learning","score":0.3422999978065491}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7452999949455261},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6629999876022339},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6234999895095825},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.5253000259399414},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.499099999666214},{"id":"https://openalex.org/C132525143","wikidata":"https://www.wikidata.org/wiki/Q141488","display_name":"Graph","level":2,"score":0.475600004196167},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.44769999384880066},{"id":"https://openalex.org/C118505674","wikidata":"https://www.wikidata.org/wiki/Q42586063","display_name":"Encoder","level":2,"score":0.4431000053882599},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.40299999713897705},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.3544999957084656},{"id":"https://openalex.org/C28006648","wikidata":"https://www.wikidata.org/wiki/Q6934509","display_name":"Multi-task learning","level":3,"score":0.3422999978065491},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.33180001378059387},{"id":"https://openalex.org/C150899416","wikidata":"https://www.wikidata.org/wiki/Q1820378","display_name":"Transfer of learning","level":2,"score":0.32249999046325684},{"id":"https://openalex.org/C51167844","wikidata":"https://www.wikidata.org/wiki/Q4422623","display_name":"Latent variable","level":2,"score":0.31929999589920044},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.2922999858856201},{"id":"https://openalex.org/C11671645","wikidata":"https://www.wikidata.org/wiki/Q5054567","display_name":"Causal model","level":2,"score":0.2865000069141388},{"id":"https://openalex.org/C168167062","wikidata":"https://www.wikidata.org/wiki/Q1117970","display_name":"Component (thermodynamics)","level":2,"score":0.27790001034736633},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.2712000012397766},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.2709999978542328},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.267300009727478},{"id":"https://openalex.org/C77405623","wikidata":"https://www.wikidata.org/wiki/Q598451","display_name":"System dynamics","level":2,"score":0.26460000872612},{"id":"https://openalex.org/C12725497","wikidata":"https://www.wikidata.org/wiki/Q810247","display_name":"Baseline (sea)","level":2,"score":0.2533000111579895}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.12312","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.12312","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.12312","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.12312","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Random":[0],"delays":[1],"weaken":[2],"the":[3,19,38,116,130,150],"temporal":[4],"correspondence":[5],"between":[6],"actions":[7],"and":[8,33,81,98,108,123,154,164],"subsequent":[9],"state":[10],"feedback,":[11],"making":[12],"it":[13],"difficult":[14],"for":[15],"agents":[16],"to":[17,71,86,112,161],"identify":[18],"true":[20],"propagation":[21],"process":[22],"of":[23,40],"action":[24],"effects.":[25],"In":[26],"cross-task":[27,120],"scenarios,":[28],"changes":[29],"in":[30,115],"task":[31,43],"objectives":[32],"reward":[34],"formulations":[35],"further":[36,147],"reduce":[37],"reusability":[39],"previously":[41],"acquired":[42],"knowledge.":[44,101],"To":[45],"address":[46],"this":[47,49,103],"problem,":[48],"paper":[50],"proposes":[51],"a":[52,68,83],"transferable":[53,95],"delay-aware":[54],"reinforcement":[55],"learning":[56,94,107],"method":[57,66,132],"based":[58],"on":[59,136],"implicit":[60],"causal":[61,89],"graph":[62],"modeling.":[63],"The":[64],"proposed":[65,131],"uses":[67],"field-node":[69],"encoder":[70],"represent":[72],"high-dimensional":[73],"observations":[74],"as":[75],"latent":[76,117],"states":[77],"with":[78,141],"node-level":[79],"semantics,":[80],"employs":[82],"message-passing":[84],"mechanism":[85],"characterize":[87],"dynamic":[88],"dependencies":[90],"among":[91],"nodes,":[92],"thereby":[93],"structured":[96,152],"representations":[97,153],"environment":[99],"dynamics":[100,155],"On":[102],"basis,":[104],"imagination-driven":[105],"behavior":[106],"planning":[109],"are":[110],"incorporated":[111],"optimize":[113],"policies":[114],"space,":[118],"enabling":[119],"knowledge":[121,156],"transfer":[122,145],"rapid":[124],"adaptation.":[125,168],"Experimental":[126],"results":[127],"show":[128],"that":[129,149],"outperforms":[133],"baseline":[134],"methods":[135],"DMC":[137],"continuous":[138],"control":[139],"tasks":[140,163],"random":[142],"delays.":[143],"Cross-task":[144],"experiments":[146],"demonstrate":[148],"learned":[151],"can":[157],"be":[158],"effectively":[159],"transferred":[160],"new":[162],"significantly":[165],"accelerate":[166],"policy":[167]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-05-14T00:00:00"}
