{"id":"https://openalex.org/W7134834858","doi":"https://doi.org/10.48550/arxiv.2603.08118","title":"Model-based Offline RL via Robust Value-Aware Model Learning with Implicitly Differentiable Adaptive Weighting","display_name":"Model-based Offline RL via Robust Value-Aware Model Learning with Implicitly Differentiable Adaptive Weighting","publication_year":2026,"publication_date":"2026-03-09","ids":{"openalex":"https://openalex.org/W7134834858","doi":"https://doi.org/10.48550/arxiv.2603.08118"},"language":null,"primary_location":{"id":"pmh:doi:10.48550/arxiv.2603.08118","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"type":"article","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":null,"any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5128648214","display_name":"Zhongjian Qiao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Qiao, Zhongjian","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128632789","display_name":"Jiafei Lyu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lyu, Jiafei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128663641","display_name":"Boxiang Lyu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lyu, Boxiang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128652502","display_name":"Yao Shu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shu, Yao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128664675","display_name":"Siyang Gao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Gao, Siyang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5128653919","display_name":"Shuang Qiu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Qiu, Shuang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.29036543,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6809999942779541,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6809999942779541,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.12970000505447388,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.03610000014305115,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5737000107765198},{"id":"https://openalex.org/keywords/generalization","display_name":"Generalization","score":0.5720999836921692},{"id":"https://openalex.org/keywords/weighting","display_name":"Weighting","score":0.4814999997615814},{"id":"https://openalex.org/keywords/differentiable-function","display_name":"Differentiable function","score":0.4641999900341034},{"id":"https://openalex.org/keywords/hyperparameter","display_name":"Hyperparameter","score":0.4494999945163727},{"id":"https://openalex.org/keywords/minimax","display_name":"Minimax","score":0.44200000166893005},{"id":"https://openalex.org/keywords/regret","display_name":"Regret","score":0.38679999113082886},{"id":"https://openalex.org/keywords/scheme","display_name":"Scheme (mathematics)","score":0.37400001287460327},{"id":"https://openalex.org/keywords/adaptive-learning","display_name":"Adaptive learning","score":0.3424000144004822}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7013000249862671},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5737000107765198},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.5720999836921692},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5217999815940857},{"id":"https://openalex.org/C183115368","wikidata":"https://www.wikidata.org/wiki/Q856577","display_name":"Weighting","level":2,"score":0.4814999997615814},{"id":"https://openalex.org/C202615002","wikidata":"https://www.wikidata.org/wiki/Q783507","display_name":"Differentiable function","level":2,"score":0.4641999900341034},{"id":"https://openalex.org/C8642999","wikidata":"https://www.wikidata.org/wiki/Q4171168","display_name":"Hyperparameter","level":2,"score":0.4494999945163727},{"id":"https://openalex.org/C149728462","wikidata":"https://www.wikidata.org/wiki/Q751319","display_name":"Minimax","level":2,"score":0.44200000166893005},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.426800012588501},{"id":"https://openalex.org/C50817715","wikidata":"https://www.wikidata.org/wiki/Q79895177","display_name":"Regret","level":2,"score":0.38679999113082886},{"id":"https://openalex.org/C77618280","wikidata":"https://www.wikidata.org/wiki/Q1155772","display_name":"Scheme (mathematics)","level":2,"score":0.37400001287460327},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.3628000020980835},{"id":"https://openalex.org/C125014702","wikidata":"https://www.wikidata.org/wiki/Q4680749","display_name":"Adaptive learning","level":2,"score":0.3424000144004822},{"id":"https://openalex.org/C2776760102","wikidata":"https://www.wikidata.org/wiki/Q5139990","display_name":"Code (set theory)","level":3,"score":0.33180001378059387},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.32030001282691956},{"id":"https://openalex.org/C37736160","wikidata":"https://www.wikidata.org/wiki/Q1801315","display_name":"Adversarial system","level":2,"score":0.3107999861240387},{"id":"https://openalex.org/C43126263","wikidata":"https://www.wikidata.org/wiki/Q128751","display_name":"Source code","level":2,"score":0.30640000104904175},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.29660001397132874},{"id":"https://openalex.org/C2781067378","wikidata":"https://www.wikidata.org/wiki/Q17027399","display_name":"Interpretability","level":2,"score":0.290800005197525},{"id":"https://openalex.org/C35651441","wikidata":"https://www.wikidata.org/wiki/Q625303","display_name":"Independence (probability theory)","level":2,"score":0.27900001406669617},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.2712000012397766},{"id":"https://openalex.org/C41608201","wikidata":"https://www.wikidata.org/wiki/Q980509","display_name":"Embedding","level":2,"score":0.26829999685287476},{"id":"https://openalex.org/C2780490138","wikidata":"https://www.wikidata.org/wiki/Q7079636","display_name":"Offline learning","level":3,"score":0.2660999894142151},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.26460000872612},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.259799987077713},{"id":"https://openalex.org/C55439883","wikidata":"https://www.wikidata.org/wiki/Q360812","display_name":"Correctness","level":2,"score":0.25870001316070557},{"id":"https://openalex.org/C58166","wikidata":"https://www.wikidata.org/wiki/Q224821","display_name":"Fuzzy logic","level":2,"score":0.2574999928474426},{"id":"https://openalex.org/C2781002164","wikidata":"https://www.wikidata.org/wiki/Q6822311","display_name":"Meta learning (computer science)","level":3,"score":0.2572999894618988},{"id":"https://openalex.org/C127705205","wikidata":"https://www.wikidata.org/wiki/Q5748245","display_name":"Heuristics","level":2,"score":0.25699999928474426}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:doi:10.48550/arxiv.2603.08118","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},{"id":"doi:10.48550/arxiv.2603.08118","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.08118","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:doi:10.48550/arxiv.2603.08118","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","score":0.5382561087608337,"id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Model-based":[0],"offline":[1,8],"reinforcement":[2],"learning":[3,33,112,135],"(RL)":[4],"aims":[5],"to":[6,24,38,93,143,150,214],"enhance":[7],"RL":[9],"with":[10,66,84,113,125,147],"a":[11,35,44,49,55,63,130,155,182],"dynamics":[12,123,141],"model":[13,26,32,40,67,101,124,126,134,142,165,192],"that":[14,61,73,90,186,202],"facilitates":[15],"policy":[16],"exploration.":[17],"However,":[18,69],"\\textit{model":[19],"exploitation}":[20],"could":[21],"occur":[22,81],"due":[23],"inevitable":[25],"errors,":[27],"degrading":[28],"algorithm":[29],"performance.":[30],"Adversarial":[31],"offers":[34],"theoretical":[36],"framework":[37],"mitigate":[39],"exploitation":[41],"by":[42],"solving":[43],"maximin":[45],"formulation.":[46],"Within":[47],"such":[48],"paradigm,":[50],"RAMBO~\\citep{rigter2022rambo}":[51],"has":[52],"emerged":[53],"as":[54],"representative":[56],"and":[57,77,97,163,190,198,207],"most":[58],"popular":[59],"method":[60],"provides":[62],"practical":[64],"implementation":[65],"gradient.":[68],"we":[70,107,176],"empirically":[71],"reveal":[72],"severe":[74],"Q-value":[75,153],"underestimation":[76],"gradient":[78],"explosion":[79],"can":[80],"in":[82],"RAMBO":[83,206,221],"only":[85],"slight":[86],"hyperparameter":[87],"tuning,":[88],"suggesting":[89],"it":[91],"tends":[92],"be":[94],"overly":[95],"conservative":[96],"suffers":[98],"from":[99],"unstable":[100],"updates.":[102,166],"To":[103,167],"address":[104],"these":[105],"issues,":[106],"propose":[108,177],"\\textbf{RO}bust":[109],"value-aware":[110,133,191],"\\textbf{M}odel":[111],"\\textbf{I}mplicitly":[114],"differentiable":[115,179],"adaptive":[116,180],"weighting":[117],"(ROMI).":[118],"Instead":[119],"of":[120],"updating":[121],"the":[122,140,151],"gradient,":[127],"ROMI":[128,203],"introduces":[129],"novel":[131],"robust":[132],"approach.":[136],"This":[137],"approach":[138],"requires":[139],"predict":[144],"future":[145],"states":[146],"values":[148],"close":[149],"minimum":[152],"within":[154],"scale-adjustable":[156],"state":[157],"uncertainty":[158],"set,":[159],"enabling":[160],"controllable":[161],"conservatism":[162],"stable":[164],"further":[168],"improve":[169],"out-of-distribution":[170],"(OOD)":[171],"generalization":[172],"during":[173],"multi-step":[174],"rollouts,":[175],"implicitly":[178],"weighting,":[181],"bi-level":[183],"optimization":[184],"scheme":[185],"adaptively":[187],"achieves":[188,208],"dynamics-":[189],"learning.":[193],"Empirical":[194],"results":[195],"on":[196,218],"D4RL":[197],"NeoRL":[199],"datasets":[200,219],"show":[201],"significantly":[204],"outperforms":[205],"competitive":[209],"or":[210],"superior":[211],"performance":[212],"compared":[213],"other":[215],"state-of-the-art":[216],"methods":[217],"where":[220],"typically":[222],"underperforms.":[223],"Code":[224],"is":[225],"available":[226],"at":[227],"https://github.com/zq2r/ROMI.git.":[228]},"counts_by_year":[],"updated_date":"2026-07-15T18:14:33.161393","created_date":"2026-03-11T00:00:00"}
