{"id":"https://openalex.org/W4414359477","doi":"https://doi.org/10.24963/ijcai.2025/642","title":"Imagination-Limited Q-Learning for Offline Reinforcement Learning","display_name":"Imagination-Limited Q-Learning for Offline Reinforcement Learning","publication_year":2025,"publication_date":"2025-09-01","ids":{"openalex":"https://openalex.org/W4414359477","doi":"https://doi.org/10.24963/ijcai.2025/642"},"language":"en","primary_location":{"id":"doi:10.24963/ijcai.2025/642","is_oa":true,"landing_page_url":"https://doi.org/10.24963/ijcai.2025/642","pdf_url":"https://www.ijcai.org/proceedings/2025/0642.pdf","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://www.ijcai.org/proceedings/2025/0642.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5100429037","display_name":"Wenhui Liu","orcid":"https://orcid.org/0009-0002-7766-8802"},"institutions":[{"id":"https://openalex.org/I66867065","display_name":"East China Normal University","ror":"https://ror.org/02n96ep67","country_code":"CN","type":"education","lineage":["https://openalex.org/I66867065"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Wenhui Liu","raw_affiliation_strings":["East China Normal University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"East China Normal University","institution_ids":["https://openalex.org/I66867065"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5042499646","display_name":"Zhijian Wu","orcid":"https://orcid.org/0000-0002-3040-3287"},"institutions":[{"id":"https://openalex.org/I66867065","display_name":"East China Normal University","ror":"https://ror.org/02n96ep67","country_code":"CN","type":"education","lineage":["https://openalex.org/I66867065"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Zhijian Wu","raw_affiliation_strings":["East China Normal University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"East China Normal University","institution_ids":["https://openalex.org/I66867065"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5028904438","display_name":"Jingchao Wang","orcid":"https://orcid.org/0000-0003-1848-320X"},"institutions":[{"id":"https://openalex.org/I66867065","display_name":"East China Normal University","ror":"https://ror.org/02n96ep67","country_code":"CN","type":"education","lineage":["https://openalex.org/I66867065"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Jingchao Wang","raw_affiliation_strings":["East China Normal University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"East China Normal University","institution_ids":["https://openalex.org/I66867065"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5101940253","display_name":"Dingjiang Huang","orcid":"https://orcid.org/0000-0002-0144-7344"},"institutions":[{"id":"https://openalex.org/I66867065","display_name":"East China Normal University","ror":"https://ror.org/02n96ep67","country_code":"CN","type":"education","lineage":["https://openalex.org/I66867065"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Dingjiang Huang","raw_affiliation_strings":["East China Normal University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"East China Normal University","institution_ids":["https://openalex.org/I66867065"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5017862559","display_name":"Shuigeng Zhou","orcid":"https://orcid.org/0000-0002-1949-2768"},"institutions":[{"id":"https://openalex.org/I24943067","display_name":"Fudan University","ror":"https://ror.org/013q1eq08","country_code":"CN","type":"education","lineage":["https://openalex.org/I24943067"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Shuigeng Zhou","raw_affiliation_strings":["Fudan University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Fudan University","institution_ids":["https://openalex.org/I24943067"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.21078183,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"5770","last_page":"5778"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.29179999232292175,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.29179999232292175,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.7351999878883362},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7050999999046326},{"id":"https://openalex.org/keywords/convergence","display_name":"Convergence (economics)","score":0.4984000027179718},{"id":"https://openalex.org/keywords/range","display_name":"Range (aeronautics)","score":0.4731000065803528},{"id":"https://openalex.org/keywords/constraint","display_name":"Constraint (computer-aided design)","score":0.4429999887943268},{"id":"https://openalex.org/keywords/limiting","display_name":"Limiting","score":0.4343999922275543},{"id":"https://openalex.org/keywords/value","display_name":"Value (mathematics)","score":0.4336000084877014},{"id":"https://openalex.org/keywords/markov-process","display_name":"Markov process","score":0.39399999380111694}],"concepts":[{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.7351999878883362},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7050999999046326},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6650000214576721},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.4984000027179718},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4869000017642975},{"id":"https://openalex.org/C204323151","wikidata":"https://www.wikidata.org/wiki/Q905424","display_name":"Range (aeronautics)","level":2,"score":0.4731000065803528},{"id":"https://openalex.org/C2776036281","wikidata":"https://www.wikidata.org/wiki/Q48769818","display_name":"Constraint (computer-aided design)","level":2,"score":0.4429999887943268},{"id":"https://openalex.org/C188198153","wikidata":"https://www.wikidata.org/wiki/Q1613840","display_name":"Limiting","level":2,"score":0.4343999922275543},{"id":"https://openalex.org/C2776291640","wikidata":"https://www.wikidata.org/wiki/Q2912517","display_name":"Value (mathematics)","level":2,"score":0.4336000084877014},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.39399999380111694},{"id":"https://openalex.org/C2776135515","wikidata":"https://www.wikidata.org/wiki/Q17143721","display_name":"Regularization (linguistics)","level":2,"score":0.38499999046325684},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3831000030040741},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.36039999127388},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.3422999978065491},{"id":"https://openalex.org/C168031717","wikidata":"https://www.wikidata.org/wiki/Q1530280","display_name":"Balance (ability)","level":2,"score":0.3239000141620636},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.3181999921798706},{"id":"https://openalex.org/C28901747","wikidata":"https://www.wikidata.org/wiki/Q177571","display_name":"Decision theory","level":2,"score":0.31290000677108765},{"id":"https://openalex.org/C75553542","wikidata":"https://www.wikidata.org/wiki/Q178161","display_name":"A priori and a posteriori","level":2,"score":0.29429998993873596},{"id":"https://openalex.org/C17098449","wikidata":"https://www.wikidata.org/wiki/Q176814","display_name":"Partially observable Markov decision process","level":4,"score":0.2874999940395355},{"id":"https://openalex.org/C167085575","wikidata":"https://www.wikidata.org/wiki/Q6803654","display_name":"Mean squared prediction error","level":2,"score":0.28049999475479126},{"id":"https://openalex.org/C46686674","wikidata":"https://www.wikidata.org/wiki/Q466303","display_name":"Boosting (machine learning)","level":2,"score":0.27090001106262207},{"id":"https://openalex.org/C163836022","wikidata":"https://www.wikidata.org/wiki/Q6771326","display_name":"Markov model","level":3,"score":0.25360000133514404}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.24963/ijcai.2025/642","is_oa":true,"landing_page_url":"https://doi.org/10.24963/ijcai.2025/642","pdf_url":"https://www.ijcai.org/proceedings/2025/0642.pdf","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.24963/ijcai.2025/642","is_oa":true,"landing_page_url":"https://doi.org/10.24963/ijcai.2025/642","pdf_url":"https://www.ijcai.org/proceedings/2025/0642.pdf","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[{"id":"https://openalex.org/G2428490243","display_name":null,"funder_award_id":"U1711262","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"},{"id":"https://openalex.org/G832669383","display_name":"\u57fa\u4e8e\u7ec4\u5408\u7ed3\u6784\u548c\u5148\u9a8c\u77e5\u8bc6\u7684\u6d41\u6570\u636e\u5728\u7ebf\u673a\u5668\u5b66\u4e60\u7406\u8bba\u4e0e\u65b9\u6cd5\u7814\u7a76","funder_award_id":"62072185","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"}],"funders":[{"id":"https://openalex.org/F4320306076","display_name":"National Science Foundation","ror":"https://ror.org/021nxhr62"},{"id":"https://openalex.org/F4320321001","display_name":"National Natural Science Foundation of China","ror":"https://ror.org/01h0zpd94"}],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W4414359477.pdf","grobid_xml":"https://content.openalex.org/works/W4414359477.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Offline":[0],"reinforcement":[1],"learning":[2],"seeks":[3],"to":[4,65,82,105],"derive":[5],"improved":[6],"policies":[7],"entirely":[8],"from":[9],"historical":[10],"data":[11],"but":[12],"often":[13],"struggles":[14],"with":[15,92],"over-optimistic":[16],"value":[17,33,45,158],"estimates":[18,159],"for":[19],"out-of-distribution":[20],"(OOD)":[21],"actions.":[22],"This":[23],"issue":[24],"is":[25,160],"typically":[26],"mitigated":[27],"via":[28],"policy":[29],"constraint":[30],"or":[31,43],"conservative":[32],"regularization":[34],"methods.":[35],"However,":[36],"these":[37],"approaches":[38],"may":[39],"impose":[40],"overly":[41],"constraints":[42],"biased":[44],"estimates,":[46],"potentially":[47],"limiting":[48],"performance":[49,168],"improvements.":[50],"To":[51],"balance":[52],"exploitation":[53],"and":[54,86,137],"restriction,":[55],"we":[56,77,114,128],"propose":[57],"an":[58],"Imagination-Limited":[59],"Q-learning":[60],"(ILQ)":[61],"method,":[62],"which":[63],"aims":[64],"maintain":[66],"the":[67,79,89,93,106,116,119,131,144,155,176],"optimism":[68],"that":[69,130,148,154],"OOD":[70,84,103,141],"actions":[71,104],"deserve":[72],"within":[73],"appropriate":[74],"limits.":[75],"Specifically,":[76],"utilize":[78],"dynamics":[80],"model":[81],"imagine":[83],"action-values,":[85],"then":[87],"clip":[88],"imagined":[90],"values":[91,136,139],"maximum":[94],"behavior":[95],"values.":[96],"Such":[97],"design":[98],"maintains":[99],"reasonable":[100],"evaluation":[101],"of":[102,118,140,149,173],"furthest":[107],"extent,":[108],"while":[109],"avoiding":[110],"its":[111],"over-optimism.":[112],"Theoretically,":[113],"prove":[115],"convergence":[117],"proposed":[120],"ILQ":[121],"under":[122],"tabular":[123],"Markov":[124],"decision":[125],"processes.":[126],"Particularly,":[127],"demonstrate":[129],"error":[132],"bound":[133],"between":[134],"estimated":[135],"optimality":[138],"state-actions":[142],"possesses":[143],"same":[145],"magnitude":[146],"as":[147],"in-distribution":[150],"ones,":[151],"thereby":[152],"indicating":[153],"bias":[156],"in":[157,175],"effectively":[161],"mitigated.":[162],"Empirically,":[163],"our":[164],"method":[165],"achieves":[166],"state-of-the-art":[167],"on":[169],"a":[170],"wide":[171],"range":[172],"tasks":[174],"D4RL":[177],"benchmark.":[178]},"counts_by_year":[],"updated_date":"2026-08-01T09:00:35.917206","created_date":"2025-10-10T00:00:00"}
