{"id":"https://openalex.org/W7130720140","doi":"https://doi.org/10.48550/arxiv.2602.17062","title":"Retaining Suboptimal Actions to Follow Shifting Optima in Multi-Agent Reinforcement Learning","display_name":"Retaining Suboptimal Actions to Follow Shifting Optima in Multi-Agent Reinforcement Learning","publication_year":2026,"publication_date":"2026-02-19","ids":{"openalex":"https://openalex.org/W7130720140","doi":"https://doi.org/10.48550/arxiv.2602.17062"},"language":null,"primary_location":{"id":"pmh:doi:10.48550/arxiv.2602.17062","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"type":"article","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":null,"any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5126519400","display_name":"Yonghyeon Jo","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jo, Yonghyeon","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5126520779","display_name":"Sunwoo Lee","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lee, Sunwoo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5091657241","display_name":"Seungyul Han","orcid":"https://orcid.org/0000-0002-5376-1976"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Han, Seungyul","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.21694976,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9520999789237976,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9520999789237976,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.0032999999821186066,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.002899999963119626,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8145999908447266},{"id":"https://openalex.org/keywords/adaptability","display_name":"Adaptability","score":0.7263000011444092},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.5644999742507935},{"id":"https://openalex.org/keywords/code","display_name":"Code (set theory)","score":0.5098999738693237},{"id":"https://openalex.org/keywords/core","display_name":"Core (optical fiber)","score":0.49869999289512634},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.47769999504089355},{"id":"https://openalex.org/keywords/decomposition","display_name":"Decomposition","score":0.4602999985218048},{"id":"https://openalex.org/keywords/value","display_name":"Value (mathematics)","score":0.4569999873638153}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8145999908447266},{"id":"https://openalex.org/C177606310","wikidata":"https://www.wikidata.org/wiki/Q5674297","display_name":"Adaptability","level":2,"score":0.7263000011444092},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6485999822616577},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.5644999742507935},{"id":"https://openalex.org/C2776760102","wikidata":"https://www.wikidata.org/wiki/Q5139990","display_name":"Code (set theory)","level":3,"score":0.5098999738693237},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.499099999666214},{"id":"https://openalex.org/C2164484","wikidata":"https://www.wikidata.org/wiki/Q5170150","display_name":"Core (optical fiber)","level":2,"score":0.49869999289512634},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.47769999504089355},{"id":"https://openalex.org/C124681953","wikidata":"https://www.wikidata.org/wiki/Q339062","display_name":"Decomposition","level":2,"score":0.4602999985218048},{"id":"https://openalex.org/C2776291640","wikidata":"https://www.wikidata.org/wiki/Q2912517","display_name":"Value (mathematics)","level":2,"score":0.4569999873638153},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.42419999837875366},{"id":"https://openalex.org/C14646407","wikidata":"https://www.wikidata.org/wiki/Q1430750","display_name":"Bellman equation","level":2,"score":0.41269999742507935},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.3968000113964081},{"id":"https://openalex.org/C166109690","wikidata":"https://www.wikidata.org/wiki/Q4677422","display_name":"Action selection","level":3,"score":0.35749998688697815},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.3377000093460083},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.26739999651908875},{"id":"https://openalex.org/C204323151","wikidata":"https://www.wikidata.org/wiki/Q905424","display_name":"Range (aeronautics)","level":2,"score":0.2581000030040741},{"id":"https://openalex.org/C2780598303","wikidata":"https://www.wikidata.org/wiki/Q65921492","display_name":"Flexibility (engineering)","level":2,"score":0.2531999945640564},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.2526000142097473},{"id":"https://openalex.org/C55842286","wikidata":"https://www.wikidata.org/wiki/Q533036","display_name":"Q-function","level":4,"score":0.25189998745918274},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.25110000371932983}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:doi:10.48550/arxiv.2602.17062","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},{"id":"doi:10.48550/arxiv.2602.17062","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2602.17062","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:doi:10.48550/arxiv.2602.17062","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Value":[0],"decomposition":[1],"is":[2,103],"a":[3,18,64],"core":[4],"approach":[5],"for":[6],"cooperative":[7],"multi-agent":[8],"reinforcement":[9],"learning":[10],"(MARL).":[11],"However,":[12],"existing":[13],"methods":[14],"still":[15],"rely":[16],"on":[17,83],"single":[19],"optimal":[20],"action":[21],"and":[22,72,98],"struggle":[23],"to":[24,36,54,75,78],"adapt":[25],"when":[26],"the":[27,79],"underlying":[28],"value":[29],"function":[30],"shifts":[31],"during":[32],"training,":[33],"often":[34],"converging":[35],"suboptimal":[37],"policies.":[38],"To":[39],"address":[40],"this":[41],"limitation,":[42],"we":[43],"propose":[44],"Successive":[45],"Sub-value":[46],"Q-learning":[47],"(S2Q),":[48],"which":[49],"learns":[50],"multiple":[51],"sub-value":[52,61],"functions":[53,62],"retain":[55],"alternative":[56],"high-value":[57],"actions.":[58],"Incorporating":[59],"these":[60],"into":[63],"Softmax-based":[65],"behavior":[66],"policy,":[67],"S2Q":[68,89],"encourages":[69],"persistent":[70],"exploration":[71],"enables":[73],"$Q^{\\text{tot}}$":[74],"adjust":[76],"quickly":[77],"changing":[80],"optima.":[81],"Experiments":[82],"challenging":[84],"MARL":[85,93],"benchmarks":[86],"confirm":[87],"that":[88],"consistently":[90],"outperforms":[91],"various":[92],"algorithms,":[94],"demonstrating":[95],"improved":[96],"adaptability":[97],"overall":[99],"performance.":[100],"Our":[101],"code":[102],"available":[104],"at":[105],"https://github.com/hyeon1996/S2Q.":[106]},"counts_by_year":[],"updated_date":"2026-07-15T18:14:33.161393","created_date":"2026-02-21T00:00:00"}
