{"id":"https://openalex.org/W7166646355","doi":"https://doi.org/10.48550/arxiv.2606.30072","title":"ACPO: Agent-Chained Policy Optimization for Multi-Agent Reinforcement Learning","display_name":"ACPO: Agent-Chained Policy Optimization for Multi-Agent Reinforcement Learning","publication_year":2026,"publication_date":"2026-06-29","ids":{"openalex":"https://openalex.org/W7166646355","doi":"https://doi.org/10.48550/arxiv.2606.30072"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.30072","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.30072","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.30072","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5093219846","display_name":"Daiki E. Matsunaga","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Matsunaga, Daiki E.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5003990368","display_name":"Junho Na","orcid":"https://orcid.org/0009-0004-1054-1975"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Na, Junho","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5019244137","display_name":"Tri Wahyu Guntara","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Guntara, Tri Wahyu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139652593","display_name":"Scott Sanner","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sanner, Scott","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139700297","display_name":"Pascal Poupart","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Poupart, Pascal","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139699184","display_name":"Jongmin Lee","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lee, Jongmin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139665465","display_name":"Kee-Eung Kim","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kim, Kee-Eung","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9232000112533569,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9232000112533569,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.014100000262260437,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.005499999970197678,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/commit","display_name":"Commit","score":0.8185999989509583},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7644000053405762},{"id":"https://openalex.org/keywords/joint","display_name":"Joint (building)","score":0.6261000037193298},{"id":"https://openalex.org/keywords/decomposition","display_name":"Decomposition","score":0.6215999722480774},{"id":"https://openalex.org/keywords/nash-equilibrium","display_name":"Nash equilibrium","score":0.517799973487854},{"id":"https://openalex.org/keywords/mechanism","display_name":"Mechanism (biology)","score":0.3555000126361847}],"concepts":[{"id":"https://openalex.org/C153180980","wikidata":"https://www.wikidata.org/wiki/Q19776675","display_name":"Commit","level":2,"score":0.8185999989509583},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7644000053405762},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6787999868392944},{"id":"https://openalex.org/C18555067","wikidata":"https://www.wikidata.org/wiki/Q8375051","display_name":"Joint (building)","level":2,"score":0.6261000037193298},{"id":"https://openalex.org/C124681953","wikidata":"https://www.wikidata.org/wiki/Q339062","display_name":"Decomposition","level":2,"score":0.6215999722480774},{"id":"https://openalex.org/C46814582","wikidata":"https://www.wikidata.org/wiki/Q23389","display_name":"Nash equilibrium","level":2,"score":0.517799973487854},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.46050000190734863},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.39169999957084656},{"id":"https://openalex.org/C89611455","wikidata":"https://www.wikidata.org/wiki/Q6804646","display_name":"Mechanism (biology)","level":2,"score":0.3555000126361847},{"id":"https://openalex.org/C2776291640","wikidata":"https://www.wikidata.org/wiki/Q2912517","display_name":"Value (mathematics)","level":2,"score":0.31779998540878296},{"id":"https://openalex.org/C177142836","wikidata":"https://www.wikidata.org/wiki/Q44455","display_name":"Game theory","level":2,"score":0.30149999260902405},{"id":"https://openalex.org/C2779436431","wikidata":"https://www.wikidata.org/wiki/Q30672407","display_name":"Policy learning","level":2,"score":0.2872999906539917},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.27709999680519104},{"id":"https://openalex.org/C2779304628","wikidata":"https://www.wikidata.org/wiki/Q3503480","display_name":"Face (sociological concept)","level":2,"score":0.26440000534057617},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2637999951839447}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.30072","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.30072","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.30072","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.30072","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/16","score":0.6462631225585938,"display_name":"Peace, Justice and strong institutions"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Cooperative":[0],"tasks":[1],"in":[2,131],"Multi-Agent":[3],"Reinforcement":[4],"Learning":[5],"(MARL)":[6],"require":[7],"agents":[8,133,186],"to":[9,29,60,119],"collectively":[10],"maximize":[11],"a":[12,110,123,138,143,155],"shared":[13],"return.":[14],"Under":[15],"the":[16,69,114,127,150,179,183],"Centralized":[17],"Training":[18],"with":[19,41,105,178],"Decentralized":[20],"Execution":[21],"(CTDE)":[22],"paradigm,":[23],"policy":[24,71,116],"gradients":[25],"have":[26],"remained":[27],"difficult":[28],"compute":[30],"directly.":[31],"Prior":[32],"methods":[33],"largely":[34],"follow":[35],"two":[36],"approaches:":[37],"independent":[38,151],"factorized":[39],"updates":[40,107,153],"centralized":[42],"critics,":[43],"which":[44,57,132],"lack":[45],"general":[46],"joint-improvement":[47],"guarantees":[48],"without":[49],"value":[50],"decomposition":[51,77],"assumptions,":[52],"or":[53],"alternating":[54],"best-response":[55],"updates,":[56],"can":[58],"converge":[59],"suboptimal":[61],"Nash":[62],"Equilibria.":[63],"In":[64],"this":[65,92,120],"paper,":[66],"we":[67,94],"show":[68],"joint":[70,115,129,157],"gradient":[72],"admits":[73],"an":[74],"exact":[75],"decentralized":[76,88],"of":[78,126,165,185],"per-agent":[79,84,152],"terms,":[80],"each":[81,140],"formed":[82],"from":[83],"score":[85],"functions":[86],"and":[87,162,171],"critics.":[89],"Based":[90],"on":[91,113,142,167],"decomposition,":[93],"develop":[95],"Agent-Chained":[96],"Policy":[97],"Optimization":[98],"(ACPO),":[99],"where":[100,173],"actors":[101],"are":[102],"trained":[103],"independently,":[104],"their":[106],"together":[108],"constituting":[109],"single":[111,156],"step":[112],"gradient.":[117],"Central":[118],"result":[121],"is":[122],"serialized":[124],"view":[125],"simultaneous":[128],"decision":[130],"commit":[134],"actions":[135,147],"one":[136],"at":[137],"time,":[139],"conditioning":[141],"belief":[144],"over":[145],"preceding":[146],"that":[148],"ties":[149],"into":[154],"step.":[158],"We":[159],"evaluate":[160],"on-policy":[161],"off-policy":[163],"instantiations":[164],"ACPO":[166],"Multi-Robot":[168],"Warehouse,":[169],"SMACv2,":[170],"MA-MuJoCo,":[172],"it":[174],"outperforms":[175],"strong":[176],"baselines,":[177],"gap":[180],"widening":[181],"as":[182],"number":[184],"grows.":[187]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-07-01T00:00:00"}
