{"id":"https://openalex.org/W7164373446","doi":"https://doi.org/10.48550/arxiv.2606.11284","title":"Phi-Actor-Critic: Steering General-Sum Games to Pareto-Efficient Correlated Equilibria","display_name":"Phi-Actor-Critic: Steering General-Sum Games to Pareto-Efficient Correlated Equilibria","publication_year":2026,"publication_date":"2026-06-09","ids":{"openalex":"https://openalex.org/W7164373446","doi":"https://doi.org/10.48550/arxiv.2606.11284"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.11284","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.11284","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.11284","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5138401386","display_name":"Wongyu Lee","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lee, Wongyu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138417670","display_name":"Francesco Lelli","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lelli, Francesco","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5026384166","display_name":"Omran Ayoub","orcid":"https://orcid.org/0000-0002-3884-3594"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ayoub, Omran","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5038468421","display_name":"Massimo Tornatore","orcid":"https://orcid.org/0000-0003-0740-1061"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tornatore, Massimo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7141000032424927,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7141000032424927,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11031","display_name":"Game Theory and Applications","score":0.08429999649524689,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.029600000008940697,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/counterfactual-thinking","display_name":"Counterfactual thinking","score":0.8339999914169312},{"id":"https://openalex.org/keywords/regret","display_name":"Regret","score":0.7616000175476074},{"id":"https://openalex.org/keywords/nash-equilibrium","display_name":"Nash equilibrium","score":0.6022999882698059},{"id":"https://openalex.org/keywords/swap","display_name":"Swap (finance)","score":0.5109000205993652},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.4618000090122223},{"id":"https://openalex.org/keywords/incentive","display_name":"Incentive","score":0.4250999987125397},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.38199999928474426},{"id":"https://openalex.org/keywords/coordination-game","display_name":"Coordination game","score":0.3644999861717224},{"id":"https://openalex.org/keywords/monotonic-function","display_name":"Monotonic function","score":0.3433000147342682}],"concepts":[{"id":"https://openalex.org/C108650721","wikidata":"https://www.wikidata.org/wiki/Q1783253","display_name":"Counterfactual thinking","level":2,"score":0.8339999914169312},{"id":"https://openalex.org/C50817715","wikidata":"https://www.wikidata.org/wiki/Q79895177","display_name":"Regret","level":2,"score":0.7616000175476074},{"id":"https://openalex.org/C46814582","wikidata":"https://www.wikidata.org/wiki/Q23389","display_name":"Nash equilibrium","level":2,"score":0.6022999882698059},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5625},{"id":"https://openalex.org/C99821215","wikidata":"https://www.wikidata.org/wiki/Q1136583","display_name":"Swap (finance)","level":2,"score":0.5109000205993652},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.4618000090122223},{"id":"https://openalex.org/C162324750","wikidata":"https://www.wikidata.org/wiki/Q8134","display_name":"Economics","level":0,"score":0.44690001010894775},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.43549999594688416},{"id":"https://openalex.org/C29122968","wikidata":"https://www.wikidata.org/wiki/Q1414816","display_name":"Incentive","level":2,"score":0.4250999987125397},{"id":"https://openalex.org/C175444787","wikidata":"https://www.wikidata.org/wiki/Q39072","display_name":"Microeconomics","level":1,"score":0.4025000035762787},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.38199999928474426},{"id":"https://openalex.org/C144237770","wikidata":"https://www.wikidata.org/wiki/Q747534","display_name":"Mathematical economics","level":1,"score":0.3749000132083893},{"id":"https://openalex.org/C107257861","wikidata":"https://www.wikidata.org/wiki/Q656316","display_name":"Coordination game","level":2,"score":0.3644999861717224},{"id":"https://openalex.org/C72169020","wikidata":"https://www.wikidata.org/wiki/Q194404","display_name":"Monotonic function","level":2,"score":0.3433000147342682},{"id":"https://openalex.org/C164407509","wikidata":"https://www.wikidata.org/wiki/Q5384490","display_name":"Equilibrium selection","level":4,"score":0.32899999618530273},{"id":"https://openalex.org/C32407928","wikidata":"https://www.wikidata.org/wiki/Q2733833","display_name":"Best response","level":3,"score":0.3068000078201294},{"id":"https://openalex.org/C81917197","wikidata":"https://www.wikidata.org/wiki/Q628760","display_name":"Selection (genetic algorithm)","level":2,"score":0.3005000054836273},{"id":"https://openalex.org/C2777632111","wikidata":"https://www.wikidata.org/wiki/Q1937518","display_name":"Reservation","level":2,"score":0.2955000102519989},{"id":"https://openalex.org/C29202148","wikidata":"https://www.wikidata.org/wiki/Q287260","display_name":"Resource allocation","level":2,"score":0.2870999872684479},{"id":"https://openalex.org/C147764199","wikidata":"https://www.wikidata.org/wiki/Q6865248","display_name":"Minification","level":2,"score":0.2849999964237213},{"id":"https://openalex.org/C91810955","wikidata":"https://www.wikidata.org/wiki/Q7731670","display_name":"Incentive compatibility","level":3,"score":0.28349998593330383},{"id":"https://openalex.org/C206729178","wikidata":"https://www.wikidata.org/wiki/Q2271896","display_name":"Scheduling (production processes)","level":2,"score":0.27720001339912415},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.27639999985694885},{"id":"https://openalex.org/C79416737","wikidata":"https://www.wikidata.org/wiki/Q2305519","display_name":"Social learning","level":2,"score":0.2736999988555908},{"id":"https://openalex.org/C153517567","wikidata":"https://www.wikidata.org/wiki/Q26090","display_name":"Mechanism design","level":2,"score":0.2736999988555908},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.27250000834465027},{"id":"https://openalex.org/C2780310539","wikidata":"https://www.wikidata.org/wiki/Q12547192","display_name":"Imperfect","level":2,"score":0.2685999870300293},{"id":"https://openalex.org/C149782125","wikidata":"https://www.wikidata.org/wiki/Q160039","display_name":"Econometrics","level":1,"score":0.2590000033378601},{"id":"https://openalex.org/C11343654","wikidata":"https://www.wikidata.org/wiki/Q780008","display_name":"Solution concept","level":3,"score":0.25540000200271606}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.11284","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.11284","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.11284","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.11284","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Real-world":[0],"multi-agent":[1,46],"systems,":[2],"from":[3],"traffic":[4],"coordination":[5,165],"to":[6,68,89],"resource":[7],"allocation,":[8],"are":[9,58],"often":[10,66],"modeled":[11],"as":[12,55],"general-sum":[13],"games":[14],"where":[15],"individual":[16],"incentives":[17],"conflict":[18],"with":[19,52],"collective":[20,174],"welfare.":[21],"In":[22],"these":[23],"settings,":[24],"the":[25,153],"central":[26],"challenge":[27],"is":[28],"not":[29],"merely":[30],"finding":[31],"an":[32],"equilibrium,":[33],"but":[34,70],"selecting":[35],"socially":[36,71],"desirable":[37],"outcomes":[38],"among":[39],"many":[40],"suboptimal":[41],"Nash":[42],"equilibria.":[43,73],"Standard":[44],"deep":[45,104],"reinforcement":[47],"learning":[48,91],"(MARL)":[49],"methods":[50,65],"struggle":[51],"this":[53,76],"problem,":[54],"value-decomposition":[56],"approaches":[57],"constrained":[59],"by":[60],"monotonicity":[61],"assumptions":[62],"and":[63,152,163,176],"policy-gradient":[64],"converge":[67],"stable":[69,164],"inefficient":[72],"To":[74,97],"address":[75],"limitation,":[77],"we":[78],"propose":[79],"$\u03a6$-Actor-Critic":[80],"($\u03a6$-AC),":[81],"a":[82,108,117,129],"framework":[83],"that":[84,112,134,159],"leverages":[85],"swap":[86],"regret":[87,100,142],"minimization":[88],"steer":[90],"toward":[92],"high-welfare":[93],"correlated":[94],"equilibria":[95],"(CE).":[96],"make":[98],"counterfactual":[99,124],"estimation":[101],"tractable":[102],"in":[103,116],"MARL,":[105],"$\u03a6$-AC":[106,160],"employs":[107],"centralized":[109],"attention":[110],"critic":[111],"predicts":[113],"vector-valued":[114],"regrets":[115],"single":[118],"forward":[119],"pass,":[120],"avoiding":[121],"computationally":[122],"expensive":[123],"simulations.":[125],"We":[126],"further":[127],"introduce":[128],"Lagrangian-based":[130],"equilibrium":[131],"selection":[132],"mechanism":[133],"optimizes":[135],"social":[136],"welfare":[137],"while":[138,171],"enforcing":[139],"stability":[140],"through":[141],"constraints.":[143],"Experiments":[144],"on":[145],"matrix":[146],"games,":[147],"Multi-Agent":[148],"Particle":[149],"Environments":[150],"(MPE),":[151],"Melting":[154],"Pot":[155],"Harvest":[156],"scenario":[157],"demonstrate":[158],"learns":[161],"efficient":[162],"strategies":[166],"across":[167],"diverse":[168],"mixed-motive":[169],"settings":[170],"maintaining":[172],"high":[173],"return":[175],"competitive":[177],"fairness.":[178]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-06-12T00:00:00"}
