{"id":"https://openalex.org/W7134807297","doi":"https://doi.org/10.48550/arxiv.2603.06977","title":"NePPO: Near-Potential Policy Optimization for General-Sum Multi-Agent Reinforcement Learning","display_name":"NePPO: Near-Potential Policy Optimization for General-Sum Multi-Agent Reinforcement Learning","publication_year":2026,"publication_date":"2026-03-07","ids":{"openalex":"https://openalex.org/W7134807297","doi":"https://doi.org/10.48550/arxiv.2603.06977"},"language":null,"primary_location":{"id":"pmh:doi:10.48550/arxiv.2603.06977","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"publisher-specific-oa","license_id":"https://openalex.org/licenses/publisher-specific-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"type":"article","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":null,"any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5120713396","display_name":"Addison Kalanther","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kalanther, Addison","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128632244","display_name":"Sanika Bharvirkar","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bharvirkar, Sanika","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5021247983","display_name":"Shankar P. Sastry","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sastry, Shankar","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5031376831","display_name":"Chinmay Maheshwari","orcid":"https://orcid.org/0000-0003-3596-2851"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Maheshwari, Chinmay","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.28701165,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6811000108718872,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6811000108718872,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.09629999846220016,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.06610000133514404,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/nash-equilibrium","display_name":"Nash equilibrium","score":0.8575000166893005},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7906000018119812},{"id":"https://openalex.org/keywords/best-response","display_name":"Best response","score":0.6571999788284302},{"id":"https://openalex.org/keywords/convergence","display_name":"Convergence (economics)","score":0.5475000143051147},{"id":"https://openalex.org/keywords/epsilon-equilibrium","display_name":"Epsilon-equilibrium","score":0.5166000127792358},{"id":"https://openalex.org/keywords/potential-game","display_name":"Potential game","score":0.508899986743927},{"id":"https://openalex.org/keywords/pipeline","display_name":"Pipeline (software)","score":0.4887000024318695},{"id":"https://openalex.org/keywords/correlated-equilibrium","display_name":"Correlated equilibrium","score":0.44339999556541443},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.43209999799728394}],"concepts":[{"id":"https://openalex.org/C46814582","wikidata":"https://www.wikidata.org/wiki/Q23389","display_name":"Nash equilibrium","level":2,"score":0.8575000166893005},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7906000018119812},{"id":"https://openalex.org/C32407928","wikidata":"https://www.wikidata.org/wiki/Q2733833","display_name":"Best response","level":3,"score":0.6571999788284302},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.645799994468689},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.6000999808311462},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.5475000143051147},{"id":"https://openalex.org/C141824439","wikidata":"https://www.wikidata.org/wiki/Q307521","display_name":"Epsilon-equilibrium","level":4,"score":0.5166000127792358},{"id":"https://openalex.org/C2778079155","wikidata":"https://www.wikidata.org/wiki/Q288500","display_name":"Potential game","level":3,"score":0.508899986743927},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.4887000024318695},{"id":"https://openalex.org/C163630976","wikidata":"https://www.wikidata.org/wiki/Q964667","display_name":"Correlated equilibrium","level":5,"score":0.44339999556541443},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.43209999799728394},{"id":"https://openalex.org/C164407509","wikidata":"https://www.wikidata.org/wiki/Q5384490","display_name":"Equilibrium selection","level":4,"score":0.42669999599456787},{"id":"https://openalex.org/C177142836","wikidata":"https://www.wikidata.org/wiki/Q44455","display_name":"Game theory","level":2,"score":0.39800000190734863},{"id":"https://openalex.org/C22349654","wikidata":"https://www.wikidata.org/wiki/Q2039354","display_name":"Risk dominance","level":5,"score":0.3788999915122986},{"id":"https://openalex.org/C153258448","wikidata":"https://www.wikidata.org/wiki/Q1199743","display_name":"Gradient descent","level":3,"score":0.35929998755455017},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.3330000042915344},{"id":"https://openalex.org/C2164484","wikidata":"https://www.wikidata.org/wiki/Q5170150","display_name":"Core (optical fiber)","level":2,"score":0.32089999318122864},{"id":"https://openalex.org/C145071142","wikidata":"https://www.wikidata.org/wiki/Q1411116","display_name":"Fictitious play","level":3,"score":0.31450000405311584},{"id":"https://openalex.org/C28719098","wikidata":"https://www.wikidata.org/wiki/Q44946","display_name":"Point (geometry)","level":2,"score":0.29760000109672546},{"id":"https://openalex.org/C3309286","wikidata":"https://www.wikidata.org/wiki/Q4907693","display_name":"Bilevel optimization","level":3,"score":0.2806999981403351},{"id":"https://openalex.org/C144237770","wikidata":"https://www.wikidata.org/wiki/Q747534","display_name":"Mathematical economics","level":1,"score":0.28040000796318054},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.27230000495910645},{"id":"https://openalex.org/C11343654","wikidata":"https://www.wikidata.org/wiki/Q780008","display_name":"Solution concept","level":3,"score":0.2703999876976013},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.2694999873638153},{"id":"https://openalex.org/C73795354","wikidata":"https://www.wikidata.org/wiki/Q287618","display_name":"Sequential game","level":3,"score":0.26579999923706055},{"id":"https://openalex.org/C37404715","wikidata":"https://www.wikidata.org/wiki/Q380679","display_name":"Dynamic programming","level":2,"score":0.26190000772476196},{"id":"https://openalex.org/C14646407","wikidata":"https://www.wikidata.org/wiki/Q1430750","display_name":"Bellman equation","level":2,"score":0.25540000200271606},{"id":"https://openalex.org/C94766913","wikidata":"https://www.wikidata.org/wiki/Q1530271","display_name":"Equilibrium point","level":3,"score":0.25290000438690186}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:doi:10.48550/arxiv.2603.06977","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"publisher-specific-oa","license_id":"https://openalex.org/licenses/publisher-specific-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},{"id":"doi:10.48550/arxiv.2603.06977","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.06977","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:doi:10.48550/arxiv.2603.06977","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"publisher-specific-oa","license_id":"https://openalex.org/licenses/publisher-specific-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Multi-agent":[0],"reinforcement":[1],"learning":[2,25],"(MARL)":[3],"is":[4,57,91],"increasingly":[5],"used":[6],"to":[7,92,183],"design":[8],"learning-enabled":[9],"agents":[10,49],"that":[11,99,132,158],"interact":[12],"in":[13,20,36,84],"shared":[14],"environments.":[15,87],"However,":[16],"training":[17],"MARL":[18,72,129],"algorithms":[19],"general-sum":[21],"games":[22],"remains":[23],"challenging:":[24],"dynamics":[26],"can":[27],"become":[28],"unstable,":[29],"and":[30,52,143,166,189],"convergence":[31],"guarantees":[32],"typically":[33],"hold":[34],"only":[35],"restricted":[37],"settings":[38],"such":[39,98,131,186],"as":[40,110,187],"two-player":[41],"zero-sum":[42],"or":[43],"fully":[44],"cooperative":[45,105],"games.":[46],"Moreover,":[47],"when":[48],"have":[50],"heterogeneous":[51],"potentially":[53],"conflicting":[54],"preferences,":[55],"it":[56],"unclear":[58],"what":[59],"system-level":[60],"objective":[61,130,135,161],"should":[62],"guide":[63],"learning.":[64],"In":[65],"this":[66,108,123,134,160,180],"paper,":[67],"we":[68,125],"propose":[69],"a":[70,94,104,115,127],"new":[71],"pipeline":[73,157],"called":[74],"Near-Potential":[75],"Policy":[76],"Optimization":[77],"(NePPO)":[78],"for":[79],"computing":[80],"approximate":[81,146,169],"Nash":[82,101,116,147,170],"equilibria":[83],"mixed":[85],"cooperative--competitive":[86],"The":[88],"core":[89],"idea":[90],"learn":[93],"player-independent":[95],"potential":[96,109,140],"function":[97,141],"the":[100,111,119,137,150,176],"equilibrium":[102,117,148,171],"of":[103,118,149,179],"game":[106],"with":[107],"common":[112],"utility":[113],"approximates":[114],"original":[120,151],"game.":[121,152],"To":[122],"end,":[124],"introduce":[126],"novel":[128],"minimizing":[133],"yields":[136],"best":[138],"possible":[139],"candidate":[142],"consequently":[144],"an":[145,155,168],"We":[153,173],"develop":[154],"algorithmic":[156],"minimizes":[159],"using":[162],"zeroth-order":[163],"gradient":[164],"descent":[165],"returns":[167],"policy.":[172],"empirically":[174],"show":[175],"superior":[177],"performance":[178],"approach":[181],"compared":[182],"popular":[184],"baselines":[185],"IPPO":[188],"MAPPO.":[190]},"counts_by_year":[],"updated_date":"2026-07-15T18:14:33.161393","created_date":"2026-03-11T00:00:00"}
