{"id":"https://openalex.org/W7160836204","doi":"https://doi.org/10.48550/arxiv.2605.07101","title":"Decentralized Diffusion Policy Learning for Enhanced Exploration in Cooperative Multi-agent Reinforcement Learning","display_name":"Decentralized Diffusion Policy Learning for Enhanced Exploration in Cooperative Multi-agent Reinforcement Learning","publication_year":2026,"publication_date":"2026-05-08","ids":{"openalex":"https://openalex.org/W7160836204","doi":"https://doi.org/10.48550/arxiv.2605.07101"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.07101","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.07101","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.07101","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5135876125","display_name":"Yuyang Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Yuyang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135899969","display_name":"Haldun Balim","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Balim, Haldun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5135884124","display_name":"Na Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Na","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9380999803543091,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9380999803543091,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.004000000189989805,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.0038999998942017555,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7660999894142151},{"id":"https://openalex.org/keywords/policy-learning","display_name":"Policy learning","score":0.6517000198364258},{"id":"https://openalex.org/keywords/softmax-function","display_name":"Softmax function","score":0.628600001335144},{"id":"https://openalex.org/keywords/matching","display_name":"Matching (statistics)","score":0.5490999817848206},{"id":"https://openalex.org/keywords/probabilistic-logic","display_name":"Probabilistic logic","score":0.5142999887466431},{"id":"https://openalex.org/keywords/class","display_name":"Class (philosophy)","score":0.47699999809265137},{"id":"https://openalex.org/keywords/gaussian","display_name":"Gaussian","score":0.3995000123977661}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7660999894142151},{"id":"https://openalex.org/C2779436431","wikidata":"https://www.wikidata.org/wiki/Q30672407","display_name":"Policy learning","level":2,"score":0.6517000198364258},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6345000267028809},{"id":"https://openalex.org/C188441871","wikidata":"https://www.wikidata.org/wiki/Q7554146","display_name":"Softmax function","level":3,"score":0.628600001335144},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.5490999817848206},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5437999963760376},{"id":"https://openalex.org/C49937458","wikidata":"https://www.wikidata.org/wiki/Q2599292","display_name":"Probabilistic logic","level":2,"score":0.5142999887466431},{"id":"https://openalex.org/C2777212361","wikidata":"https://www.wikidata.org/wiki/Q5127848","display_name":"Class (philosophy)","level":2,"score":0.47699999809265137},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.46000000834465027},{"id":"https://openalex.org/C163716315","wikidata":"https://www.wikidata.org/wiki/Q901177","display_name":"Gaussian","level":2,"score":0.3995000123977661},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.34940001368522644},{"id":"https://openalex.org/C69357855","wikidata":"https://www.wikidata.org/wiki/Q163214","display_name":"Diffusion","level":2,"score":0.3402999937534332},{"id":"https://openalex.org/C52740198","wikidata":"https://www.wikidata.org/wiki/Q1539564","display_name":"Importance sampling","level":3,"score":0.32120001316070557},{"id":"https://openalex.org/C61326573","wikidata":"https://www.wikidata.org/wiki/Q1496376","display_name":"Gaussian process","level":3,"score":0.3188000023365021},{"id":"https://openalex.org/C39890363","wikidata":"https://www.wikidata.org/wiki/Q36108","display_name":"Generative grammar","level":2,"score":0.29179999232292175},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.27869999408721924},{"id":"https://openalex.org/C140779682","wikidata":"https://www.wikidata.org/wiki/Q210868","display_name":"Sampling (signal processing)","level":3,"score":0.2662000060081482},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2526000142097473},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.2524999976158142}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.07101","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.07101","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.07101","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.07101","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Cooperative":[0],"multi-agent":[1,141,144,150],"reinforcement":[2],"learning":[3,86],"(MARL)":[4],"involves":[5],"complex":[6],"agent":[7],"interactions":[8],"and":[9,41,67,147,152],"requires":[10],"effective":[11],"exploration":[12,64],"strategies.":[13],"A":[14],"prominent":[15],"class":[16],"of":[17,59,74,116],"MARL":[18,138],"algorithms,":[19],"decentralized":[20,83],"softmax":[21],"policy":[22,29,48,85,92],"gradient":[23],"(DecSPG),":[24],"addresses":[25],"this":[26,51,68,79],"through":[27],"energy-based":[28,35],"updates.":[30],"In":[31,50],"practice,":[32],"however,":[33],"such":[34],"policies":[36,61,118],"are":[37,42],"intractable":[38],"to":[39],"maintain":[40],"commonly":[43],"projected":[44],"onto":[45],"the":[46,56,72],"Gaussian":[47,60],"class.":[49],"work,":[52],"we":[53,81],"show":[54],"that":[55,103],"limited":[57],"expressiveness":[58],"severely":[62],"hinders":[63],"in":[65],"DecSPG,":[66],"limitation":[69],"worsens":[70],"as":[71],"number":[73],"agents":[75],"grows.":[76],"To":[77],"address":[78],"issue,":[80],"propose":[82],"diffusion":[84,96,117],"(DDPL),":[87],"which":[88],"parameterizes":[89],"each":[90],"agent's":[91],"with":[93,129],"a":[94,125],"denoising":[95],"probabilistic":[97],"model,":[98],"an":[99],"expressive":[100],"generative":[101],"model":[102],"captures":[104],"multi-modal":[105],"action":[106],"distributions":[107],"for":[108],"enhanced":[109],"exploration.":[110],"DDPL":[111,134],"enables":[112],"efficient":[113],"online":[114],"training":[115,127],"via":[119],"importance":[120],"sampling":[121],"score":[122],"matching":[123],"(ISSM),":[124],"novel":[126],"method":[128],"theoretical":[130],"guarantee.":[131],"We":[132],"evaluate":[133],"on":[135],"representative":[136],"continuous-action":[137],"benchmarks,":[139],"including":[140],"particle":[142],"environment,":[143],"MuJoCo,":[145],"IsaacLab,":[146],"JAX-reimplemented":[148],"StarCraft":[149],"challenge,":[151],"observe":[153],"consistently":[154],"improved":[155],"performance.":[156]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-05-12T00:00:00"}
