{"id":"https://openalex.org/W4385484707","doi":"https://doi.org/10.1109/ijcnn54540.2023.10191313","title":"Evolution Strategies Enhanced Complex Multiagent Coordination","display_name":"Evolution Strategies Enhanced Complex Multiagent Coordination","publication_year":2023,"publication_date":"2023-06-18","ids":{"openalex":"https://openalex.org/W4385484707","doi":"https://doi.org/10.1109/ijcnn54540.2023.10191313"},"language":"en","primary_location":{"id":"doi:10.1109/ijcnn54540.2023.10191313","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ijcnn54540.2023.10191313","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2023 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5101868264","display_name":"Yunfei Du","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yunfei Du","raw_affiliation_strings":["Hikvision Research Institude,Hangzhou,China,310051"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Hikvision Research Institude,Hangzhou,China,310051","institution_ids":[]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5100715443","display_name":"Wang Yin","orcid":"https://orcid.org/0009-0000-7099-8759"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yin Wang","raw_affiliation_strings":["Hikvision Research Institude,Hangzhou,China,310051"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Hikvision Research Institude,Hangzhou,China,310051","institution_ids":[]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5073881156","display_name":"Ya Cong","orcid":"https://orcid.org/0000-0003-2432-5996"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ya Cong","raw_affiliation_strings":["Hikvision Research Institude,Hangzhou,China,310051"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Hikvision Research Institude,Hangzhou,China,310051","institution_ids":[]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5082728339","display_name":"Weihao Jiang","orcid":"https://orcid.org/0000-0003-3482-8538"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Weihao Jiang","raw_affiliation_strings":["Hikvision Research Institude,Hangzhou,China,310051"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Hikvision Research Institude,Hangzhou,China,310051","institution_ids":[]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5085955762","display_name":"Shiliang Pu","orcid":"https://orcid.org/0000-0001-5269-7821"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shiliang Pu","raw_affiliation_strings":["Hikvision Research Institude,Hangzhou,China,310051"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Hikvision Research Institude,Hangzhou,China,310051","institution_ids":[]}]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":2,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"9"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9991999864578247,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9991999864578247,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.9348999857902527,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8144791722297668},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7526252865791321},{"id":"https://openalex.org/keywords/contradiction","display_name":"Contradiction","score":0.5631734132766724},{"id":"https://openalex.org/keywords/entropy","display_name":"Entropy (arrow of time)","score":0.487533301115036},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.4840394854545593}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8144791722297668},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7526252865791321},{"id":"https://openalex.org/C2776728590","wikidata":"https://www.wikidata.org/wiki/Q363948","display_name":"Contradiction","level":2,"score":0.5631734132766724},{"id":"https://openalex.org/C106301342","wikidata":"https://www.wikidata.org/wiki/Q4117933","display_name":"Entropy (arrow of time)","level":2,"score":0.487533301115036},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4840394854545593},{"id":"https://openalex.org/C111472728","wikidata":"https://www.wikidata.org/wiki/Q9471","display_name":"Epistemology","level":1,"score":0.0},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.0},{"id":"https://openalex.org/C62520636","wikidata":"https://www.wikidata.org/wiki/Q944","display_name":"Quantum mechanics","level":1,"score":0.0},{"id":"https://openalex.org/C138885662","wikidata":"https://www.wikidata.org/wiki/Q5891","display_name":"Philosophy","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/ijcnn54540.2023.10191313","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ijcnn54540.2023.10191313","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2023 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":59,"referenced_works":["https://openalex.org/W1995620855","https://openalex.org/W2509924317","https://openalex.org/W2596367596","https://openalex.org/W2778749116","https://openalex.org/W2894662639","https://openalex.org/W2914351253","https://openalex.org/W2947526499","https://openalex.org/W2949963774","https://openalex.org/W2951278471","https://openalex.org/W2951799422","https://openalex.org/W2952465248","https://openalex.org/W2973525135","https://openalex.org/W2978148161","https://openalex.org/W3021603984","https://openalex.org/W3029901419","https://openalex.org/W3046288222","https://openalex.org/W3093488414","https://openalex.org/W3099303207","https://openalex.org/W3107951310","https://openalex.org/W3117812535","https://openalex.org/W3166318878","https://openalex.org/W3166907241","https://openalex.org/W3179983589","https://openalex.org/W3207729391","https://openalex.org/W3211360571","https://openalex.org/W4213190850","https://openalex.org/W4236817408","https://openalex.org/W4283213319","https://openalex.org/W4286378301","https://openalex.org/W4288091739","https://openalex.org/W4288359891","https://openalex.org/W4295598622","https://openalex.org/W4297810554","https://openalex.org/W4299802797","https://openalex.org/W4308081891","https://openalex.org/W6735641298","https://openalex.org/W6738796088","https://openalex.org/W6745190604","https://openalex.org/W6746622358","https://openalex.org/W6749304979","https://openalex.org/W6755459763","https://openalex.org/W6755903938","https://openalex.org/W6758763022","https://openalex.org/W6761920647","https://openalex.org/W6762491519","https://openalex.org/W6762973735","https://openalex.org/W6767327128","https://openalex.org/W6767919266","https://openalex.org/W6768731700","https://openalex.org/W6776835688","https://openalex.org/W6781750019","https://openalex.org/W6784097869","https://openalex.org/W6785535465","https://openalex.org/W6795139234","https://openalex.org/W6795975040","https://openalex.org/W6796107676","https://openalex.org/W6803709789","https://openalex.org/W6810550521","https://openalex.org/W6846751954"],"related_works":["https://openalex.org/W4391375266","https://openalex.org/W2748952813","https://openalex.org/W2381825231","https://openalex.org/W2377933838","https://openalex.org/W2348916262","https://openalex.org/W4210310594","https://openalex.org/W2330422317","https://openalex.org/W2354224618","https://openalex.org/W2354172502","https://openalex.org/W2391836570"],"abstract_inverted_index":{"Multi-agent":[0],"coordination":[1],"involves":[2],"both":[3,214],"the":[4,11,14,21,56,64,78,84,92,98,105,114,143,153,167,192,199,208],"individual":[5,168,193,202],"reward":[6,100,169,210],"and":[7,20,61,94,131,140,150,170,173,180,194,197,203,218,222],"team":[8,28,171,195,204],"reward,":[9,172,196],"where":[10],"former":[12,85],"guides":[13],"agent":[15,48],"to":[16,45,63,91],"learn":[17],"basic":[18],"skills":[19],"latter":[22],"measures":[23],"how":[24],"well":[25,206],"such":[26,70],"a":[27,124,231],"cooperatively":[29],"completes":[30],"final":[31],"tasks.":[32,235],"However,":[33],"in":[34,104,216,220],"many":[35],"complex":[36,234],"scenarios,":[37],"these":[38,119],"two":[39],"aspects":[40],"can":[41,189],"be":[42],"contradictory,":[43],"due":[44],"that":[46,163],"one":[47],"excessively":[49],"pursuing":[50],"its":[51],"own":[52],"profits":[53],"may":[54],"suppress":[55],"performance":[57],"of":[58,66,155,186,233],"other":[59],"teammates":[60],"lead":[62],"reduction":[65],"overall":[67],"profits.":[68],"Besides,":[69],"dual":[71],"rewards":[72],"are":[73],"generally":[74],"entangled":[75],"which":[76,88],"make":[77],"learning":[79,135,179],"swing":[80],"between":[81,201],"optimizing":[82],"either":[83],"or":[86],"latter,":[87],"further":[89,109],"leads":[90],"sub-optimal":[93],"unstable":[95],"solutions.":[96],"Moreover,":[97],"sparse":[99,209],"problem":[101],"commonly":[102],"encountered":[103],"multi-agent":[106,133],"system":[107],"would":[108],"exacerbate":[110],"this":[111],"contradiction.":[112],"In":[113],"present":[115],"work,":[116],"we":[117],"address":[118],"challenges":[120],"by":[121],"proposing":[122],"CEMARL,":[123],"novel":[125],"framework":[126,217],"combining":[127],"cross-entropy":[128],"method":[129],"(CEM)":[130],"off-policy":[132],"reinforcement":[134],"(MARL).":[136],"CEM":[137],"is":[138,148,162],"gradient-free":[139,181],"learns":[141,151],"from":[142,152],"whole":[144],"episode,":[145],"whereas":[146],"MARL":[147],"gradient-based":[149,178],"experiences":[154],"agents.":[156],"The":[157],"core":[158],"idea":[159],"behind":[160],"CEMARL":[161,212],"it":[164,188],"explicitly":[165],"decomposes":[166],"deals":[174],"with":[175],"them":[176],"through":[177],"evolution,":[182],"respectively.":[183],"By":[184],"means":[185],"this,":[187],"simultaneously":[190],"maximize":[191],"reconciles":[198],"contradiction":[200],"as":[205,207],"problem.":[211],"shows":[213],"conciseness":[215],"stability":[219],"training,":[221],"achieves":[223],"significantly":[224],"better":[225],"performances":[226],"than":[227],"state-of-the-art":[228],"baselines":[229],"on":[230],"range":[232]},"counts_by_year":[{"year":2025,"cited_by_count":1},{"year":2024,"cited_by_count":1}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
