{"id":"https://openalex.org/W4414360686","doi":"https://doi.org/10.24963/ijcai.2025/20","title":"Asynchronous Credit Assignment for Multi-Agent Reinforcement Learning","display_name":"Asynchronous Credit Assignment for Multi-Agent Reinforcement Learning","publication_year":2025,"publication_date":"2025-09-01","ids":{"openalex":"https://openalex.org/W4414360686","doi":"https://doi.org/10.24963/ijcai.2025/20"},"language":"en","primary_location":{"id":"doi:10.24963/ijcai.2025/20","is_oa":true,"landing_page_url":"https://doi.org/10.24963/ijcai.2025/20","pdf_url":"https://www.ijcai.org/proceedings/2025/0020.pdf","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://www.ijcai.org/proceedings/2025/0020.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5103181632","display_name":"Yongheng Liang","orcid":"https://orcid.org/0000-0001-7074-218X"},"institutions":[{"id":"https://openalex.org/I157773358","display_name":"Sun Yat-sen University","ror":"https://ror.org/0064kty71","country_code":"CN","type":"education","lineage":["https://openalex.org/I157773358"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Yongheng Liang","raw_affiliation_strings":["Guangdong Key Laboratory of Big Data Analysis and Processing","Sun Yat-sen University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Guangdong Key Laboratory of Big Data Analysis and Processing","institution_ids":[]},{"raw_affiliation_string":"Sun Yat-sen University","institution_ids":["https://openalex.org/I157773358"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5102755158","display_name":"Hejun Wu","orcid":"https://orcid.org/0000-0001-9758-5698"},"institutions":[{"id":"https://openalex.org/I157773358","display_name":"Sun Yat-sen University","ror":"https://ror.org/0064kty71","country_code":"CN","type":"education","lineage":["https://openalex.org/I157773358"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Hejun Wu","raw_affiliation_strings":["Guangdong Key Laboratory of Big Data Analysis and Processing","Sun Yat-sen University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Guangdong Key Laboratory of Big Data Analysis and Processing","institution_ids":[]},{"raw_affiliation_string":"Sun Yat-sen University","institution_ids":["https://openalex.org/I157773358"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5038214042","display_name":"Haitao Wang","orcid":"https://orcid.org/0000-0002-8394-6410"},"institutions":[{"id":"https://openalex.org/I157773358","display_name":"Sun Yat-sen University","ror":"https://ror.org/0064kty71","country_code":"CN","type":"education","lineage":["https://openalex.org/I157773358"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Haitao Wang","raw_affiliation_strings":["Guangdong Key Laboratory of Big Data Analysis and Processing","Sun Yat-sen University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Guangdong Key Laboratory of Big Data Analysis and Processing","institution_ids":[]},{"raw_affiliation_string":"Sun Yat-sen University","institution_ids":["https://openalex.org/I157773358"]}]},{"author_position":"last","author":{"id":null,"display_name":"Hao Cai","orcid":null},"institutions":[{"id":"https://openalex.org/I32574673","display_name":"Shantou University","ror":"https://ror.org/01a099706","country_code":"CN","type":"education","lineage":["https://openalex.org/I32574673"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Hao Cai","raw_affiliation_strings":["Shantou University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Shantou University","institution_ids":["https://openalex.org/I32574673"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":11.3964,"has_fulltext":true,"cited_by_count":2,"citation_normalized_percentile":{"value":0.98496835,"is_in_top_1_percent":false,"is_in_top_10_percent":true},"cited_by_percentile_year":{"min":91,"max":97},"biblio":{"volume":null,"issue":null,"first_page":"170","last_page":"178"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10127","display_name":"Banking stability, regulation, efficiency","score":0.85589998960495,"subfield":{"id":"https://openalex.org/subfields/2003","display_name":"Finance"},"field":{"id":"https://openalex.org/fields/20","display_name":"Economics, Econometrics and Finance"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},"topics":[{"id":"https://openalex.org/T10127","display_name":"Banking stability, regulation, efficiency","score":0.85589998960495,"subfield":{"id":"https://openalex.org/subfields/2003","display_name":"Finance"},"field":{"id":"https://openalex.org/fields/20","display_name":"Economics, Econometrics and Finance"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/asynchronous-communication","display_name":"Asynchronous communication","score":0.8392999768257141},{"id":"https://openalex.org/keywords/interpretability","display_name":"Interpretability","score":0.7912999987602234},{"id":"https://openalex.org/keywords/asynchrony","display_name":"Asynchrony (computer programming)","score":0.7128999829292297},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6654000282287598},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.4555000066757202},{"id":"https://openalex.org/keywords/multiplicative-function","display_name":"Multiplicative function","score":0.3937000036239624},{"id":"https://openalex.org/keywords/bottleneck","display_name":"Bottleneck","score":0.3481999933719635}],"concepts":[{"id":"https://openalex.org/C151319957","wikidata":"https://www.wikidata.org/wiki/Q752739","display_name":"Asynchronous communication","level":2,"score":0.8392999768257141},{"id":"https://openalex.org/C2781067378","wikidata":"https://www.wikidata.org/wiki/Q17027399","display_name":"Interpretability","level":2,"score":0.7912999987602234},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.782800018787384},{"id":"https://openalex.org/C2779019669","wikidata":"https://www.wikidata.org/wiki/Q25203946","display_name":"Asynchrony (computer programming)","level":3,"score":0.7128999829292297},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6654000282287598},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.4555000066757202},{"id":"https://openalex.org/C120314980","wikidata":"https://www.wikidata.org/wiki/Q180634","display_name":"Distributed computing","level":1,"score":0.39590001106262207},{"id":"https://openalex.org/C42747912","wikidata":"https://www.wikidata.org/wiki/Q1048447","display_name":"Multiplicative function","level":2,"score":0.3937000036239624},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.38830000162124634},{"id":"https://openalex.org/C2780513914","wikidata":"https://www.wikidata.org/wiki/Q18210350","display_name":"Bottleneck","level":2,"score":0.3481999933719635},{"id":"https://openalex.org/C2776628324","wikidata":"https://www.wikidata.org/wiki/Q22222748","display_name":"Frequency assignment","level":2,"score":0.33180001378059387},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.31360000371932983},{"id":"https://openalex.org/C62611344","wikidata":"https://www.wikidata.org/wiki/Q1062658","display_name":"Node (physics)","level":2,"score":0.30410000681877136},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.30309998989105225},{"id":"https://openalex.org/C132010649","wikidata":"https://www.wikidata.org/wiki/Q189222","display_name":"Intuition","level":2,"score":0.28349998593330383},{"id":"https://openalex.org/C85044808","wikidata":"https://www.wikidata.org/wiki/Q620614","display_name":"Assignment problem","level":2,"score":0.2770000100135803},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.2703000009059906},{"id":"https://openalex.org/C2777072894","wikidata":"https://www.wikidata.org/wiki/Q4812204","display_name":"Asynchronous learning","level":5,"score":0.27000001072883606},{"id":"https://openalex.org/C194146004","wikidata":"https://www.wikidata.org/wiki/Q5532462","display_name":"Generalized assignment problem","level":3,"score":0.2635999917984009}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.24963/ijcai.2025/20","is_oa":true,"landing_page_url":"https://doi.org/10.24963/ijcai.2025/20","pdf_url":"https://www.ijcai.org/proceedings/2025/0020.pdf","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.24963/ijcai.2025/20","is_oa":true,"landing_page_url":"https://doi.org/10.24963/ijcai.2025/20","pdf_url":"https://www.ijcai.org/proceedings/2025/0020.pdf","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[{"id":"https://openalex.org/G3373226507","display_name":null,"funder_award_id":"62272497","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"}],"funders":[{"id":"https://openalex.org/F4320321001","display_name":"National Natural Science Foundation of China","ror":"https://ror.org/01h0zpd94"}],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W4414360686.pdf","grobid_xml":"https://content.openalex.org/works/W4414360686.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Credit":[0],"assignment":[1,23,67],"is":[2],"a":[3,70,77],"critical":[4],"problem":[5],"in":[6,122],"multi-agent":[7],"reinforcement":[8],"learning":[9],"(MARL),":[10],"aiming":[11],"to":[12,37,55,88,112],"identify":[13],"agents'":[14],"marginal":[15],"contributions":[16],"for":[17,42,144],"optimizing":[18],"cooperative":[19],"policies.":[20],"Current":[21],"credit":[22,66,93],"methods":[24,136],"typically":[25],"assume":[26],"synchronous":[27],"decision-making":[28],"among":[29,116],"agents.":[30],"However,":[31],"many":[32],"real-world":[33],"scenarios":[34],"require":[35],"agents":[36],"act":[38],"asynchronously":[39],"without":[40],"waiting":[41],"others.":[43],"This":[44],"asynchrony":[45],"introduces":[46],"conditional":[47],"dependencies":[48,115],"between":[49],"actions,":[50,118],"which":[51],"pose":[52],"great":[53],"challenges":[54],"current":[56],"methods.":[57],"To":[58],"address":[59],"this":[60],"issue,":[61],"we":[62],"propose":[63],"an":[64],"asynchronous":[65,86,117,124,145],"framework,":[68],"incorporating":[69],"Virtual":[71],"Synchrony":[72],"Proxy":[73],"(VSP)":[74],"mechanism":[75],"and":[76,104],"Multiplicative":[78],"Value":[79],"Decomposition":[80],"(MVD)":[81],"algorithm.":[82],"VSP":[83,99],"enables":[84],"physically":[85],"actions":[87],"be":[89],"virtually":[90],"synchronized":[91],"during":[92],"assignment.":[94],"We":[95],"theoretically":[96],"prove":[97],"that":[98,129],"preserves":[100],"both":[101],"task":[102],"equilibrium":[103],"algorithm":[105],"convergence.":[106],"Furthermore,":[107],"MVD":[108],"leverages":[109],"multiplicative":[110],"interactions":[111],"effectively":[113],"model":[114],"offering":[119],"theoretical":[120],"advantages":[121],"handling":[123],"tasks.":[125],"Extensive":[126],"experiments":[127],"show":[128],"our":[130],"framework":[131],"consistently":[132],"outperforms":[133],"state-of-the-art":[134],"MARL":[135],"on":[137],"challenging":[138],"tasks":[139],"while":[140],"providing":[141],"improved":[142],"interpretability":[143],"cooperation.":[146]},"counts_by_year":[{"year":2026,"cited_by_count":1},{"year":2025,"cited_by_count":1}],"updated_date":"2026-08-01T09:00:35.917206","created_date":"2025-10-10T00:00:00"}
