{"id":"https://openalex.org/W3161195296","doi":"https://doi.org/10.1109/icassp39728.2021.9414712","title":"Self-Inference Of Others\u2019 Policies For Homogeneous Agents In Cooperative Multi-Agent Reinforcement Learning","display_name":"Self-Inference Of Others\u2019 Policies For Homogeneous Agents In Cooperative Multi-Agent Reinforcement Learning","publication_year":2021,"publication_date":"2021-05-13","ids":{"openalex":"https://openalex.org/W3161195296","doi":"https://doi.org/10.1109/icassp39728.2021.9414712","mag":"3161195296"},"language":"en","primary_location":{"id":"doi:10.1109/icassp39728.2021.9414712","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp39728.2021.9414712","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ICASSP 2021 - 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5101999069","display_name":"Qifeng Lin","orcid":"https://orcid.org/0000-0003-0523-8811"},"institutions":[{"id":"https://openalex.org/I157773358","display_name":"Sun Yat-sen University","ror":"https://ror.org/0064kty71","country_code":"CN","type":"education","lineage":["https://openalex.org/I157773358"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Qifeng Lin","raw_affiliation_strings":["Sun Yat-Sen University Guangdong Provincial Key Laboratory of Computational Science, Sun Yat-Sen University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Sun Yat-Sen University Guangdong Provincial Key Laboratory of Computational Science, Sun Yat-Sen University","institution_ids":["https://openalex.org/I157773358"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5029820392","display_name":"Qing Ling","orcid":"https://orcid.org/0000-0003-4222-5964"},"institutions":[{"id":"https://openalex.org/I157773358","display_name":"Sun Yat-sen University","ror":"https://ror.org/0064kty71","country_code":"CN","type":"education","lineage":["https://openalex.org/I157773358"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Qing Ling","raw_affiliation_strings":["Sun Yat-Sen University Guangdong Provincial Key Laboratory of Computational Science, Sun Yat-Sen University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Sun Yat-Sen University Guangdong Provincial Key Laboratory of Computational Science, Sun Yat-Sen University","institution_ids":["https://openalex.org/I157773358"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I157773358"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.04855145,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":"20","issue":null,"first_page":"3490","last_page":"3494"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9958000183105469,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9958000183105469,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11975","display_name":"Evolutionary Algorithms and Applications","score":0.9312000274658203,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10328","display_name":"Supply Chain and Inventory Management","score":0.9035000205039978,"subfield":{"id":"https://openalex.org/subfields/1404","display_name":"Management Information Systems"},"field":{"id":"https://openalex.org/fields/14","display_name":"Business, Management and Accounting"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.845043957233429},{"id":"https://openalex.org/keywords/homogeneous","display_name":"Homogeneous","score":0.6795734167098999},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.6487762928009033},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.5769205093383789},{"id":"https://openalex.org/keywords/multi-agent-system","display_name":"Multi-agent system","score":0.47914594411849976},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.4557705223560333},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.44506075978279114},{"id":"https://openalex.org/keywords/psychology","display_name":"Psychology","score":0.1427563726902008},{"id":"https://openalex.org/keywords/social-psychology","display_name":"Social psychology","score":0.13093730807304382},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.11479276418685913}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.845043957233429},{"id":"https://openalex.org/C66882249","wikidata":"https://www.wikidata.org/wiki/Q169336","display_name":"Homogeneous","level":2,"score":0.6795734167098999},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6487762928009033},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.5769205093383789},{"id":"https://openalex.org/C41550386","wikidata":"https://www.wikidata.org/wiki/Q529909","display_name":"Multi-agent system","level":2,"score":0.47914594411849976},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4557705223560333},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.44506075978279114},{"id":"https://openalex.org/C15744967","wikidata":"https://www.wikidata.org/wiki/Q9418","display_name":"Psychology","level":0,"score":0.1427563726902008},{"id":"https://openalex.org/C77805123","wikidata":"https://www.wikidata.org/wiki/Q161272","display_name":"Social psychology","level":1,"score":0.13093730807304382},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.11479276418685913},{"id":"https://openalex.org/C114614502","wikidata":"https://www.wikidata.org/wiki/Q76592","display_name":"Combinatorics","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icassp39728.2021.9414712","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp39728.2021.9414712","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ICASSP 2021 - 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/8","score":0.5899999737739563,"display_name":"Decent work and economic growth"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":35,"referenced_works":["https://openalex.org/W74003006","https://openalex.org/W2128643385","https://openalex.org/W2145339207","https://openalex.org/W2145510175","https://openalex.org/W2173248099","https://openalex.org/W2396783599","https://openalex.org/W2475089067","https://openalex.org/W2604283518","https://openalex.org/W2604873668","https://openalex.org/W2617547828","https://openalex.org/W2768629321","https://openalex.org/W2776777826","https://openalex.org/W2788212683","https://openalex.org/W2883532348","https://openalex.org/W2951896791","https://openalex.org/W2962938168","https://openalex.org/W2962941327","https://openalex.org/W2963065757","https://openalex.org/W2963259091","https://openalex.org/W2963407617","https://openalex.org/W2963562809","https://openalex.org/W2963864421","https://openalex.org/W2964251366","https://openalex.org/W2982515032","https://openalex.org/W3209101326","https://openalex.org/W4299802797","https://openalex.org/W6684921986","https://openalex.org/W6712348848","https://openalex.org/W6721101288","https://openalex.org/W6736572398","https://openalex.org/W6736622323","https://openalex.org/W6738796088","https://openalex.org/W6747146101","https://openalex.org/W6748910126","https://openalex.org/W6757096465"],"related_works":["https://openalex.org/W4310083477","https://openalex.org/W2328553770","https://openalex.org/W2920061524","https://openalex.org/W1977959518","https://openalex.org/W2038908348","https://openalex.org/W2107890255","https://openalex.org/W2106552856","https://openalex.org/W2145821588","https://openalex.org/W2086122291","https://openalex.org/W1987513656"],"abstract_inverted_index":{"Multi-agent":[0],"reinforcement":[1],"learning":[2],"(MARL)":[3],"has":[4],"been":[5],"widely":[6],"applied":[7],"in":[8,59],"various":[9],"cooperative":[10],"tasks,":[11],"where":[12],"multiple":[13],"agents":[14,32,55,69,113],"are":[15,114],"trained":[16],"to":[17,35,51,87,98],"collaboratively":[18],"achieve":[19],"global":[20],"goals.":[21],"During":[22],"the":[23,37,43,66,74,103,112,121,128,138],"training":[24],"stage":[25],"of":[26,30,42,62,68,76,89,130,137],"MARL,":[27],"inferring":[28,73],"policies":[29,105],"other":[31,54],"is":[33],"able":[34],"improve":[36],"coordination":[38],"efficiency.":[39],"However,":[40],"most":[41],"existing":[44],"policy":[45,75],"inference":[46],"methods":[47],"require":[48],"each":[49,100],"agent":[50,78,90,101,131],"model":[52],"all":[53],"separately,":[56],"which":[57],"results":[58,134],"quadratic":[60],"growth":[61],"resource":[63],"consumption":[64],"as":[65],"number":[67],"increases.":[70],"In":[71],"addition,":[72],"an":[77],"solely":[79],"from":[80],"its":[81,107],"observations":[82],"and":[83,123,126],"actions":[84],"may":[85],"lead":[86],"failure":[88],"modeling.":[91,132],"To":[92],"address":[93],"this":[94],"issue,":[95],"we":[96],"propose":[97],"let":[99],"infer":[102],"others\u2019":[104],"with":[106],"own":[108],"model,":[109],"given":[110],"that":[111],"homogeneous.":[115],"This":[116],"self-inference":[117],"approach":[118],"significantly":[119],"reduces":[120],"computation":[122],"storage":[124],"consumption,":[125],"guarantees":[127],"quality":[129],"Experimental":[133],"demonstrate":[135],"effectiveness":[136],"proposed":[139],"approach.":[140]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
