{"id":"https://openalex.org/W2966157599","doi":"https://doi.org/10.24963/ijcai.2019/181","title":"Learning Deep Decentralized Policy Network by Collective Rewards for Real-Time Combat Game","display_name":"Learning Deep Decentralized Policy Network by Collective Rewards for Real-Time Combat Game","publication_year":2019,"publication_date":"2019-07-28","ids":{"openalex":"https://openalex.org/W2966157599","doi":"https://doi.org/10.24963/ijcai.2019/181","mag":"2966157599"},"language":"en","primary_location":{"id":"doi:10.24963/ijcai.2019/181","is_oa":true,"landing_page_url":"https://doi.org/10.24963/ijcai.2019/181","pdf_url":"https://www.ijcai.org/proceedings/2019/0181.pdf","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the Twenty-Eighth International Joint Conference on Artificial Intelligence","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://www.ijcai.org/proceedings/2019/0181.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5070755370","display_name":"Peixi Peng","orcid":"https://orcid.org/0000-0002-7427-8764"},"institutions":[{"id":"https://openalex.org/I19820366","display_name":"Chinese Academy of Sciences","ror":"https://ror.org/034t30j35","country_code":"CN","type":"government","lineage":["https://openalex.org/I19820366"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Peixi Peng","raw_affiliation_strings":["Institute of Automation, Chinese Academy of Sciences"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Institute of Automation, Chinese Academy of Sciences","institution_ids":["https://openalex.org/I19820366"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5076090670","display_name":"Junliang Xing","orcid":"https://orcid.org/0000-0001-6801-0510"},"institutions":[{"id":"https://openalex.org/I19820366","display_name":"Chinese Academy of Sciences","ror":"https://ror.org/034t30j35","country_code":"CN","type":"government","lineage":["https://openalex.org/I19820366"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Junliang Xing","raw_affiliation_strings":["Institute of Automation, Chinese Academy of Sciences"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Institute of Automation, Chinese Academy of Sciences","institution_ids":["https://openalex.org/I19820366"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5026303574","display_name":"Lili Cao","orcid":"https://orcid.org/0000-0002-6878-4599"},"institutions":[{"id":"https://openalex.org/I19820366","display_name":"Chinese Academy of Sciences","ror":"https://ror.org/034t30j35","country_code":"CN","type":"government","lineage":["https://openalex.org/I19820366"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Lili Cao","raw_affiliation_strings":["Institute of Automation, Chinese Academy of Sciences"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Institute of Automation, Chinese Academy of Sciences","institution_ids":["https://openalex.org/I19820366"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5067063678","display_name":"Lisen Mu","orcid":null},"institutions":[{"id":"https://openalex.org/I4401726824","display_name":"Horizon Robotics (China)","ror":"https://ror.org/05cmv6g68","country_code":null,"type":"company","lineage":["https://openalex.org/I4401726824"]}],"countries":[],"is_corresponding":false,"raw_author_name":"Lisen Mu","raw_affiliation_strings":["Horizon Robotics"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Horizon Robotics","institution_ids":["https://openalex.org/I4401726824"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5050972076","display_name":"Chang Huang","orcid":"https://orcid.org/0000-0002-2451-5100"},"institutions":[{"id":"https://openalex.org/I4401726824","display_name":"Horizon Robotics (China)","ror":"https://ror.org/05cmv6g68","country_code":null,"type":"company","lineage":["https://openalex.org/I4401726824"]}],"countries":[],"is_corresponding":false,"raw_author_name":"Chang Huang","raw_affiliation_strings":["Horizon Robotics"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Horizon Robotics","institution_ids":["https://openalex.org/I4401726824"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":2,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1305","last_page":"1311"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9979000091552734,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9979000091552734,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11574","display_name":"Artificial Intelligence in Games","score":0.9934999942779541,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10812","display_name":"Human Pose and Action Recognition","score":0.9898999929428101,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8064696192741394},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7529557347297668},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.7361452579498291},{"id":"https://openalex.org/keywords/regret","display_name":"Regret","score":0.6636502146720886},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.6557690501213074},{"id":"https://openalex.org/keywords/adversary","display_name":"Adversary","score":0.6122360825538635},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.6113423109054565},{"id":"https://openalex.org/keywords/state-space","display_name":"State space","score":0.48341476917266846},{"id":"https://openalex.org/keywords/imitation","display_name":"Imitation","score":0.4585762321949005},{"id":"https://openalex.org/keywords/fictitious-play","display_name":"Fictitious play","score":0.4581093490123749},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.4567195177078247},{"id":"https://openalex.org/keywords/state","display_name":"State (computer science)","score":0.4184328019618988},{"id":"https://openalex.org/keywords/markov-process","display_name":"Markov process","score":0.3517051935195923},{"id":"https://openalex.org/keywords/machine-learning","display_name":"Machine learning","score":0.3225903809070587},{"id":"https://openalex.org/keywords/nash-equilibrium","display_name":"Nash equilibrium","score":0.18256568908691406},{"id":"https://openalex.org/keywords/computer-security","display_name":"Computer security","score":0.1789190173149109},{"id":"https://openalex.org/keywords/engineering","display_name":"Engineering","score":0.1504485011100769},{"id":"https://openalex.org/keywords/mathematical-optimization","display_name":"Mathematical optimization","score":0.12932023406028748}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8064696192741394},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7529557347297668},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.7361452579498291},{"id":"https://openalex.org/C50817715","wikidata":"https://www.wikidata.org/wiki/Q79895177","display_name":"Regret","level":2,"score":0.6636502146720886},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6557690501213074},{"id":"https://openalex.org/C41065033","wikidata":"https://www.wikidata.org/wiki/Q2825412","display_name":"Adversary","level":2,"score":0.6122360825538635},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.6113423109054565},{"id":"https://openalex.org/C72434380","wikidata":"https://www.wikidata.org/wiki/Q230930","display_name":"State space","level":2,"score":0.48341476917266846},{"id":"https://openalex.org/C126388530","wikidata":"https://www.wikidata.org/wiki/Q1131737","display_name":"Imitation","level":2,"score":0.4585762321949005},{"id":"https://openalex.org/C145071142","wikidata":"https://www.wikidata.org/wiki/Q1411116","display_name":"Fictitious play","level":3,"score":0.4581093490123749},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.4567195177078247},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.4184328019618988},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.3517051935195923},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3225903809070587},{"id":"https://openalex.org/C46814582","wikidata":"https://www.wikidata.org/wiki/Q23389","display_name":"Nash equilibrium","level":2,"score":0.18256568908691406},{"id":"https://openalex.org/C38652104","wikidata":"https://www.wikidata.org/wiki/Q3510521","display_name":"Computer security","level":1,"score":0.1789190173149109},{"id":"https://openalex.org/C127413603","wikidata":"https://www.wikidata.org/wiki/Q11023","display_name":"Engineering","level":0,"score":0.1504485011100769},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.12932023406028748},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.0},{"id":"https://openalex.org/C77805123","wikidata":"https://www.wikidata.org/wiki/Q161272","display_name":"Social psychology","level":1,"score":0.0},{"id":"https://openalex.org/C201995342","wikidata":"https://www.wikidata.org/wiki/Q682496","display_name":"Systems engineering","level":1,"score":0.0},{"id":"https://openalex.org/C111919701","wikidata":"https://www.wikidata.org/wiki/Q9135","display_name":"Operating system","level":1,"score":0.0},{"id":"https://openalex.org/C105795698","wikidata":"https://www.wikidata.org/wiki/Q12483","display_name":"Statistics","level":1,"score":0.0},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.0},{"id":"https://openalex.org/C15744967","wikidata":"https://www.wikidata.org/wiki/Q9418","display_name":"Psychology","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.24963/ijcai.2019/181","is_oa":true,"landing_page_url":"https://doi.org/10.24963/ijcai.2019/181","pdf_url":"https://www.ijcai.org/proceedings/2019/0181.pdf","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the Twenty-Eighth International Joint Conference on Artificial Intelligence","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.24963/ijcai.2019/181","is_oa":true,"landing_page_url":"https://doi.org/10.24963/ijcai.2019/181","pdf_url":"https://www.ijcai.org/proceedings/2019/0181.pdf","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the Twenty-Eighth International Joint Conference on Artificial Intelligence","raw_type":"proceedings-article"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","score":0.8199999928474426,"id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[{"id":"https://openalex.org/F4320321001","display_name":"National Natural Science Foundation of China","ror":"https://ror.org/01h0zpd94"}],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W2966157599.pdf","grobid_xml":"https://content.openalex.org/works/W2966157599.grobid-xml"},"referenced_works_count":38,"referenced_works":["https://openalex.org/W1750339092","https://openalex.org/W1931877416","https://openalex.org/W2005951230","https://openalex.org/W2022504108","https://openalex.org/W2051228319","https://openalex.org/W2117539524","https://openalex.org/W2119717200","https://openalex.org/W2145339207","https://openalex.org/W2148112459","https://openalex.org/W2257979135","https://openalex.org/W2518713116","https://openalex.org/W2604283518","https://openalex.org/W2617547828","https://openalex.org/W2730357202","https://openalex.org/W2741302028","https://openalex.org/W2776126823","https://openalex.org/W2788862220","https://openalex.org/W2803616302","https://openalex.org/W2808602506","https://openalex.org/W2883057932","https://openalex.org/W2891663723","https://openalex.org/W2950560044","https://openalex.org/W2950735232","https://openalex.org/W2962957031","https://openalex.org/W2963022170","https://openalex.org/W2963277051","https://openalex.org/W2963368198","https://openalex.org/W2963376229","https://openalex.org/W3093287223","https://openalex.org/W3104860527","https://openalex.org/W4229812034","https://openalex.org/W4230563027","https://openalex.org/W4293862243","https://openalex.org/W4295598622","https://openalex.org/W4298857966","https://openalex.org/W4299802797","https://openalex.org/W4306290508","https://openalex.org/W4312558117"],"related_works":["https://openalex.org/W2970347269","https://openalex.org/W4287863949","https://openalex.org/W1850488217","https://openalex.org/W4287102143","https://openalex.org/W2945119207","https://openalex.org/W3182614517","https://openalex.org/W2807018115","https://openalex.org/W4388236136","https://openalex.org/W4200250224","https://openalex.org/W2606546905"],"abstract_inverted_index":{"The":[0],"task":[1,39,54],"of":[2],"real-time":[3,22,48],"combat":[4,23,104],"game":[5],"is":[6,26,85],"to":[7,11,28,41,72],"coordinate":[8],"multiple":[9],"units":[10],"defeat":[12,111],"their":[13],"enemies":[14],"controlled":[15],"by":[16,96],"the":[17,74],"given":[18],"opponent":[19,92,113],"in":[20],"a":[21,30,38,56,66,80],"scenario.":[24],"It":[25],"difficult":[27],"design":[29],"high-level":[31],"Artificial":[32],"Intelligence":[33],"(AI)":[34],"program":[35],"for":[36],"such":[37],"due":[40],"its":[42],"extremely":[43],"large":[44],"state-action":[45],"space":[46],"and":[47,64,93,115],"requirements.":[49],"This":[50],"paper":[51],"formulates":[52],"this":[53],"as":[55],"collective":[57],"decentralized":[58],"partially":[59],"observable":[60],"Markov":[61],"decision":[62],"process,":[63],"designs":[65],"Deep":[67],"Decentralized":[68],"Policy":[69],"Network":[70],"(DDPN)":[71],"model":[73],"polices.":[75],"To":[76],"train":[77],"DDPN":[78],"effectively,":[79],"novel":[81],"two-stage":[82],"learning":[83,90,95],"algorithm":[84],"proposed":[86,108],"which":[87],"combines":[88],"imitation":[89],"from":[91],"reinforcement":[94],"no-regret":[97],"dynamics.":[98],"Extensive":[99],"experimental":[100],"results":[101],"on":[102],"various":[103],"scenarios":[105],"indicate":[106],"that":[107],"method":[109],"can":[110],"different":[112],"models":[114],"significantly":[116],"outperforms":[117],"many":[118],"state-of-the-art":[119],"approaches.":[120]},"counts_by_year":[{"year":2023,"cited_by_count":1},{"year":2020,"cited_by_count":1}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
