{"id":"https://openalex.org/W2965676832","doi":"https://doi.org/10.24963/ijcai.2019/323","title":"Deep Multi-Agent Reinforcement Learning with Discrete-Continuous Hybrid Action Spaces","display_name":"Deep Multi-Agent Reinforcement Learning with Discrete-Continuous Hybrid Action Spaces","publication_year":2019,"publication_date":"2019-07-28","ids":{"openalex":"https://openalex.org/W2965676832","doi":"https://doi.org/10.24963/ijcai.2019/323","mag":"2965676832"},"language":"en","primary_location":{"id":"doi:10.24963/ijcai.2019/323","is_oa":true,"landing_page_url":"https://doi.org/10.24963/ijcai.2019/323","pdf_url":"https://www.ijcai.org/proceedings/2019/0323.pdf","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the Twenty-Eighth International Joint Conference on Artificial Intelligence","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://www.ijcai.org/proceedings/2019/0323.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5015445968","display_name":"Haotian Fu","orcid":null},"institutions":[{"id":"https://openalex.org/I162868743","display_name":"Tianjin University","ror":"https://ror.org/012tb2g32","country_code":"CN","type":"education","lineage":["https://openalex.org/I162868743"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Haotian Fu","raw_affiliation_strings":["College of Intelligence and Computing, Tianjin University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"College of Intelligence and Computing, Tianjin University","institution_ids":["https://openalex.org/I162868743"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5103176048","display_name":"Hongyao Tang","orcid":"https://orcid.org/0000-0001-7478-7684"},"institutions":[{"id":"https://openalex.org/I162868743","display_name":"Tianjin University","ror":"https://ror.org/012tb2g32","country_code":"CN","type":"education","lineage":["https://openalex.org/I162868743"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Hongyao Tang","raw_affiliation_strings":["College of Intelligence and Computing, Tianjin University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"College of Intelligence and Computing, Tianjin University","institution_ids":["https://openalex.org/I162868743"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5047509839","display_name":"Jianye Hao","orcid":"https://orcid.org/0000-0002-0422-8235"},"institutions":[{"id":"https://openalex.org/I162868743","display_name":"Tianjin University","ror":"https://ror.org/012tb2g32","country_code":"CN","type":"education","lineage":["https://openalex.org/I162868743"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Jianye Hao","raw_affiliation_strings":["College of Intelligence and Computing, Tianjin University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"College of Intelligence and Computing, Tianjin University","institution_ids":["https://openalex.org/I162868743"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5045930689","display_name":"Zihan Lei","orcid":null},"institutions":[{"id":"https://openalex.org/I162868743","display_name":"Tianjin University","ror":"https://ror.org/012tb2g32","country_code":"CN","type":"education","lineage":["https://openalex.org/I162868743"]},{"id":"https://openalex.org/I4210091137","display_name":"NetEase (China)","ror":"https://ror.org/00fp6fj05","country_code":"CN","type":"company","lineage":["https://openalex.org/I4210091137"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Zihan Lei","raw_affiliation_strings":["Fuxi AI Lab in Netease","College of Intelligence and Computing, Tianjin University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Fuxi AI Lab in Netease","institution_ids":["https://openalex.org/I4210091137"]},{"raw_affiliation_string":"College of Intelligence and Computing, Tianjin University","institution_ids":["https://openalex.org/I162868743"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5103121632","display_name":"Yingfeng Chen","orcid":"https://orcid.org/0000-0002-9747-5947"},"institutions":[{"id":"https://openalex.org/I4210091137","display_name":"NetEase (China)","ror":"https://ror.org/00fp6fj05","country_code":"CN","type":"company","lineage":["https://openalex.org/I4210091137"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Yingfeng Chen","raw_affiliation_strings":["Fuxi AI Lab in Netease"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Fuxi AI Lab in Netease","institution_ids":["https://openalex.org/I4210091137"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5022008180","display_name":"Changjie Fan","orcid":"https://orcid.org/0000-0001-5420-0516"},"institutions":[{"id":"https://openalex.org/I4210091137","display_name":"NetEase (China)","ror":"https://ror.org/00fp6fj05","country_code":"CN","type":"company","lineage":["https://openalex.org/I4210091137"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Changjie Fan","raw_affiliation_strings":["Fuxi AI Lab in Netease"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Fuxi AI Lab in Netease","institution_ids":["https://openalex.org/I4210091137"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":64,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"2329","last_page":"2335"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9995999932289124,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9995999932289124,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11674","display_name":"Sports Analytics and Performance","score":0.9642000198364258,"subfield":{"id":"https://openalex.org/subfields/2002","display_name":"Economics and Econometrics"},"field":{"id":"https://openalex.org/fields/20","display_name":"Economics, Econometrics and Finance"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.9466000199317932,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.902036726474762},{"id":"https://openalex.org/keywords/parameterized-complexity","display_name":"Parameterized complexity","score":0.7584580183029175},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7563426494598389},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.6852085590362549},{"id":"https://openalex.org/keywords/deep-learning","display_name":"Deep learning","score":0.609721839427948},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.5864897966384888},{"id":"https://openalex.org/keywords/multi-agent-system","display_name":"Multi-agent system","score":0.45942002534866333},{"id":"https://openalex.org/keywords/variety","display_name":"Variety (cybernetics)","score":0.43556928634643555},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.42349064350128174},{"id":"https://openalex.org/keywords/machine-learning","display_name":"Machine learning","score":0.41385072469711304},{"id":"https://openalex.org/keywords/algorithm","display_name":"Algorithm","score":0.10775619745254517}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.902036726474762},{"id":"https://openalex.org/C165464430","wikidata":"https://www.wikidata.org/wiki/Q1570441","display_name":"Parameterized complexity","level":2,"score":0.7584580183029175},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7563426494598389},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6852085590362549},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.609721839427948},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.5864897966384888},{"id":"https://openalex.org/C41550386","wikidata":"https://www.wikidata.org/wiki/Q529909","display_name":"Multi-agent system","level":2,"score":0.45942002534866333},{"id":"https://openalex.org/C136197465","wikidata":"https://www.wikidata.org/wiki/Q1729295","display_name":"Variety (cybernetics)","level":2,"score":0.43556928634643555},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.42349064350128174},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.41385072469711304},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.10775619745254517},{"id":"https://openalex.org/C62520636","wikidata":"https://www.wikidata.org/wiki/Q944","display_name":"Quantum mechanics","level":1,"score":0.0},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.24963/ijcai.2019/323","is_oa":true,"landing_page_url":"https://doi.org/10.24963/ijcai.2019/323","pdf_url":"https://www.ijcai.org/proceedings/2019/0323.pdf","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the Twenty-Eighth International Joint Conference on Artificial Intelligence","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.24963/ijcai.2019/323","is_oa":true,"landing_page_url":"https://doi.org/10.24963/ijcai.2019/323","pdf_url":"https://www.ijcai.org/proceedings/2019/0323.pdf","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the Twenty-Eighth International Joint Conference on Artificial Intelligence","raw_type":"proceedings-article"},"sustainable_development_goals":[{"score":0.44999998807907104,"id":"https://metadata.un.org/sdg/16","display_name":"Peace, Justice and strong institutions"}],"awards":[{"id":"https://openalex.org/G8462351438","display_name":null,"funder_award_id":"61702362","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"},{"id":"https://openalex.org/G8921145797","display_name":null,"funder_award_id":"U1836214","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"}],"funders":[{"id":"https://openalex.org/F4320321001","display_name":"National Natural Science Foundation of China","ror":"https://ror.org/01h0zpd94"},{"id":"https://openalex.org/F4320326190","display_name":"Tianjin Science and Technology Committee","ror":null}],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W2965676832.pdf","grobid_xml":"https://content.openalex.org/works/W2965676832.grobid-xml"},"referenced_works_count":22,"referenced_works":["https://openalex.org/W2012812921","https://openalex.org/W2026662445","https://openalex.org/W2145339207","https://openalex.org/W2256420211","https://openalex.org/W2395575420","https://openalex.org/W2604283518","https://openalex.org/W2736601468","https://openalex.org/W2739657930","https://openalex.org/W2798511001","https://openalex.org/W2892110489","https://openalex.org/W2894389820","https://openalex.org/W2897417898","https://openalex.org/W2963257680","https://openalex.org/W2963262099","https://openalex.org/W2963616477","https://openalex.org/W2963864421","https://openalex.org/W2964043796","https://openalex.org/W4214717370","https://openalex.org/W4295598622","https://openalex.org/W4298857966","https://openalex.org/W4299802797","https://openalex.org/W4302570325"],"related_works":["https://openalex.org/W2051058708","https://openalex.org/W1494268238","https://openalex.org/W154868527","https://openalex.org/W1983207144","https://openalex.org/W2490706771","https://openalex.org/W2480116122","https://openalex.org/W4255576661","https://openalex.org/W1516574938","https://openalex.org/W2625725254","https://openalex.org/W2563912921"],"abstract_inverted_index":{"Deep":[0,66,73,133,136],"Reinforcement":[1],"Learning":[2],"(DRL)":[3],"has":[4,34],"been":[5],"applied":[6],"to":[7,25,40,98],"address":[8],"a":[9],"variety":[10],"of":[11,28,91],"cooperative":[12],"multi-agent":[13,41],"problems":[14,42],"with":[15,43],"either":[16],"discrete":[17],"action":[18,22,48],"spaces":[19,49],"or":[20],"continuous":[21],"spaces.":[23],"However,":[24],"the":[26,82,100],"best":[27],"our":[29],"knowledge,":[30],"no":[31],"previous":[32],"work":[33,57],"ever":[35],"succeeded":[36],"in":[37,54],"applying":[38],"DRL":[39],"discrete-continuous":[44],"hybrid":[45],"(or":[46],"parameterized)":[47],"which":[50],"is":[51],"very":[52],"common":[53],"practice.":[55],"Our":[56,116],"fills":[58],"this":[59],"gap":[60],"by":[61],"proposing":[62],"two":[63],"novel":[64],"algorithms:":[65],"Multi-Agent":[67,74],"Parameterized":[68],"Q-Networks":[69,77],"(Deep":[70,78],"MAPQN)":[71],"and":[72,126,135,140],"Hierarchical":[75],"Hybrid":[76],"MAHHQN).":[79],"We":[80],"follow":[81],"centralized":[83],"training":[84,101],"but":[85],"decentralized":[86],"execution":[87],"paradigm:":[88],"different":[89,94],"levels":[90],"communication":[92],"between":[93],"agents":[95],"are":[96,138],"used":[97],"facilitate":[99],"process,":[102],"while":[103],"each":[104],"agent":[105],"executes":[106],"its":[107],"policy":[108],"independently":[109],"based":[110],"on":[111,119],"local":[112],"observations":[113],"during":[114],"execution.":[115],"empirical":[117],"results":[118],"several":[120],"challenging":[121],"tasks":[122],"(simulated":[123],"RoboCup":[124],"Soccer":[125],"game":[127],"Ghost":[128],"Story)":[129],"show":[130],"that":[131],"both":[132],"MAPQN":[134],"MAHHQN":[137],"effective":[139],"significantly":[141],"outperform":[142],"existing":[143],"independent":[144],"deep":[145],"parameterized":[146],"Q-learning":[147],"method.":[148]},"counts_by_year":[{"year":2026,"cited_by_count":2},{"year":2025,"cited_by_count":13},{"year":2024,"cited_by_count":13},{"year":2023,"cited_by_count":9},{"year":2022,"cited_by_count":8},{"year":2021,"cited_by_count":9},{"year":2020,"cited_by_count":8},{"year":2019,"cited_by_count":2}],"updated_date":"2026-07-23T08:03:31.855105","created_date":"2025-10-10T00:00:00"}
