{"id":"https://openalex.org/W2897822515","doi":"https://doi.org/10.1109/ijcnn.2018.8489477","title":"Model-Free Reinforcement Learning for Fully Cooperative Multi-Agent Graphical Games","display_name":"Model-Free Reinforcement Learning for Fully Cooperative Multi-Agent Graphical Games","publication_year":2018,"publication_date":"2018-07-01","ids":{"openalex":"https://openalex.org/W2897822515","doi":"https://doi.org/10.1109/ijcnn.2018.8489477","mag":"2897822515"},"language":"en","primary_location":{"id":"doi:10.1109/ijcnn.2018.8489477","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ijcnn.2018.8489477","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2018 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5049454999","display_name":"Qichao Zhang","orcid":"https://orcid.org/0000-0001-9747-391X"},"institutions":[{"id":"https://openalex.org/I4210165038","display_name":"University of Chinese Academy of Sciences","ror":"https://ror.org/05qbk4x57","country_code":"CN","type":"education","lineage":["https://openalex.org/I19820366","https://openalex.org/I4210165038"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Qichao Zhang","raw_affiliation_strings":["University of Chinese Academy of Sciences, Beijing, China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Chinese Academy of Sciences, Beijing, China","institution_ids":["https://openalex.org/I4210165038"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5100624298","display_name":"Dongbin Zhao","orcid":"https://orcid.org/0000-0001-8218-9633"},"institutions":[{"id":"https://openalex.org/I4210165038","display_name":"University of Chinese Academy of Sciences","ror":"https://ror.org/05qbk4x57","country_code":"CN","type":"education","lineage":["https://openalex.org/I19820366","https://openalex.org/I4210165038"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Dongbin Zhao","raw_affiliation_strings":["University of Chinese Academy of Sciences, Beijing, China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Chinese Academy of Sciences, Beijing, China","institution_ids":["https://openalex.org/I4210165038"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5016137188","display_name":"Frank L. Lewis","orcid":"https://orcid.org/0000-0003-4074-1615"},"institutions":[{"id":"https://openalex.org/I189196454","display_name":"The University of Texas at Arlington","ror":"https://ror.org/019kgqr73","country_code":"US","type":"education","lineage":["https://openalex.org/I189196454"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Frank L. Lewis","raw_affiliation_strings":["UTA Research Institute, The University of Texas at Arlington, TX, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"UTA Research Institute, The University of Texas at Arlington, TX, USA","institution_ids":["https://openalex.org/I189196454"]}]}],"institutions":[],"countries_distinct_count":2,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":16,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"6"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9983000159263611,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10040","display_name":"Adaptive Control of Nonlinear Systems","score":0.9537000060081482,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8272697329521179},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7561988830566406},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.6212754845619202},{"id":"https://openalex.org/keywords/scheme","display_name":"Scheme (mathematics)","score":0.5462023019790649},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.5347586870193481},{"id":"https://openalex.org/keywords/bellman-equation","display_name":"Bellman equation","score":0.5274227857589722},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.4609987735748291},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.45744746923446655},{"id":"https://openalex.org/keywords/optimal-control","display_name":"Optimal control","score":0.45157307386398315},{"id":"https://openalex.org/keywords/multi-agent-system","display_name":"Multi-agent system","score":0.442748486995697},{"id":"https://openalex.org/keywords/mathematical-optimization","display_name":"Mathematical optimization","score":0.4164234697818756},{"id":"https://openalex.org/keywords/distributed-computing","display_name":"Distributed computing","score":0.38464125990867615},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.3780735433101654},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.09257251024246216}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8272697329521179},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7561988830566406},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.6212754845619202},{"id":"https://openalex.org/C77618280","wikidata":"https://www.wikidata.org/wiki/Q1155772","display_name":"Scheme (mathematics)","level":2,"score":0.5462023019790649},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.5347586870193481},{"id":"https://openalex.org/C14646407","wikidata":"https://www.wikidata.org/wiki/Q1430750","display_name":"Bellman equation","level":2,"score":0.5274227857589722},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.4609987735748291},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.45744746923446655},{"id":"https://openalex.org/C91575142","wikidata":"https://www.wikidata.org/wiki/Q1971426","display_name":"Optimal control","level":2,"score":0.45157307386398315},{"id":"https://openalex.org/C41550386","wikidata":"https://www.wikidata.org/wiki/Q529909","display_name":"Multi-agent system","level":2,"score":0.442748486995697},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.4164234697818756},{"id":"https://openalex.org/C120314980","wikidata":"https://www.wikidata.org/wiki/Q180634","display_name":"Distributed computing","level":1,"score":0.38464125990867615},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3780735433101654},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.09257251024246216},{"id":"https://openalex.org/C86803240","wikidata":"https://www.wikidata.org/wiki/Q420","display_name":"Biology","level":0,"score":0.0},{"id":"https://openalex.org/C134306372","wikidata":"https://www.wikidata.org/wiki/Q7754","display_name":"Mathematical analysis","level":1,"score":0.0},{"id":"https://openalex.org/C78458016","wikidata":"https://www.wikidata.org/wiki/Q840400","display_name":"Evolutionary biology","level":1,"score":0.0},{"id":"https://openalex.org/C111919701","wikidata":"https://www.wikidata.org/wiki/Q9135","display_name":"Operating system","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/ijcnn.2018.8489477","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ijcnn.2018.8489477","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2018 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":25,"referenced_works":["https://openalex.org/W1614417283","https://openalex.org/W2024303516","https://openalex.org/W2107726111","https://openalex.org/W2108383324","https://openalex.org/W2131363581","https://openalex.org/W2145339207","https://openalex.org/W2173248099","https://openalex.org/W2292533394","https://openalex.org/W2395575420","https://openalex.org/W2405379562","https://openalex.org/W2430619152","https://openalex.org/W2586495351","https://openalex.org/W2588283865","https://openalex.org/W2606378794","https://openalex.org/W2768629321","https://openalex.org/W2785556016","https://openalex.org/W2963000099","https://openalex.org/W2963407617","https://openalex.org/W2963864421","https://openalex.org/W2964338167","https://openalex.org/W4299802797","https://openalex.org/W6684921986","https://openalex.org/W6712181171","https://openalex.org/W6713411898","https://openalex.org/W6738796088"],"related_works":["https://openalex.org/W2386410636","https://openalex.org/W3038962357","https://openalex.org/W2025663273","https://openalex.org/W3099153698","https://openalex.org/W1859185863","https://openalex.org/W4307691181","https://openalex.org/W4285537323","https://openalex.org/W1932159282","https://openalex.org/W2964126589","https://openalex.org/W3016225735"],"abstract_inverted_index":{"In":[0],"this":[1],"paper,":[2],"the":[3,9,28,31,35,50,56,62,66,69,76,81,85,88,97,108,117,120,125,132,138,142,154,157],"optimal":[4,51,133,139],"coordinated":[5],"control":[6,52,109],"problem":[7],"for":[8,75,103,141],"homogeneous":[10],"multi-agent":[11],"graphical":[12,144],"games":[13],"with":[14,124],"completely":[15],"unknown":[16],"dynamics":[17],"is":[18,24,46,59,73,92,101,150],"investigated.":[19],"The":[20,43],"off-policy":[21],"reinforcement":[22],"learning":[23],"proposed":[25,158],"to":[26,48,106,130,152],"approach":[27,131],"solution":[29],"of":[30,37,156],"Hamilton-Jacobi":[32],"equation":[33],"under":[34],"framework":[36],"centralized":[38,60,89,134],"training":[39,82],"and":[40,68,95,137],"decentralized":[41],"execution.":[42],"actor-critic":[44,126],"structure":[45,127],"adopted":[47,74],"learn":[49],"policies.":[53],"Note":[54],"that":[55],"critic":[57,90],"network":[58,79,91,100,122],"using":[61],"information":[63],"from":[64],"all":[65],"agents,":[67],"parameter":[70],"sharing":[71],"scheme":[72],"single":[77],"actor":[78,99],"during":[80],"process.":[83],"For":[84,116],"execution":[86],"process,":[87],"not":[93],"required,":[94],"only":[96],"trained":[98],"used":[102],"each":[104],"agent":[105],"obtain":[107],"input":[110],"based":[111],"on":[112],"its":[113],"individual":[114],"observation.":[115],"implementation":[118],"purpose,":[119],"neural":[121],"approximators":[123],"are":[128],"constructed":[129],"value":[135],"function":[136],"policies":[140],"multiagent":[143],"games.":[145],"Finally,":[146],"a":[147],"simulation":[148],"example":[149],"provided":[151],"demonstrate":[153],"effectiveness":[155],"algorithm.":[159]},"counts_by_year":[{"year":2025,"cited_by_count":1},{"year":2023,"cited_by_count":1},{"year":2022,"cited_by_count":2},{"year":2021,"cited_by_count":4},{"year":2020,"cited_by_count":2},{"year":2019,"cited_by_count":6}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
