{"id":"https://openalex.org/W4382935738","doi":"https://doi.org/10.23919/acc55779.2023.10156236","title":"Federated reinforcement learning for generalizable motion planning","display_name":"Federated reinforcement learning for generalizable motion planning","publication_year":2023,"publication_date":"2023-05-31","ids":{"openalex":"https://openalex.org/W4382935738","doi":"https://doi.org/10.23919/acc55779.2023.10156236"},"language":"en","primary_location":{"id":"doi:10.23919/acc55779.2023.10156236","is_oa":false,"landing_page_url":"https://doi.org/10.23919/acc55779.2023.10156236","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2023 American Control Conference (ACC)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5045036436","display_name":"Zhenyuan Yuan","orcid":"https://orcid.org/0000-0001-6195-1481"},"institutions":[{"id":"https://openalex.org/I130769515","display_name":"Pennsylvania State University","ror":"https://ror.org/04p491231","country_code":"US","type":"education","lineage":["https://openalex.org/I130769515"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Zhenyuan Yuan","raw_affiliation_strings":["Pennsylvania State University,School of Electrical Engineering and Computer Science,USA,PA 16802"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Pennsylvania State University,School of Electrical Engineering and Computer Science,USA,PA 16802","institution_ids":["https://openalex.org/I130769515"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5101828020","display_name":"Siyuan Xu","orcid":"https://orcid.org/0000-0002-7999-9712"},"institutions":[{"id":"https://openalex.org/I130769515","display_name":"Pennsylvania State University","ror":"https://ror.org/04p491231","country_code":"US","type":"education","lineage":["https://openalex.org/I130769515"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Siyuan Xu","raw_affiliation_strings":["Pennsylvania State University,School of Electrical Engineering and Computer Science,USA,PA 16802"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Pennsylvania State University,School of Electrical Engineering and Computer Science,USA,PA 16802","institution_ids":["https://openalex.org/I130769515"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5101766328","display_name":"Minghui Zhu","orcid":"https://orcid.org/0000-0003-3879-7820"},"institutions":[{"id":"https://openalex.org/I130769515","display_name":"Pennsylvania State University","ror":"https://ror.org/04p491231","country_code":"US","type":"education","lineage":["https://openalex.org/I130769515"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Minghui Zhu","raw_affiliation_strings":["Pennsylvania State University,School of Electrical Engineering and Computer Science,USA,PA 16802"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Pennsylvania State University,School of Electrical Engineering and Computer Science,USA,PA 16802","institution_ids":["https://openalex.org/I130769515"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I130769515"],"apc_list":null,"apc_paid":null,"fwci":0.8712,"has_fulltext":false,"cited_by_count":4,"citation_normalized_percentile":{"value":0.73775803,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":90,"max":96},"biblio":{"volume":null,"issue":null,"first_page":"78","last_page":"83"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9994000196456909,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9994000196456909,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10249","display_name":"Distributed Control Multi-Agent Systems","score":0.9987999796867371,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.9954000115394592,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8293889760971069},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.8080466985702515},{"id":"https://openalex.org/keywords/generalization","display_name":"Generalization","score":0.7466637492179871},{"id":"https://openalex.org/keywords/upload","display_name":"Upload","score":0.7353243827819824},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.5554142594337463},{"id":"https://openalex.org/keywords/limiting","display_name":"Limiting","score":0.5455651879310608},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.5210599303245544},{"id":"https://openalex.org/keywords/sample","display_name":"Sample (material)","score":0.5054404735565186},{"id":"https://openalex.org/keywords/scheme","display_name":"Scheme (mathematics)","score":0.4836333990097046},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.3305925726890564},{"id":"https://openalex.org/keywords/world-wide-web","display_name":"World Wide Web","score":0.08899283409118652}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8293889760971069},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8080466985702515},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.7466637492179871},{"id":"https://openalex.org/C71901391","wikidata":"https://www.wikidata.org/wiki/Q7126699","display_name":"Upload","level":2,"score":0.7353243827819824},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.5554142594337463},{"id":"https://openalex.org/C188198153","wikidata":"https://www.wikidata.org/wiki/Q1613840","display_name":"Limiting","level":2,"score":0.5455651879310608},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.5210599303245544},{"id":"https://openalex.org/C198531522","wikidata":"https://www.wikidata.org/wiki/Q485146","display_name":"Sample (material)","level":2,"score":0.5054404735565186},{"id":"https://openalex.org/C77618280","wikidata":"https://www.wikidata.org/wiki/Q1155772","display_name":"Scheme (mathematics)","level":2,"score":0.4836333990097046},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3305925726890564},{"id":"https://openalex.org/C136764020","wikidata":"https://www.wikidata.org/wiki/Q466","display_name":"World Wide Web","level":1,"score":0.08899283409118652},{"id":"https://openalex.org/C127413603","wikidata":"https://www.wikidata.org/wiki/Q11023","display_name":"Engineering","level":0,"score":0.0},{"id":"https://openalex.org/C134306372","wikidata":"https://www.wikidata.org/wiki/Q7754","display_name":"Mathematical analysis","level":1,"score":0.0},{"id":"https://openalex.org/C78519656","wikidata":"https://www.wikidata.org/wiki/Q101333","display_name":"Mechanical engineering","level":1,"score":0.0},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.0},{"id":"https://openalex.org/C199360897","wikidata":"https://www.wikidata.org/wiki/Q9143","display_name":"Programming language","level":1,"score":0.0},{"id":"https://openalex.org/C43617362","wikidata":"https://www.wikidata.org/wiki/Q170050","display_name":"Chromatography","level":1,"score":0.0},{"id":"https://openalex.org/C185592680","wikidata":"https://www.wikidata.org/wiki/Q2329","display_name":"Chemistry","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.23919/acc55779.2023.10156236","is_oa":false,"landing_page_url":"https://doi.org/10.23919/acc55779.2023.10156236","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2023 American Control Conference (ACC)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":32,"referenced_works":["https://openalex.org/W1144593952","https://openalex.org/W1424654272","https://openalex.org/W1845972764","https://openalex.org/W1999156278","https://openalex.org/W2067461601","https://openalex.org/W2155007355","https://openalex.org/W2334313299","https://openalex.org/W2514372789","https://openalex.org/W2525788423","https://openalex.org/W2593841437","https://openalex.org/W2737223130","https://openalex.org/W2752041096","https://openalex.org/W2784146092","https://openalex.org/W2788115019","https://openalex.org/W2808177011","https://openalex.org/W2937697512","https://openalex.org/W2962822210","https://openalex.org/W2963470657","https://openalex.org/W2964257141","https://openalex.org/W3001538587","https://openalex.org/W3007384386","https://openalex.org/W3045604948","https://openalex.org/W3057525668","https://openalex.org/W3098201584","https://openalex.org/W4206686222","https://openalex.org/W4382935738","https://openalex.org/W6682262322","https://openalex.org/W6682849425","https://openalex.org/W6749032143","https://openalex.org/W6752254417","https://openalex.org/W6761231748","https://openalex.org/W6854459608"],"related_works":["https://openalex.org/W2944823289","https://openalex.org/W2003209439","https://openalex.org/W4321854979","https://openalex.org/W3037018281","https://openalex.org/W2358319515","https://openalex.org/W2972592048","https://openalex.org/W4312214821","https://openalex.org/W2497626292","https://openalex.org/W2390344072","https://openalex.org/W3089066832"],"abstract_inverted_index":{"This":[0],"paper":[1],"considers":[2],"the":[3,55,62,67,71,75,79,93,106,129],"problem":[4],"of":[5,19,32],"learning":[6,26,31],"a":[7,17,24,36],"control":[8,52,88],"policy":[9,53,77,89],"that":[10,28,91,105],"generalize":[11],"well":[12,121],"to":[13,61,78,111],"novel":[14],"environments":[15],"given":[16],"set":[18],"sample":[20],"environments.":[21],"We":[22],"develop":[23],"federated":[25],"framework":[27,108],"enables":[29],"collaborative":[30],"multiple":[33],"learners":[34,72],"and":[35,54,73,90,118],"centralized":[37],"server":[38,94],"without":[39],"sharing":[40],"their":[41],"raw":[42],"data.":[43],"In":[44],"each":[45,47],"iteration,":[46],"learner":[48,82],"uploads":[49],"its":[50,86],"local":[51,87],"corresponding":[56],"estimated":[57],"normalized":[58],"arrival":[59,116],"time":[60,117],"server,":[63],"which":[64],"then":[65,83],"computes":[66],"global":[68,125],"optimum":[69],"among":[70],"broadcasts":[74],"optimal":[76,126],"learners.":[80],"Each":[81],"selects":[84],"between":[85],"from":[92],"for":[95,137],"next":[96],"iteration.":[97],"By":[98],"leveraging":[99],"generalization":[100,113],"error,":[101],"our":[102],"analysis":[103],"shows":[104],"proposed":[107],"is":[109,135],"able":[110],"provide":[112],"guarantees":[114],"on":[115],"safety":[119],"as":[120,122],"consensus":[123],"at":[124],"value":[127],"in":[128],"limiting":[130],"case.":[131],"Monte":[132],"Carlo":[133],"simulation":[134],"conducted":[136],"evaluation.":[138]},"counts_by_year":[{"year":2025,"cited_by_count":2},{"year":2024,"cited_by_count":1},{"year":2023,"cited_by_count":1}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
