{"id":"https://openalex.org/W3012452733","doi":"https://doi.org/10.1109/cdc40024.2019.9030252","title":"Reinforcement Learning for Adaptive Periodic Linear Quadratic Control","display_name":"Reinforcement Learning for Adaptive Periodic Linear Quadratic Control","publication_year":2019,"publication_date":"2019-12-01","ids":{"openalex":"https://openalex.org/W3012452733","doi":"https://doi.org/10.1109/cdc40024.2019.9030252","mag":"3012452733"},"language":"en","primary_location":{"id":"doi:10.1109/cdc40024.2019.9030252","is_oa":false,"landing_page_url":"https://doi.org/10.1109/cdc40024.2019.9030252","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2019 IEEE 58th Conference on Decision and Control (CDC)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5058655480","display_name":"Bo Pang","orcid":"https://orcid.org/0000-0002-4359-2937"},"institutions":[{"id":"https://openalex.org/I57206974","display_name":"New York University","ror":"https://ror.org/0190ak572","country_code":"US","type":"education","lineage":["https://openalex.org/I57206974"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Bo Pang","raw_affiliation_strings":["Control and Networks Lab, Department of Electrical and Computer Engineering, Tandon School of Engineering, New York University, Brooklyn, NY, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Control and Networks Lab, Department of Electrical and Computer Engineering, Tandon School of Engineering, New York University, Brooklyn, NY, USA","institution_ids":["https://openalex.org/I57206974"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5067046312","display_name":"Zhong\u2010Ping Jiang","orcid":"https://orcid.org/0000-0002-4868-9359"},"institutions":[{"id":"https://openalex.org/I57206974","display_name":"New York University","ror":"https://ror.org/0190ak572","country_code":"US","type":"education","lineage":["https://openalex.org/I57206974"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Zhong-Ping Jiang","raw_affiliation_strings":["Control and Networks Lab, Department of Electrical and Computer Engineering, Tandon School of Engineering, New York University, Brooklyn, NY, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Control and Networks Lab, Department of Electrical and Computer Engineering, Tandon School of Engineering, New York University, Brooklyn, NY, USA","institution_ids":["https://openalex.org/I57206974"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5017329457","display_name":"Iven Mareels","orcid":"https://orcid.org/0000-0002-9832-5959"},"institutions":[{"id":"https://openalex.org/I4210120068","display_name":"IBM Research - Australia","ror":"https://ror.org/027r3nx49","country_code":"AU","type":"facility","lineage":["https://openalex.org/I1341412227","https://openalex.org/I4210114115","https://openalex.org/I4210120068"]}],"countries":["AU"],"is_corresponding":false,"raw_author_name":"Iven Mareels","raw_affiliation_strings":["IBM Research - Australia, Melbourne, Vic, Australia"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"IBM Research - Australia, Melbourne, Vic, Australia","institution_ids":["https://openalex.org/I4210120068"]}]}],"institutions":[],"countries_distinct_count":2,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":3,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"3322","last_page":"3327"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.9994000196456909,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.9994000196456909,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9900000095367432,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10791","display_name":"Advanced Control Systems Optimization","score":0.987500011920929,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8688902854919434},{"id":"https://openalex.org/keywords/lossy-compression","display_name":"Lossy compression","score":0.6514378190040588},{"id":"https://openalex.org/keywords/dynamic-programming","display_name":"Dynamic programming","score":0.6479237079620361},{"id":"https://openalex.org/keywords/optimal-control","display_name":"Optimal control","score":0.5860208868980408},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.5732851028442383},{"id":"https://openalex.org/keywords/control-theory","display_name":"Control theory (sociology)","score":0.5202451944351196},{"id":"https://openalex.org/keywords/adaptive-control","display_name":"Adaptive control","score":0.51255202293396},{"id":"https://openalex.org/keywords/bellman-equation","display_name":"Bellman equation","score":0.49239838123321533},{"id":"https://openalex.org/keywords/mathematical-optimization","display_name":"Mathematical optimization","score":0.472332626581192},{"id":"https://openalex.org/keywords/linear-quadratic-regulator","display_name":"Linear-quadratic regulator","score":0.45414990186691284},{"id":"https://openalex.org/keywords/state","display_name":"State (computer science)","score":0.42454713582992554},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.3031255006790161},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.2852070927619934},{"id":"https://openalex.org/keywords/algorithm","display_name":"Algorithm","score":0.27841371297836304},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.1569294035434723}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8688902854919434},{"id":"https://openalex.org/C165021410","wikidata":"https://www.wikidata.org/wiki/Q55564","display_name":"Lossy compression","level":2,"score":0.6514378190040588},{"id":"https://openalex.org/C37404715","wikidata":"https://www.wikidata.org/wiki/Q380679","display_name":"Dynamic programming","level":2,"score":0.6479237079620361},{"id":"https://openalex.org/C91575142","wikidata":"https://www.wikidata.org/wiki/Q1971426","display_name":"Optimal control","level":2,"score":0.5860208868980408},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5732851028442383},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.5202451944351196},{"id":"https://openalex.org/C107464732","wikidata":"https://www.wikidata.org/wiki/Q235781","display_name":"Adaptive control","level":3,"score":0.51255202293396},{"id":"https://openalex.org/C14646407","wikidata":"https://www.wikidata.org/wiki/Q1430750","display_name":"Bellman equation","level":2,"score":0.49239838123321533},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.472332626581192},{"id":"https://openalex.org/C98779006","wikidata":"https://www.wikidata.org/wiki/Q2520550","display_name":"Linear-quadratic regulator","level":3,"score":0.45414990186691284},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.42454713582992554},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.3031255006790161},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2852070927619934},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.27841371297836304},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.1569294035434723}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/cdc40024.2019.9030252","is_oa":false,"landing_page_url":"https://doi.org/10.1109/cdc40024.2019.9030252","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2019 IEEE 58th Conference on Decision and Control (CDC)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":25,"referenced_works":["https://openalex.org/W41554520","https://openalex.org/W43261302","https://openalex.org/W197349956","https://openalex.org/W284420941","https://openalex.org/W560518094","https://openalex.org/W1578747665","https://openalex.org/W1973713785","https://openalex.org/W2068257363","https://openalex.org/W2098034501","https://openalex.org/W2110118704","https://openalex.org/W2147371848","https://openalex.org/W2150259647","https://openalex.org/W2171492457","https://openalex.org/W2467518411","https://openalex.org/W2595897327","https://openalex.org/W2628293824","https://openalex.org/W2897661175","https://openalex.org/W2911308665","https://openalex.org/W2911668038","https://openalex.org/W2914054366","https://openalex.org/W3016893731","https://openalex.org/W4301419299","https://openalex.org/W4301886962","https://openalex.org/W6634701477","https://openalex.org/W6759005142"],"related_works":["https://openalex.org/W4255265352","https://openalex.org/W4239477580","https://openalex.org/W4285537323","https://openalex.org/W1932159282","https://openalex.org/W2090698372","https://openalex.org/W4383890581","https://openalex.org/W2965004901","https://openalex.org/W2921905705","https://openalex.org/W4233178034","https://openalex.org/W2003293420"],"abstract_inverted_index":{"This":[0],"paper":[1],"presents":[2],"a":[3],"first":[4],"solution":[5],"to":[6,28,32,62],"the":[7,37,49,72,76,85,91],"problem":[8],"of":[9,79,84],"adaptive":[10,21],"LQR":[11],"for":[12],"continuous-time":[13],"linear":[14],"periodic":[15],"systems.":[16],"Specifically,":[17],"reinforcement":[18],"learning":[19],"and":[20,41,55],"dynamic":[22],"programming":[23],"(ADP)":[24],"techniques":[25],"are":[26,46,60],"used":[27],"develop":[29],"two":[30],"algorithms":[31,59,87],"obtain":[33],"near-optimal":[34,64],"controllers.":[35],"Firstly,":[36],"policy":[38],"iteration":[39,43],"(PI)":[40],"value":[42],"(VI)":[44],"methods":[45],"proposed":[47],"when":[48],"model":[50],"is":[51,88],"known.":[52],"Then,":[53],"PI-based":[54],"VI-based":[56],"off-policy":[57],"ADP":[58],"derived":[61,86],"find":[63],"solutions":[65],"directly":[66],"from":[67],"input/state":[68],"data":[69],"collected":[70],"along":[71],"system":[73,80],"trajectories,":[74],"without":[75],"exact":[77],"knowledge":[78],"dynamics.":[81],"The":[82],"effectiveness":[83],"validated":[89],"using":[90],"well-known":[92],"lossy":[93],"Mathieu":[94],"equation.":[95]},"counts_by_year":[{"year":2025,"cited_by_count":1},{"year":2024,"cited_by_count":1},{"year":2023,"cited_by_count":1}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
