{"id":"https://openalex.org/W1979271707","doi":"https://doi.org/10.1109/ijcnn.2014.6889527","title":"A Kalman filter-based actor-critic learning approach","display_name":"A Kalman filter-based actor-critic learning approach","publication_year":2014,"publication_date":"2014-07-01","ids":{"openalex":"https://openalex.org/W1979271707","doi":"https://doi.org/10.1109/ijcnn.2014.6889527","mag":"1979271707"},"language":"en","primary_location":{"id":"doi:10.1109/ijcnn.2014.6889527","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ijcnn.2014.6889527","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2014 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5115604616","display_name":"Bin Wang","orcid":"https://orcid.org/0000-0002-0267-3749"},"institutions":[{"id":"https://openalex.org/I19820366","display_name":"Chinese Academy of Sciences","ror":"https://ror.org/034t30j35","country_code":"CN","type":"government","lineage":["https://openalex.org/I19820366"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Bin Wang","raw_affiliation_strings":["The State Key Laboratory of Management and Control for Complex Systems, Chinese Academy of Sciences, Beijing, China","State Key laboratory of Management and Control for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China#TAB#"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"The State Key Laboratory of Management and Control for Complex Systems, Chinese Academy of Sciences, Beijing, China","institution_ids":["https://openalex.org/I19820366"]},{"raw_affiliation_string":"State Key laboratory of Management and Control for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China#TAB#","institution_ids":["https://openalex.org/I19820366"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5100624298","display_name":"Dongbin Zhao","orcid":"https://orcid.org/0000-0001-8218-9633"},"institutions":[{"id":"https://openalex.org/I19820366","display_name":"Chinese Academy of Sciences","ror":"https://ror.org/034t30j35","country_code":"CN","type":"government","lineage":["https://openalex.org/I19820366"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Dongbin Zhao","raw_affiliation_strings":["The State Key Laboratory of Management and Control for Complex Systems, Chinese Academy of Sciences, Beijing, China","State Key laboratory of Management and Control for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China#TAB#"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"The State Key Laboratory of Management and Control for Complex Systems, Chinese Academy of Sciences, Beijing, China","institution_ids":["https://openalex.org/I19820366"]},{"raw_affiliation_string":"State Key laboratory of Management and Control for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China#TAB#","institution_ids":["https://openalex.org/I19820366"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I19820366"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":2,"citation_normalized_percentile":{"value":0.06955752,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":89,"max":94},"biblio":{"volume":"16","issue":null,"first_page":"3657","last_page":"3662"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.9997000098228455,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.9997000098228455,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9991999864578247,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10917","display_name":"Smart Grid Security and Resilience","score":0.977400004863739,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/kalman-filter","display_name":"Kalman filter","score":0.7516137957572937},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7490414977073669},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.665585458278656},{"id":"https://openalex.org/keywords/cerebellar-model-articulation-controller","display_name":"Cerebellar model articulation controller","score":0.6432946920394897},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.6349490284919739},{"id":"https://openalex.org/keywords/benchmark","display_name":"Benchmark (surveying)","score":0.5620208382606506},{"id":"https://openalex.org/keywords/extended-kalman-filter","display_name":"Extended Kalman filter","score":0.5315525531768799},{"id":"https://openalex.org/keywords/bellman-equation","display_name":"Bellman equation","score":0.4649442732334137},{"id":"https://openalex.org/keywords/control-theory","display_name":"Control theory (sociology)","score":0.45141106843948364},{"id":"https://openalex.org/keywords/alpha-beta-filter","display_name":"Alpha beta filter","score":0.44054684042930603},{"id":"https://openalex.org/keywords/state-space","display_name":"State space","score":0.4158231019973755},{"id":"https://openalex.org/keywords/fast-kalman-filter","display_name":"Fast Kalman filter","score":0.4125784635543823},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.4109702706336975},{"id":"https://openalex.org/keywords/algorithm","display_name":"Algorithm","score":0.39980730414390564},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.3899012804031372},{"id":"https://openalex.org/keywords/markov-process","display_name":"Markov process","score":0.36400648951530457},{"id":"https://openalex.org/keywords/machine-learning","display_name":"Machine learning","score":0.35477662086486816},{"id":"https://openalex.org/keywords/mathematical-optimization","display_name":"Mathematical optimization","score":0.2936214506626129},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.23949316143989563},{"id":"https://openalex.org/keywords/moving-horizon-estimation","display_name":"Moving horizon estimation","score":0.11412626504898071},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.09491756558418274}],"concepts":[{"id":"https://openalex.org/C157286648","wikidata":"https://www.wikidata.org/wiki/Q846780","display_name":"Kalman filter","level":2,"score":0.7516137957572937},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7490414977073669},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.665585458278656},{"id":"https://openalex.org/C2780576740","wikidata":"https://www.wikidata.org/wiki/Q5064071","display_name":"Cerebellar model articulation controller","level":3,"score":0.6432946920394897},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.6349490284919739},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.5620208382606506},{"id":"https://openalex.org/C206833254","wikidata":"https://www.wikidata.org/wiki/Q5421817","display_name":"Extended Kalman filter","level":3,"score":0.5315525531768799},{"id":"https://openalex.org/C14646407","wikidata":"https://www.wikidata.org/wiki/Q1430750","display_name":"Bellman equation","level":2,"score":0.4649442732334137},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.45141106843948364},{"id":"https://openalex.org/C11588082","wikidata":"https://www.wikidata.org/wiki/Q4735154","display_name":"Alpha beta filter","level":5,"score":0.44054684042930603},{"id":"https://openalex.org/C72434380","wikidata":"https://www.wikidata.org/wiki/Q230930","display_name":"State space","level":2,"score":0.4158231019973755},{"id":"https://openalex.org/C150679823","wikidata":"https://www.wikidata.org/wiki/Q5436946","display_name":"Fast Kalman filter","level":4,"score":0.4125784635543823},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4109702706336975},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.39980730414390564},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.3899012804031372},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.36400648951530457},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.35477662086486816},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.2936214506626129},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.23949316143989563},{"id":"https://openalex.org/C50050547","wikidata":"https://www.wikidata.org/wiki/Q6927137","display_name":"Moving horizon estimation","level":4,"score":0.11412626504898071},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.09491756558418274},{"id":"https://openalex.org/C13280743","wikidata":"https://www.wikidata.org/wiki/Q131089","display_name":"Geodesy","level":1,"score":0.0},{"id":"https://openalex.org/C105795698","wikidata":"https://www.wikidata.org/wiki/Q12483","display_name":"Statistics","level":1,"score":0.0},{"id":"https://openalex.org/C205649164","wikidata":"https://www.wikidata.org/wiki/Q1071","display_name":"Geography","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/ijcnn.2014.6889527","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ijcnn.2014.6889527","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2014 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","score":0.7699999809265137,"id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":32,"referenced_works":["https://openalex.org/W32403112","https://openalex.org/W109068864","https://openalex.org/W1536482800","https://openalex.org/W1626155273","https://openalex.org/W1974883306","https://openalex.org/W1993740947","https://openalex.org/W1999912147","https://openalex.org/W2016436679","https://openalex.org/W2035018355","https://openalex.org/W2046513829","https://openalex.org/W2062541405","https://openalex.org/W2105934661","https://openalex.org/W2118556122","https://openalex.org/W2132351269","https://openalex.org/W2134882417","https://openalex.org/W2141562047","https://openalex.org/W2145938889","https://openalex.org/W2156737235","https://openalex.org/W2158091072","https://openalex.org/W2158984235","https://openalex.org/W2160561608","https://openalex.org/W2165501837","https://openalex.org/W2953189830","https://openalex.org/W2963643858","https://openalex.org/W3041202696","https://openalex.org/W3139377883","https://openalex.org/W4214717370","https://openalex.org/W4242606736","https://openalex.org/W6631965157","https://openalex.org/W6658958466","https://openalex.org/W6677370284","https://openalex.org/W6683195989"],"related_works":["https://openalex.org/W2752451087","https://openalex.org/W2348123856","https://openalex.org/W2145874287","https://openalex.org/W2326815100","https://openalex.org/W3036780875","https://openalex.org/W2152670157","https://openalex.org/W2631353110","https://openalex.org/W2870890761","https://openalex.org/W2055884657","https://openalex.org/W2483158495"],"abstract_inverted_index":{"Kalman":[0,40,46,80],"fiter":[1],"is":[2,44,51,82,123],"an":[3],"efficient":[4,125],"way":[5],"to":[6,19,70,84,107],"estimate":[7,85],"the":[8,11,58,72,76,86,89,96,101,109,112,119],"parameters":[9],"of":[10,88,111],"value":[12,73],"function":[13,74,78],"in":[14,26,53],"reinforcement":[15,36],"learning.":[16],"In":[17],"order":[18],"solve":[20],"Markov":[21],"Decision":[22],"Process":[23],"(MDP)":[24],"problems":[25],"both":[27],"continuous":[28],"state":[29],"and":[30,75,100],"action":[31],"space,":[32],"a":[33],"new":[34],"online":[35],"learning":[37,50],"algorithm":[38,122],"using":[39],"filter":[41,81],"technique,":[42],"which":[43],"called":[45],"filter-based":[47],"actor-critic":[48],"(KAC)":[49],"proposed":[52,120],"this":[54],"paper.":[55],"To":[56],"implement":[57],"KAC":[59,113,121],"algorithm,":[60],"Cerebellar":[61],"Model":[62],"Articulation":[63],"Controller":[64],"(CMAC)":[65],"neural":[66],"networks":[67],"are":[68,105],"used":[69,83],"approximate":[71],"policy":[77],"respectively.":[79],"weights":[87],"critic":[90],"network.":[91],"Two":[92],"benchmark":[93],"problems,":[94],"namely":[95],"cart-pole":[97],"balancing":[98],"problem":[99,104],"acrobot":[102],"swing-up":[103],"provided":[106],"verify":[108],"effectiveness":[110],"approach.":[114],"Experimental":[115],"results":[116],"demonstrate":[117],"that":[118],"more":[124],"than":[126],"other":[127],"similar":[128],"algorithms.":[129]},"counts_by_year":[{"year":2020,"cited_by_count":1},{"year":2018,"cited_by_count":1}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
