{"id":"https://openalex.org/W2569146624","doi":"https://doi.org/10.1109/humanoids.2016.7803345","title":"Kernel dynamic policy programming: Practical reinforcement learning for high-dimensional robots","display_name":"Kernel dynamic policy programming: Practical reinforcement learning for high-dimensional robots","publication_year":2016,"publication_date":"2016-11-01","ids":{"openalex":"https://openalex.org/W2569146624","doi":"https://doi.org/10.1109/humanoids.2016.7803345","mag":"2569146624"},"language":"en","primary_location":{"id":"doi:10.1109/humanoids.2016.7803345","is_oa":false,"landing_page_url":"https://doi.org/10.1109/humanoids.2016.7803345","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2016 IEEE-RAS 16th International Conference on Humanoid Robots (Humanoids)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5011048472","display_name":"Yunduan Cui","orcid":"https://orcid.org/0000-0001-5539-4260"},"institutions":[{"id":"https://openalex.org/I60054993","display_name":"Graphic Era University","ror":"https://ror.org/03wqgqd89","country_code":"IN","type":"education","lineage":["https://openalex.org/I60054993"]}],"countries":["IN"],"is_corresponding":false,"raw_author_name":"Yunduan Cui","raw_affiliation_strings":["Department of Electronics & Communication Engineering, Graphic Era Hill University, Bhimtal, Uttarakhand, India"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Electronics & Communication Engineering, Graphic Era Hill University, Bhimtal, Uttarakhand, India","institution_ids":["https://openalex.org/I60054993"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5042074952","display_name":"Takamitsu Matsubara","orcid":"https://orcid.org/0000-0003-3545-4814"},"institutions":[{"id":"https://openalex.org/I60054993","display_name":"Graphic Era University","ror":"https://ror.org/03wqgqd89","country_code":"IN","type":"education","lineage":["https://openalex.org/I60054993"]}],"countries":["IN"],"is_corresponding":false,"raw_author_name":"Takamitsu Matsubara","raw_affiliation_strings":["Department of Electronics & Communication Engineering, Graphic Era University, Dehradun, Uttarakhand, India"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Electronics & Communication Engineering, Graphic Era University, Dehradun, Uttarakhand, India","institution_ids":["https://openalex.org/I60054993"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5087612281","display_name":"Kenji Sugimoto","orcid":"https://orcid.org/0000-0002-5149-5643"},"institutions":[{"id":"https://openalex.org/I60054993","display_name":"Graphic Era University","ror":"https://ror.org/03wqgqd89","country_code":"IN","type":"education","lineage":["https://openalex.org/I60054993"]}],"countries":["IN"],"is_corresponding":false,"raw_author_name":"Kenji Sugimoto","raw_affiliation_strings":["Department of Electrical Engineering, Graphic Era University, Dehradun, Uttarakhand, India"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Electrical Engineering, Graphic Era University, Dehradun, Uttarakhand, India","institution_ids":["https://openalex.org/I60054993"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I60054993"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":7,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"662","last_page":"667"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9987000226974487,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9987000226974487,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11663","display_name":"Viral Infectious Diseases and Gene Expression in Insects","score":0.9871000051498413,"subfield":{"id":"https://openalex.org/subfields/1312","display_name":"Molecular Biology"},"field":{"id":"https://openalex.org/fields/13","display_name":"Biochemistry, Genetics and Molecular Biology"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},{"id":"https://openalex.org/T10784","display_name":"Muscle activation and electromyography studies","score":0.9800999760627747,"subfield":{"id":"https://openalex.org/subfields/2204","display_name":"Biomedical Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8116617202758789},{"id":"https://openalex.org/keywords/bellman-equation","display_name":"Bellman equation","score":0.7561309337615967},{"id":"https://openalex.org/keywords/function-approximation","display_name":"Function approximation","score":0.6358303427696228},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.6319936513900757},{"id":"https://openalex.org/keywords/q-learning","display_name":"Q-learning","score":0.5474094748497009},{"id":"https://openalex.org/keywords/dynamic-programming","display_name":"Dynamic programming","score":0.5248282551765442},{"id":"https://openalex.org/keywords/state-space","display_name":"State space","score":0.5182073712348938},{"id":"https://openalex.org/keywords/mathematical-optimization","display_name":"Mathematical optimization","score":0.5091454386711121},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.48857054114341736},{"id":"https://openalex.org/keywords/regularization","display_name":"Regularization (linguistics)","score":0.4542759358882904},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.45137232542037964},{"id":"https://openalex.org/keywords/kernel","display_name":"Kernel (algebra)","score":0.42305970191955566},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.4225269854068756},{"id":"https://openalex.org/keywords/robot","display_name":"Robot","score":0.42007723450660706},{"id":"https://openalex.org/keywords/algorithm","display_name":"Algorithm","score":0.2631930708885193},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.22637465596199036},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.15269917249679565},{"id":"https://openalex.org/keywords/markov-process","display_name":"Markov process","score":0.12513872981071472}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8116617202758789},{"id":"https://openalex.org/C14646407","wikidata":"https://www.wikidata.org/wiki/Q1430750","display_name":"Bellman equation","level":2,"score":0.7561309337615967},{"id":"https://openalex.org/C91873725","wikidata":"https://www.wikidata.org/wiki/Q3445816","display_name":"Function approximation","level":3,"score":0.6358303427696228},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6319936513900757},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.5474094748497009},{"id":"https://openalex.org/C37404715","wikidata":"https://www.wikidata.org/wiki/Q380679","display_name":"Dynamic programming","level":2,"score":0.5248282551765442},{"id":"https://openalex.org/C72434380","wikidata":"https://www.wikidata.org/wiki/Q230930","display_name":"State space","level":2,"score":0.5182073712348938},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.5091454386711121},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.48857054114341736},{"id":"https://openalex.org/C2776135515","wikidata":"https://www.wikidata.org/wiki/Q17143721","display_name":"Regularization (linguistics)","level":2,"score":0.4542759358882904},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.45137232542037964},{"id":"https://openalex.org/C74193536","wikidata":"https://www.wikidata.org/wiki/Q574844","display_name":"Kernel (algebra)","level":2,"score":0.42305970191955566},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.4225269854068756},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.42007723450660706},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.2631930708885193},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.22637465596199036},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.15269917249679565},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.12513872981071472},{"id":"https://openalex.org/C114614502","wikidata":"https://www.wikidata.org/wiki/Q76592","display_name":"Combinatorics","level":1,"score":0.0},{"id":"https://openalex.org/C78458016","wikidata":"https://www.wikidata.org/wiki/Q840400","display_name":"Evolutionary biology","level":1,"score":0.0},{"id":"https://openalex.org/C105795698","wikidata":"https://www.wikidata.org/wiki/Q12483","display_name":"Statistics","level":1,"score":0.0},{"id":"https://openalex.org/C86803240","wikidata":"https://www.wikidata.org/wiki/Q420","display_name":"Biology","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/humanoids.2016.7803345","is_oa":false,"landing_page_url":"https://doi.org/10.1109/humanoids.2016.7803345","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2016 IEEE-RAS 16th International Conference on Humanoid Robots (Humanoids)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"score":0.4000000059604645,"display_name":"Decent work and economic growth","id":"https://metadata.un.org/sdg/8"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":29,"referenced_works":["https://openalex.org/W32403112","https://openalex.org/W211888945","https://openalex.org/W215298514","https://openalex.org/W314779054","https://openalex.org/W1499669280","https://openalex.org/W1502922572","https://openalex.org/W1510073064","https://openalex.org/W1746819321","https://openalex.org/W1755117326","https://openalex.org/W1976207411","https://openalex.org/W1977655452","https://openalex.org/W2051620263","https://openalex.org/W2118556122","https://openalex.org/W2121863487","https://openalex.org/W2126909264","https://openalex.org/W2130179125","https://openalex.org/W2147839652","https://openalex.org/W2221816161","https://openalex.org/W2586680856","https://openalex.org/W2962901215","https://openalex.org/W4211049957","https://openalex.org/W4214717370","https://openalex.org/W4285719527","https://openalex.org/W6608631664","https://openalex.org/W6608635065","https://openalex.org/W6629881138","https://openalex.org/W6637962894","https://openalex.org/W6679486095","https://openalex.org/W6682330108"],"related_works":["https://openalex.org/W4255265352","https://openalex.org/W4239477580","https://openalex.org/W4389475841","https://openalex.org/W2952594763","https://openalex.org/W2152670157","https://openalex.org/W2808418668","https://openalex.org/W2903299703","https://openalex.org/W4281791088","https://openalex.org/W4385342861","https://openalex.org/W1574958246"],"abstract_inverted_index":{"Applying":[0],"value":[1,18,27,38,72,106,121,142],"function":[2,19,28,39,73,98,107,122],"based":[3],"reinforcement":[4,144],"learning":[5,145],"algorithms":[6],"to":[7,103,147,157],"real":[8],"robots":[9],"has":[10],"been":[11],"infeasible":[12],"because":[13],"the":[14,88,105,116,120,149],"approximation":[15,29,40],"of":[16,24,37,135,151,182],"high-dimensional":[17,26,51,77],"is":[20,84,112],"difficult.":[21],"The":[22,80,109],"difficulty":[23],"such":[25],"in":[30,59,74,96,119,162],"previous":[31],"methods":[32,146],"are":[33],"twofold:":[34],"1)":[35],"instability":[36],"by":[41,86,114],"non-smooth":[42],"policy":[43,82],"update":[44,83],"and":[45,93,140,184],"2)":[46],"computational":[47,110,186],"complexity":[48,111],"associated":[49],"with":[50,56,174,179],"state-action":[52],"space.":[53,79],"To":[54],"cope":[55],"these":[57],"issues,":[58],"this":[60],"paper,":[61],"we":[62],"propose":[63],"Kernel":[64],"Dynamic":[65,136],"Policy":[66,137],"Programming":[67,138],"(KDPP)":[68],"that":[69],"smoothly":[70],"updates":[71],"an":[75],"implicit":[76],"feature":[78],"smooth":[81],"promoted":[85],"adding":[87],"Kullback-Leibler":[89],"divergence":[90],"between":[91],"current":[92],"updated":[94],"policies":[95],"reward":[97],"as":[99,129],"a":[100,130,163,172],"regularization":[101],"term":[102],"stabilize":[104],"approximation.":[108,123],"reduced":[113],"applying":[115],"kernel":[117],"trick":[118],"Therefore,":[124],"KDPP":[125,156],"can":[126],"be":[127],"interpreted":[128],"novel":[131],"yet":[132],"practical":[133],"extension":[134],"(DPP)":[139],"kernelized":[141],"function-based":[143],"combine":[148],"strengths":[150],"them.":[152],"We":[153],"successfully":[154],"applied":[155],"learn":[158],"unscrewing":[159],"bottle":[160],"cap":[161],"Pneumatic":[164],"Artificial":[165],"Muscles":[166],"(PAMs)":[167],"driven":[168],"humanoid":[169],"robot":[170],"hand,":[171],"system":[173],"24":[175],"dimensional":[176],"state":[177],"space,":[178],"limited":[180],"number":[181],"samples":[183],"commonplace":[185],"resource.":[187]},"counts_by_year":[{"year":2025,"cited_by_count":2},{"year":2024,"cited_by_count":1},{"year":2018,"cited_by_count":1},{"year":2017,"cited_by_count":3}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
