{"id":"https://openalex.org/W4405778663","doi":"https://doi.org/10.1109/iros58592.2024.10802433","title":"Distilling Reinforcement Learning Policies for Interpretable Robot Locomotion: Gradient Boosting Machines and Symbolic Regression","display_name":"Distilling Reinforcement Learning Policies for Interpretable Robot Locomotion: Gradient Boosting Machines and Symbolic Regression","publication_year":2024,"publication_date":"2024-10-14","ids":{"openalex":"https://openalex.org/W4405778663","doi":"https://doi.org/10.1109/iros58592.2024.10802433"},"language":"en","primary_location":{"id":"doi:10.1109/iros58592.2024.10802433","is_oa":false,"landing_page_url":"https://doi.org/10.1109/iros58592.2024.10802433","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5088594797","display_name":"Fernando Acero","orcid":"https://orcid.org/0000-0002-5470-8122"},"institutions":[{"id":"https://openalex.org/I45129253","display_name":"University College London","ror":"https://ror.org/02jx3x895","country_code":"GB","type":"education","lineage":["https://openalex.org/I124357947","https://openalex.org/I45129253"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Fernando Acero","raw_affiliation_strings":["University College London,Department of Computer Science"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University College London,Department of Computer Science","institution_ids":["https://openalex.org/I45129253"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5100351560","display_name":"Zhibin Li","orcid":"https://orcid.org/0000-0002-6357-7419"},"institutions":[{"id":"https://openalex.org/I45129253","display_name":"University College London","ror":"https://ror.org/02jx3x895","country_code":"GB","type":"education","lineage":["https://openalex.org/I124357947","https://openalex.org/I45129253"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Zhibin Li","raw_affiliation_strings":["University College London,Department of Computer Science"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University College London,Department of Computer Science","institution_ids":["https://openalex.org/I45129253"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I45129253"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"6840","last_page":"6847"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9000999927520752,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9000999927520752,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/gradient-boosting","display_name":"Gradient boosting","score":0.7707614898681641},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.751933753490448},{"id":"https://openalex.org/keywords/boosting","display_name":"Boosting (machine learning)","score":0.7325224876403809},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.66631019115448},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.6439907550811768},{"id":"https://openalex.org/keywords/robot","display_name":"Robot","score":0.6226621270179749},{"id":"https://openalex.org/keywords/regression","display_name":"Regression","score":0.5518065094947815},{"id":"https://openalex.org/keywords/machine-learning","display_name":"Machine learning","score":0.549789547920227},{"id":"https://openalex.org/keywords/regression-analysis","display_name":"Regression analysis","score":0.42839592695236206},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.17958897352218628},{"id":"https://openalex.org/keywords/statistics","display_name":"Statistics","score":0.15559512376785278},{"id":"https://openalex.org/keywords/random-forest","display_name":"Random forest","score":0.12004151940345764}],"concepts":[{"id":"https://openalex.org/C70153297","wikidata":"https://www.wikidata.org/wiki/Q5591907","display_name":"Gradient boosting","level":3,"score":0.7707614898681641},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.751933753490448},{"id":"https://openalex.org/C46686674","wikidata":"https://www.wikidata.org/wiki/Q466303","display_name":"Boosting (machine learning)","level":2,"score":0.7325224876403809},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.66631019115448},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6439907550811768},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.6226621270179749},{"id":"https://openalex.org/C83546350","wikidata":"https://www.wikidata.org/wiki/Q1139051","display_name":"Regression","level":2,"score":0.5518065094947815},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.549789547920227},{"id":"https://openalex.org/C152877465","wikidata":"https://www.wikidata.org/wiki/Q208042","display_name":"Regression analysis","level":2,"score":0.42839592695236206},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.17958897352218628},{"id":"https://openalex.org/C105795698","wikidata":"https://www.wikidata.org/wiki/Q12483","display_name":"Statistics","level":1,"score":0.15559512376785278},{"id":"https://openalex.org/C169258074","wikidata":"https://www.wikidata.org/wiki/Q245748","display_name":"Random forest","level":2,"score":0.12004151940345764}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/iros58592.2024.10802433","is_oa":false,"landing_page_url":"https://doi.org/10.1109/iros58592.2024.10802433","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":32,"referenced_works":["https://openalex.org/W1678356000","https://openalex.org/W2101234009","https://openalex.org/W2139053308","https://openalex.org/W2149033360","https://openalex.org/W2166163519","https://openalex.org/W2995523160","https://openalex.org/W3003997138","https://openalex.org/W3039737909","https://openalex.org/W3044916305","https://openalex.org/W3093922502","https://openalex.org/W3111294788","https://openalex.org/W3123767929","https://openalex.org/W3154414473","https://openalex.org/W3204240397","https://openalex.org/W4205430897","https://openalex.org/W4210659164","https://openalex.org/W4224225023","https://openalex.org/W4225533190","https://openalex.org/W4308092268","https://openalex.org/W4383108196","https://openalex.org/W4386026190","https://openalex.org/W4386193536","https://openalex.org/W4386499064","https://openalex.org/W4388216531","https://openalex.org/W4389666607","https://openalex.org/W4399176222","https://openalex.org/W6640174482","https://openalex.org/W6741002519","https://openalex.org/W6751437432","https://openalex.org/W6767857164","https://openalex.org/W6800032015","https://openalex.org/W6852384925"],"related_works":["https://openalex.org/W2967733078","https://openalex.org/W3204430031","https://openalex.org/W3137904399","https://openalex.org/W4310492845","https://openalex.org/W2885778889","https://openalex.org/W4310224730","https://openalex.org/W2766514146","https://openalex.org/W4289703016","https://openalex.org/W2885516856","https://openalex.org/W3094138326"],"abstract_inverted_index":{"Recent":[0],"advancements":[1],"in":[2,11,33,178],"reinforcement":[3],"learning":[4],"(RL)":[5],"have":[6],"led":[7],"to":[8,48,127,147],"remarkable":[9],"achievements":[10],"robot":[12,161],"locomotion":[13,162],"capabilities.":[14],"However,":[15],"the":[16,71,117,129,173,213],"complexity":[17],"and":[18,29,40,66,80,102,111,144,168,171,198],"\"black-box\"":[19],"nature":[20],"of":[21,38,74,122,137,140,151,175,195,206],"neural":[22,50,86,97,189],"network-based":[23],"RL":[24,51,101],"policies":[25,52,88,99,183,191,201],"hinder":[26],"their":[27],"interpretability":[28,73],"broader":[30],"acceptance,":[31],"particularly":[32],"applications":[34],"demanding":[35],"high":[36],"levels":[37],"safety":[39],"reliability.":[41],"This":[42],"paper":[43],"introduces":[44],"a":[45,135],"novel":[46],"approach":[47,158],"distill":[49,104,199],"into":[53,89,106],"more":[54,90],"interpretable":[55,200],"forms":[56],"using":[57,100,184,212],"Gradient":[58],"Boosting":[59,63],"Machines":[60,64],"(GBMs),":[61],"Explainable":[62],"(EBMs)":[65],"Symbolic":[67],"Regression.":[68],"By":[69],"leveraging":[70],"inherent":[72,118],"generalized":[75],"additive":[76],"models,":[77],"decision":[78],"trees,":[79],"analytical":[81],"expressions,":[82],"we":[83,125],"transform":[84],"opaque":[85],"network":[87,98],"transparent":[91],"\"glass-box\"":[92],"models.":[93],"We":[94,155,187],"train":[95,188],"expert":[96,143,190],"subsequently":[103],"them":[105],"(i)":[107],"GBMs,":[108],"(ii)":[109],"EBMs,":[110],"(iii)":[112],"symbolic":[113],"policies.":[114,154],"To":[115],"address":[116],"distribution":[119],"shift":[120],"challenge":[121],"behavioral":[123],"cloning,":[124],"propose":[126],"use":[128],"Dataset":[130],"Aggregation":[131],"(DAgger)":[132],"algorithm":[133],"with":[134,202],"curriculum":[136],"episode-dependent":[138],"alternation":[139],"actions":[141,180],"between":[142],"distilled":[145,182],"policies,":[146],"enable":[148],"efficient":[149],"distillation":[150],"feedback":[152],"control":[153],"evaluate":[156],"our":[157],"on":[159],"various":[160,185],"gaits":[163],"\u2013":[164,170],"walking,":[165],"trotting,":[166],"bounding,":[167],"pacing":[169],"study":[172],"importance":[174],"different":[176],"observations":[177],"joint":[179],"for":[181,192,209],"methods.":[186],"205":[193],"hours":[194],"simulated":[196,207],"experience":[197],"only":[203],"10":[204],"minutes":[205],"interaction":[208],"each":[210],"gait":[211],"proposed":[214],"method.":[215]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
