{"id":"https://openalex.org/W4391529362","doi":"https://doi.org/10.1007/s10994-023-06503-w","title":"Goal exploration augmentation via pre-trained skills for sparse-reward long-horizon goal-conditioned reinforcement learning","display_name":"Goal exploration augmentation via pre-trained skills for sparse-reward long-horizon goal-conditioned reinforcement learning","publication_year":2024,"publication_date":"2024-02-05","ids":{"openalex":"https://openalex.org/W4391529362","doi":"https://doi.org/10.1007/s10994-023-06503-w"},"language":"en","primary_location":{"id":"doi:10.1007/s10994-023-06503-w","is_oa":true,"landing_page_url":"https://doi.org/10.1007/s10994-023-06503-w","pdf_url":"https://link.springer.com/content/pdf/10.1007/s10994-023-06503-w.pdf","source":{"id":"https://openalex.org/S62148650","display_name":"Machine Learning","issn_l":"0885-6125","issn":["0885-6125","1573-0565"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319900","host_organization_name":"Springer Science+Business Media","host_organization_lineage":["https://openalex.org/P4310319900","https://openalex.org/P4310319965"],"host_organization_lineage_names":["Springer Science+Business Media","Springer Nature"],"type":"journal"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Machine Learning","raw_type":"journal-article"},"type":"article","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"hybrid","oa_url":"https://link.springer.com/content/pdf/10.1007/s10994-023-06503-w.pdf","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5021523346","display_name":"Lisheng Wu","orcid":null},"institutions":[{"id":"https://openalex.org/I28407311","display_name":"University of Manchester","ror":"https://ror.org/027m9bs27","country_code":"GB","type":"education","lineage":["https://openalex.org/I28407311"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Lisheng Wu","raw_affiliation_strings":["Department of Computer Science, University of Manchester, Manchester, M13 9PL, UK"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Computer Science, University of Manchester, Manchester, M13 9PL, UK","institution_ids":["https://openalex.org/I28407311"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5100451984","display_name":"Ke Chen","orcid":"https://orcid.org/0000-0001-9457-9364"},"institutions":[{"id":"https://openalex.org/I28407311","display_name":"University of Manchester","ror":"https://ror.org/027m9bs27","country_code":"GB","type":"education","lineage":["https://openalex.org/I28407311"]}],"countries":["GB"],"is_corresponding":true,"raw_author_name":"Ke Chen","raw_affiliation_strings":["Department of Computer Science, University of Manchester, Manchester, M13 9PL, UK"],"raw_orcid":"https://orcid.org/0000-0001-9457-9364","affiliations":[{"raw_affiliation_string":"Department of Computer Science, University of Manchester, Manchester, M13 9PL, UK","institution_ids":["https://openalex.org/I28407311"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":["https://openalex.org/A5100451984"],"corresponding_institution_ids":["https://openalex.org/I28407311"],"apc_list":{"value":2990,"currency":"USD","value_usd":2990},"apc_paid":{"value":2990,"currency":"USD","value_usd":2990},"fwci":0.8997,"has_fulltext":true,"cited_by_count":4,"citation_normalized_percentile":{"value":0.76657382,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":94,"max":97},"biblio":{"volume":"113","issue":"5","first_page":"2527","last_page":"2557"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9998000264167786,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9998000264167786,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.9768000245094299,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.9634000062942505,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8299115896224976},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.6823624968528748},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.5861812233924866},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.553789496421814},{"id":"https://openalex.org/keywords/machine-learning","display_name":"Machine learning","score":0.5463878512382507},{"id":"https://openalex.org/keywords/variety","display_name":"Variety (cybernetics)","score":0.5156863927841187},{"id":"https://openalex.org/keywords/benchmark","display_name":"Benchmark (surveying)","score":0.49321311712265015},{"id":"https://openalex.org/keywords/exploit","display_name":"Exploit","score":0.47919926047325134},{"id":"https://openalex.org/keywords/engineering","display_name":"Engineering","score":0.11368495225906372}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8299115896224976},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6823624968528748},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5861812233924866},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.553789496421814},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5463878512382507},{"id":"https://openalex.org/C136197465","wikidata":"https://www.wikidata.org/wiki/Q1729295","display_name":"Variety (cybernetics)","level":2,"score":0.5156863927841187},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.49321311712265015},{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.47919926047325134},{"id":"https://openalex.org/C127413603","wikidata":"https://www.wikidata.org/wiki/Q11023","display_name":"Engineering","level":0,"score":0.11368495225906372},{"id":"https://openalex.org/C205649164","wikidata":"https://www.wikidata.org/wiki/Q1071","display_name":"Geography","level":0,"score":0.0},{"id":"https://openalex.org/C13280743","wikidata":"https://www.wikidata.org/wiki/Q131089","display_name":"Geodesy","level":1,"score":0.0},{"id":"https://openalex.org/C201995342","wikidata":"https://www.wikidata.org/wiki/Q682496","display_name":"Systems engineering","level":1,"score":0.0},{"id":"https://openalex.org/C38652104","wikidata":"https://www.wikidata.org/wiki/Q3510521","display_name":"Computer security","level":1,"score":0.0}],"mesh":[],"locations_count":2,"locations":[{"id":"doi:10.1007/s10994-023-06503-w","is_oa":true,"landing_page_url":"https://doi.org/10.1007/s10994-023-06503-w","pdf_url":"https://link.springer.com/content/pdf/10.1007/s10994-023-06503-w.pdf","source":{"id":"https://openalex.org/S62148650","display_name":"Machine Learning","issn_l":"0885-6125","issn":["0885-6125","1573-0565"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319900","host_organization_name":"Springer Science+Business Media","host_organization_lineage":["https://openalex.org/P4310319900","https://openalex.org/P4310319965"],"host_organization_lineage_names":["Springer Science+Business Media","Springer Nature"],"type":"journal"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Machine Learning","raw_type":"journal-article"},{"id":"pmh:oai:pure.atira.dk:openaire/49be9498-ff0e-424b-be15-dc91de731872","is_oa":true,"landing_page_url":"https://research.manchester.ac.uk/en/publications/49be9498-ff0e-424b-be15-dc91de731872","pdf_url":null,"source":{"id":"https://openalex.org/S4306400662","display_name":"Research Explorer (The University of Manchester)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I28407311","host_organization_name":"University of Manchester","host_organization_lineage":["https://openalex.org/I28407311"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Wu, L & Chen, K 2024, 'Goal Exploration Augmentation via Pre-trained Skills for Sparse-Reward Long-Horizon Goal-Conditioned Reinforcement Learning', Machine Learning, vol. 113, pp. 2527-2557. https://doi.org/10.1007/s10994-023-06503-w","raw_type":"info:eu-repo/semantics/article"}],"best_oa_location":{"id":"doi:10.1007/s10994-023-06503-w","is_oa":true,"landing_page_url":"https://doi.org/10.1007/s10994-023-06503-w","pdf_url":"https://link.springer.com/content/pdf/10.1007/s10994-023-06503-w.pdf","source":{"id":"https://openalex.org/S62148650","display_name":"Machine Learning","issn_l":"0885-6125","issn":["0885-6125","1573-0565"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319900","host_organization_name":"Springer Science+Business Media","host_organization_lineage":["https://openalex.org/P4310319900","https://openalex.org/P4310319965"],"host_organization_lineage_names":["Springer Science+Business Media","Springer Nature"],"type":"journal"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Machine Learning","raw_type":"journal-article"},"sustainable_development_goals":[{"score":0.5099999904632568,"id":"https://metadata.un.org/sdg/4","display_name":"Quality Education"}],"awards":[],"funders":[],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W4391529362.pdf","grobid_xml":"https://content.openalex.org/works/W4391529362.grobid-xml"},"referenced_works_count":23,"referenced_works":["https://openalex.org/W1492014007","https://openalex.org/W2014268383","https://openalex.org/W2616430965","https://openalex.org/W2752796333","https://openalex.org/W2766447205","https://openalex.org/W2922007426","https://openalex.org/W2963099939","https://openalex.org/W2970868077","https://openalex.org/W3004534398","https://openalex.org/W3034296891","https://openalex.org/W3034767611","https://openalex.org/W3164005523","https://openalex.org/W3177828909","https://openalex.org/W3212475937","https://openalex.org/W4212774754","https://openalex.org/W4285601030","https://openalex.org/W6616173779","https://openalex.org/W6638018090","https://openalex.org/W6682849425","https://openalex.org/W6735209194","https://openalex.org/W6756256016","https://openalex.org/W6802853800","https://openalex.org/W7036529589"],"related_works":["https://openalex.org/W17155033","https://openalex.org/W3207760230","https://openalex.org/W1496222301","https://openalex.org/W4312814274","https://openalex.org/W1590307681","https://openalex.org/W2536018345","https://openalex.org/W4285370786","https://openalex.org/W2296488620","https://openalex.org/W2358353312","https://openalex.org/W2353836703"],"abstract_inverted_index":{"Abstract":[0],"Reinforcement":[1],"learning":[2,17,94],"often":[3],"struggles":[4],"to":[5,22,43,48,53,74,81,106,138,142],"accomplish":[6],"a":[7,12,28,92,162],"sparse-reward":[8],"long-horizon":[9,166],"task":[10,141],"in":[11,65,114,134,154],"complex":[13],"environment.":[14],"Goal-conditioned":[15],"reinforcement":[16],"(GCRL)":[18],"has":[19],"been":[20,72],"employed":[21],"tackle":[23],"this":[24,76,88,121],"difficult":[25],"problem":[26],"via":[27,145],"curriculum":[29],"of":[30,60,100,164],"easy-to-reach":[31],"sub-goals.":[32],"In":[33,87],"GCRL,":[34],"exploring":[35],"novel":[36,55,93],"sub-goals":[37,56],"is":[38,58],"essential":[39],"for":[40,109],"the":[41,46,49,61,83,98,128,135,139,149],"agent":[42],"ultimately":[44],"find":[45,82],"pathway":[47],"desired":[50,84],"goal.":[51],"How":[52],"explore":[54,125],"efficiently":[57],"one":[59],"most":[62],"challenging":[63],"issues":[64],"GCRL.":[66,118],"Several":[67],"goal":[68,112,155],"exploration":[69,113,156,182],"methods":[70],"have":[71],"proposed":[73],"address":[75],"issue":[77],"but":[78],"still":[79],"struggle":[80],"goals":[85,105],"efficiently.":[86],"paper,":[89],"we":[90,123],"propose":[91],"objective":[95],"by":[96],"optimizing":[97],"entropy":[99],"both":[101],"achieved":[102],"and":[103,126],"new":[104],"be":[107],"explored":[108],"more":[110],"efficient":[111],"sub-goal":[115],"selection":[116],"based":[117],"To":[119],"optimize":[120],"objective,":[122],"first":[124],"exploit":[127],"frequently":[129],"occurring":[130],"goal-transition":[131],"patterns":[132],"mined":[133],"environments":[136],"similar":[137],"current":[140],"compose":[143],"skills":[144,151],"skill":[146],"learning.":[147],"Then,":[148],"pre-trained":[150],"are":[152],"applied":[153],"with":[157],"theoretical":[158],"justification.":[159],"Evaluation":[160],"on":[161],"variety":[163],"spare-reward":[165],"benchmark":[167],"tasks":[168],"suggests":[169],"that":[170],"incorporating":[171],"our":[172],"method":[173],"into":[174],"several":[175],"state-of-the-art":[176],"GCRL":[177],"baselines":[178],"significantly":[179],"boosts":[180],"their":[181,188],"efficiency":[183],"while":[184],"improving":[185],"or":[186],"maintaining":[187],"performance.":[189]},"counts_by_year":[{"year":2026,"cited_by_count":1},{"year":2025,"cited_by_count":3}],"updated_date":"2026-08-18T07:49:30.821534","created_date":"2025-10-10T00:00:00"}
