{"id":"https://openalex.org/W7164053328","doi":"https://doi.org/10.48550/arxiv.2606.08610","title":"HARBOR: A Harness Framework for Agentic Robot Reinforcement Learning","display_name":"HARBOR: A Harness Framework for Agentic Robot Reinforcement Learning","publication_year":2026,"publication_date":"2026-06-07","ids":{"openalex":"https://openalex.org/W7164053328","doi":"https://doi.org/10.48550/arxiv.2606.08610"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.08610","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.08610","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.08610","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5059724576","display_name":"Zechu Li","orcid":"https://orcid.org/0009-0002-1534-1740"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Zechu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138216597","display_name":"Yufeng Jin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jin, Yufeng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138247261","display_name":"Xiaoyang Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Xiaoyang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5036597033","display_name":"Puze Liu","orcid":"https://orcid.org/0000-0001-6887-7704"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Puze","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138201855","display_name":"Vignesh Prasad","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Prasad, Vignesh","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138264727","display_name":"Carlo D'Eramo","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"D'Eramo, Carlo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5026055366","display_name":"Georgia Chalvatzaki","orcid":"https://orcid.org/0000-0002-5055-199X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chalvatzaki, Georgia","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.868399977684021,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.868399977684021,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.04560000076889992,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.019600000232458115,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7498000264167786},{"id":"https://openalex.org/keywords/workflow","display_name":"Workflow","score":0.6766999959945679},{"id":"https://openalex.org/keywords/executable","display_name":"Executable","score":0.5663999915122986},{"id":"https://openalex.org/keywords/robot","display_name":"Robot","score":0.5530999898910522},{"id":"https://openalex.org/keywords/pipeline","display_name":"Pipeline (software)","score":0.5231000185012817},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.4885999858379364},{"id":"https://openalex.org/keywords/automation","display_name":"Automation","score":0.4611000120639801},{"id":"https://openalex.org/keywords/codebase","display_name":"Codebase","score":0.4580000042915344},{"id":"https://openalex.org/keywords/programming-by-demonstration","display_name":"Programming by demonstration","score":0.37869998812675476},{"id":"https://openalex.org/keywords/abstraction","display_name":"Abstraction","score":0.373199999332428}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7498000264167786},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7156999707221985},{"id":"https://openalex.org/C177212765","wikidata":"https://www.wikidata.org/wiki/Q627335","display_name":"Workflow","level":2,"score":0.6766999959945679},{"id":"https://openalex.org/C160145156","wikidata":"https://www.wikidata.org/wiki/Q778586","display_name":"Executable","level":2,"score":0.5663999915122986},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.5530999898910522},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.5231000185012817},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.4885999858379364},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.47839999198913574},{"id":"https://openalex.org/C115901376","wikidata":"https://www.wikidata.org/wiki/Q184199","display_name":"Automation","level":2,"score":0.4611000120639801},{"id":"https://openalex.org/C51929080","wikidata":"https://www.wikidata.org/wiki/Q2425187","display_name":"Codebase","level":3,"score":0.4580000042915344},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.41179999709129333},{"id":"https://openalex.org/C2779038628","wikidata":"https://www.wikidata.org/wiki/Q7248497","display_name":"Programming by demonstration","level":3,"score":0.37869998812675476},{"id":"https://openalex.org/C115903868","wikidata":"https://www.wikidata.org/wiki/Q80993","display_name":"Software engineering","level":1,"score":0.37459999322891235},{"id":"https://openalex.org/C124304363","wikidata":"https://www.wikidata.org/wiki/Q673661","display_name":"Abstraction","level":2,"score":0.373199999332428},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.36079999804496765},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.34049999713897705},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3337000012397766},{"id":"https://openalex.org/C15569618","wikidata":"https://www.wikidata.org/wiki/Q3561421","display_name":"Liveness","level":2,"score":0.3158000111579895},{"id":"https://openalex.org/C188888258","wikidata":"https://www.wikidata.org/wiki/Q7353390","display_name":"Robot learning","level":4,"score":0.3052999973297119},{"id":"https://openalex.org/C147494362","wikidata":"https://www.wikidata.org/wiki/Q2078905","display_name":"Troubleshooting","level":2,"score":0.29899999499320984},{"id":"https://openalex.org/C2777904410","wikidata":"https://www.wikidata.org/wiki/Q7397","display_name":"Software","level":2,"score":0.2989000082015991},{"id":"https://openalex.org/C34413123","wikidata":"https://www.wikidata.org/wiki/Q170978","display_name":"Robotics","level":3,"score":0.29649999737739563},{"id":"https://openalex.org/C114073186","wikidata":"https://www.wikidata.org/wiki/Q2631895","display_name":"Automated planning and scheduling","level":2,"score":0.2896000146865845},{"id":"https://openalex.org/C2777655017","wikidata":"https://www.wikidata.org/wiki/Q1501161","display_name":"Toolbox","level":2,"score":0.28529998660087585},{"id":"https://openalex.org/C17098449","wikidata":"https://www.wikidata.org/wiki/Q176814","display_name":"Partially observable Markov decision process","level":4,"score":0.2768000066280365},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.2759999930858612},{"id":"https://openalex.org/C48145219","wikidata":"https://www.wikidata.org/wiki/Q1335365","display_name":"Security token","level":2,"score":0.27549999952316284},{"id":"https://openalex.org/C134448949","wikidata":"https://www.wikidata.org/wiki/Q1384274","display_name":"Expediting","level":2,"score":0.26820001006126404},{"id":"https://openalex.org/C8642999","wikidata":"https://www.wikidata.org/wiki/Q4171168","display_name":"Hyperparameter","level":2,"score":0.26809999346733093},{"id":"https://openalex.org/C92991967","wikidata":"https://www.wikidata.org/wiki/Q7644329","display_name":"Supervisory control","level":3,"score":0.25859999656677246},{"id":"https://openalex.org/C55166926","wikidata":"https://www.wikidata.org/wiki/Q2892946","display_name":"Oracle","level":2,"score":0.25589999556541443},{"id":"https://openalex.org/C206729178","wikidata":"https://www.wikidata.org/wiki/Q2271896","display_name":"Scheduling (production processes)","level":2,"score":0.2556999921798706},{"id":"https://openalex.org/C74222875","wikidata":"https://www.wikidata.org/wiki/Q16000312","display_name":"Robot kinematics","level":4,"score":0.25380000472068787}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.08610","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.08610","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.08610","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.08610","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1,113],"(RL)":[2],"has":[3],"become":[4],"a":[5,59,63,67],"powerful":[6],"paradigm":[7],"for":[8],"robot":[9,55],"learning,":[10],"particularly":[11],"in":[12,80,125],"sim-to-real":[13],"settings,":[14],"but":[15],"its":[16],"broader":[17],"adoption":[18],"remains":[19],"limited":[20],"by":[21,91],"the":[22,26,72,139,165],"engineering":[23,157],"pipeline":[24],"surrounding":[25],"algorithms.":[27],"Building":[28],"tasks,":[29],"shaping":[30],"rewards,":[31,145],"and":[32,43,66,101,104,111,122,130,155,162],"tuning":[33],"hyperparameters":[34],"require":[35],"substantial":[36],"expert":[37],"effort,":[38],"making":[39],"RL":[40,56,141],"workflows":[41],"costly":[42],"difficult":[44],"to":[45,77,148,172],"scale.":[46],"We":[47,116,134],"introduce":[48],"HARBOR,":[49],"an":[50],"agentic":[51],"framework":[52],"that":[53,136],"frames":[54],"automation":[57],"as":[58],"harness-engineering":[60],"problem:":[61],"given":[62],"simulator":[64],"codebase":[65],"task":[68],"specification,":[69],"it":[70],"automates":[71,138],"workflow":[73,142],"from":[74],"environment":[75],"setup":[76],"policy":[78],"training":[79],"simulation.":[81],"HARBOR":[82,118,137],"decomposes":[83],"such":[84],"high-level":[85],"objectives":[86],"into":[87],"bounded":[88],"stages":[89],"executed":[90],"specialized":[92],"agents":[93],"through":[94],"standardized":[95],"commands,":[96],"persistent":[97],"artifacts,":[98],"executable":[99],"gates,":[100],"reusable":[102],"knowledge,":[103],"scales":[105],"iteration":[106],"via":[107],"decentralized":[108],"parallel":[109],"trials":[110],"experience":[112],"across":[114,119],"runs.":[115],"evaluate":[117],"6":[120],"benchmarks":[121],"16":[123],"tasks":[124],"total,":[126],"spanning":[127],"manipulation,":[128],"locomotion,":[129],"bimanual":[131],"dexterous":[132],"control.":[133],"demonstrate":[135],"simulation":[140],"end-to-end,":[143],"designs":[144],"tunes":[146],"algorithms":[147],"match":[149],"or":[150],"improve":[151],"over":[152],"default":[153],"configurations,":[154],"reduces":[156],"effort":[158],"at":[159],"practical":[160],"token":[161],"wall-clock":[163],"cost;":[164],"resulting":[166],"policies":[167],"can":[168],"also":[169],"be":[170],"transferred":[171],"real":[173],"robots.":[174]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-06-10T00:00:00"}
