{"id":"https://openalex.org/W7165643088","doi":"https://doi.org/10.48550/arxiv.2606.22027","title":"RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation","display_name":"RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation","publication_year":2026,"publication_date":"2026-06-20","ids":{"openalex":"https://openalex.org/W7165643088","doi":"https://doi.org/10.48550/arxiv.2606.22027"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.22027","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.22027","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.22027","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139161602","display_name":"Pengzhi Yang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yang, Pengzhi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139208524","display_name":"Xinyu Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Xinyu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5034893058","display_name":"Pengyu Jing","orcid":"https://orcid.org/0000-0001-7378-4887"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jing, Pengyu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5113150806","display_name":"Kehan Wen","orcid":"https://orcid.org/0000-0003-0411-4489"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wen, Kehan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139162579","display_name":"Yiduo Qu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Qu, Yiduo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5011086655","display_name":"Z Zhangqin Huang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Huang, Zhenhao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139150476","display_name":"Minghao Fu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Fu, Minghao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139161727","display_name":"Xin Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Xin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5065185682","display_name":"Yaheng Shen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shen, Yaheng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139185831","display_name":"Fan Shi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shi, Fan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.9358999729156494,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.9358999729156494,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.029500000178813934,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10812","display_name":"Human Pose and Action Recognition","score":0.011300000362098217,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.6851999759674072},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6136000156402588},{"id":"https://openalex.org/keywords/clips","display_name":"CLIPS","score":0.3874000012874603},{"id":"https://openalex.org/keywords/robot","display_name":"Robot","score":0.3864000141620636},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.36959999799728394},{"id":"https://openalex.org/keywords/programming-by-demonstration","display_name":"Programming by demonstration","score":0.29649999737739563}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7124999761581421},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.6851999759674072},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6136000156402588},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5526999831199646},{"id":"https://openalex.org/C2778739407","wikidata":"https://www.wikidata.org/wiki/Q165372","display_name":"CLIPS","level":2,"score":0.3874000012874603},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.3864000141620636},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.36959999799728394},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3391000032424927},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.3370000123977661},{"id":"https://openalex.org/C2779038628","wikidata":"https://www.wikidata.org/wiki/Q7248497","display_name":"Programming by demonstration","level":3,"score":0.29649999737739563},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.29420000314712524},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.2913999855518341},{"id":"https://openalex.org/C34585555","wikidata":"https://www.wikidata.org/wiki/Q1368723","display_name":"Learning curve","level":2,"score":0.27000001072883606}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.22027","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.22027","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.22027","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.22027","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1],"for":[2],"robot":[3],"manipulation":[4,146],"is":[5,97],"often":[6,55],"bottlenecked":[7],"by":[8,41],"reward":[9,35,113,117],"design,":[10],"especially":[11,183],"in":[12,163],"long-horizon":[13,172],"tasks:":[14],"sparse":[15],"success":[16,161],"rewards":[17,24,66,129],"provide":[18],"weak":[19],"supervision,":[20],"while":[21],"hand-crafted":[22],"dense":[23],"are":[25,182],"tedious":[26],"to":[27,67,125],"design":[28],"and":[29,62,128,150,152],"generalize":[30],"poorly":[31],"across":[32],"tasks.":[33],"Progress-based":[34],"models":[36],"offer":[37],"a":[38,81,87,92,104],"promising":[39],"alternative":[40],"estimating":[42],"how":[43],"far":[44],"an":[45],"observation":[46],"has":[47],"advanced":[48],"toward":[49],"task":[50],"completion,":[51],"but":[52,70],"existing":[53],"approaches":[54],"require":[56],"task-specific":[57,112],"demonstrations":[58],"or":[59,115],"progress":[60,180],"labels,":[61,114],"can":[63],"assign":[64],"high":[65],"visually":[68],"plausible":[69],"physically":[71],"incorrect":[72],"states.":[73],"We":[74],"introduce":[75],"the":[76,158],"Reference-Anchored":[77],"Reward":[78],"Model":[79],"(RARM),":[80],"lightweight":[82],"visual":[83],"comparator":[84],"that":[85,137],"converts":[86],"single":[88],"successful":[89],"demonstration":[90],"into":[91],"dense,":[93],"progress-aware":[94],"reward.":[95],"RARM":[96,121,156],"trained":[98],"once":[99],"on":[100,171],"general-purpose":[101],"videos":[102],"with":[103,167],"contrastive":[105],"temporal":[106],"objective,":[107],"requiring":[108],"no":[109],"robot-specific":[110],"data,":[111],"per-task":[116],"engineering.":[118],"At":[119],"deployment,":[120],"matches":[122,136],"rollout":[123],"clips":[124,127],"reference":[126],"only":[130],"confident":[131],"forward":[132],"progress,":[133],"suppressing":[134],"uncertain":[135],"may":[138],"otherwise":[139],"produce":[140],"false-positive":[141],"rewards.":[142],"Across":[143],"9":[144],"simulated":[145],"tasks":[147,173],"from":[148],"LIBERO":[149],"MetaWorld":[151],"4":[153],"real-world":[154],"tasks,":[155],"achieves":[157],"best":[159],"overall":[160],"rates":[162],"subsequent":[164],"RL":[165],"training,":[166],"particularly":[168],"large":[169],"gains":[170],"such":[174],"as":[175],"cloth":[176],"folding,":[177],"where":[178],"unreliable":[179],"estimates":[181],"harmful.":[184]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-06-24T00:00:00"}
