{"id":"https://openalex.org/W7165114325","doi":"https://doi.org/10.48550/arxiv.2606.18953","title":"Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement","display_name":"Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement","publication_year":2026,"publication_date":"2026-06-17","ids":{"openalex":"https://openalex.org/W7165114325","doi":"https://doi.org/10.48550/arxiv.2606.18953"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.18953","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.18953","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.18953","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5054308328","display_name":"Kinam Kim","orcid":"https://orcid.org/0000-0003-3553-9332"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kim, Kinam","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5066028565","display_name":"Namiko Saito","orcid":"https://orcid.org/0000-0003-4140-7643"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Saito, Namiko","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5056418048","display_name":"Heecheol Kim","orcid":"https://orcid.org/0000-0002-3451-2288"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kim, Heecheol","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138844638","display_name":"Katsushi Ikeuchi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ikeuchi, Katsushi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138875888","display_name":"Jaegul Choo","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Choo, Jaegul","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5033986386","display_name":"Yasuyuki Matsushita","orcid":"https://orcid.org/0000-0002-1935-4752"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Matsushita, Yasuyuki","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.5996000170707703,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.5996000170707703,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.12470000237226486,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.08179999887943268,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/residual","display_name":"Residual","score":0.6685000061988831},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6151999831199646},{"id":"https://openalex.org/keywords/robustness","display_name":"Robustness (evolution)","score":0.5382999777793884},{"id":"https://openalex.org/keywords/teleoperation","display_name":"Teleoperation","score":0.5167999863624573},{"id":"https://openalex.org/keywords/leverage","display_name":"Leverage (statistics)","score":0.42320001125335693},{"id":"https://openalex.org/keywords/noise","display_name":"Noise (video)","score":0.3425000011920929},{"id":"https://openalex.org/keywords/lossy-compression","display_name":"Lossy compression","score":0.32919999957084656},{"id":"https://openalex.org/keywords/inverted-pendulum","display_name":"Inverted pendulum","score":0.32409998774528503}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7411999702453613},{"id":"https://openalex.org/C155512373","wikidata":"https://www.wikidata.org/wiki/Q287450","display_name":"Residual","level":2,"score":0.6685000061988831},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6151999831199646},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.5382999777793884},{"id":"https://openalex.org/C161759796","wikidata":"https://www.wikidata.org/wiki/Q3982902","display_name":"Teleoperation","level":3,"score":0.5167999863624573},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.42320001125335693},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3953999876976013},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.3425000011920929},{"id":"https://openalex.org/C165021410","wikidata":"https://www.wikidata.org/wiki/Q55564","display_name":"Lossy compression","level":2,"score":0.32919999957084656},{"id":"https://openalex.org/C192921069","wikidata":"https://www.wikidata.org/wiki/Q550134","display_name":"Inverted pendulum","level":3,"score":0.32409998774528503},{"id":"https://openalex.org/C44154836","wikidata":"https://www.wikidata.org/wiki/Q45045","display_name":"Simulation","level":1,"score":0.3181999921798706},{"id":"https://openalex.org/C46686674","wikidata":"https://www.wikidata.org/wiki/Q466303","display_name":"Boosting (machine learning)","level":2,"score":0.303600013256073},{"id":"https://openalex.org/C142614401","wikidata":"https://www.wikidata.org/wiki/Q777433","display_name":"Forward chaining","level":3,"score":0.29980000853538513},{"id":"https://openalex.org/C175291020","wikidata":"https://www.wikidata.org/wiki/Q1156822","display_name":"Offset (computer science)","level":2,"score":0.289900004863739},{"id":"https://openalex.org/C2775937380","wikidata":"https://www.wikidata.org/wiki/Q1232589","display_name":"Replica","level":2,"score":0.28119999170303345},{"id":"https://openalex.org/C204030448","wikidata":"https://www.wikidata.org/wiki/Q101017","display_name":"Distillation","level":2,"score":0.27790001034736633},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.2745000123977661},{"id":"https://openalex.org/C152124472","wikidata":"https://www.wikidata.org/wiki/Q1204361","display_name":"Redundancy (engineering)","level":2,"score":0.26980000734329224},{"id":"https://openalex.org/C36503486","wikidata":"https://www.wikidata.org/wiki/Q11235244","display_name":"Domain (mathematical analysis)","level":2,"score":0.2669999897480011},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.25}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.18953","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.18953","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.18953","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.18953","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Vision-Language-Action":[0],"(VLA)":[1],"models":[2],"can":[3,185],"generalize":[4],"across":[5],"diverse":[6],"manipulation":[7,160],"tasks,":[8],"but":[9,57],"their":[10],"imitation-learning-based":[11],"policies":[12],"remain":[13],"brittle":[14],"in":[15,31,125,143],"precise":[16],"physical":[17],"interactions":[18],"due":[19],"to":[20,127,154,178,189],"compounding":[21],"execution":[22],"errors;":[23],"Can":[24],"a":[25,44,50,54,61,102,129,163],"reinforcement":[26],"learning":[27],"policy":[28,46,139],"trained":[29,141],"purely":[30],"simulation":[32,110,126,144],"improve":[33],"the":[34,76,115,121,133,155,173,182,191],"robustness":[35],"of":[36,49,132],"real-world":[37,81,134],"VLAs":[38],"zero-shot?":[39],"Residual":[40],"RL,":[41],"which":[42],"learns":[43],"corrective":[45],"on":[47,162],"top":[48],"frozen":[51],"VLA,":[52],"offers":[53],"natural":[55],"framework,":[56],"existing":[58],"approaches":[59],"face":[60],"fundamental":[62],"sim-to-real":[63],"dilemma:":[64],"privileged-state":[65],"methods":[66,73],"require":[67],"lossy":[68],"distillation":[69],"for":[70,194],"deployment;":[71],"image-based":[72],"suffer":[74],"from":[75,176],"visual":[77],"domain":[78],"gap;":[79],"and":[80,85,111,149,151,181],"RL":[82,92,138],"is":[83,140],"costly":[84],"unsafe.":[86],"We":[87],"propose":[88],"an":[89],"object-centric":[90],"residual":[91,137],"framework":[93],"that":[94,106],"refines":[95],"VLA":[96,193],"actions":[97],"using":[98],"object":[99],"poses,":[100],"enabling":[101],"compact":[103],"observation":[104],"space":[105],"transfers":[107,152],"consistently":[108],"between":[109],"reality.":[112],"To":[113],"align":[114],"two":[116],"domains,":[117],"we":[118],"additionally":[119],"replay":[120],"same":[122],"teleoperation":[123],"demonstrations":[124],"train":[128],"sim":[130],"counterpart":[131],"VLA.":[135],"The":[136],"only":[142],"with":[145],"pose":[146],"noise":[147],"injection":[148],"dropout,":[150],"zero-shot":[153],"real":[156,164],"robot.":[157],"Across":[158],"five":[159],"tasks":[161],"Franka":[165],"Research":[166],"3":[167],"(FR3)":[168],"robot,":[169],"our":[170],"method":[171],"improves":[172],"success":[174],"rate":[175],"42%":[177],"76%":[179],"zero-shot,":[180],"improved":[183],"rollouts":[184],"be":[186],"further":[187],"reused":[188],"retrain":[190],"base":[192],"self-improvement":[195],"without":[196],"additional":[197],"teleoperation.":[198],"Project":[199],"page:":[200],"https://www.microsoft.com/en-us/research/articles/object-centric-residual-rl/":[201]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-19T00:00:00"}
