{"id":"https://openalex.org/W7139939442","doi":"https://doi.org/10.48550/arxiv.2603.18532","title":"Scaling Sim-to-Real Reinforcement Learning for Robot VLAs with Generative 3D Worlds","display_name":"Scaling Sim-to-Real Reinforcement Learning for Robot VLAs with Generative 3D Worlds","publication_year":2026,"publication_date":"2026-03-19","ids":{"openalex":"https://openalex.org/W7139939442","doi":"https://doi.org/10.48550/arxiv.2603.18532"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.18532","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.18532","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.18532","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5130215086","display_name":"Andrew Choi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Choi, Andrew","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5130241254","display_name":"Xinjie Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Xinjie","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5087325725","display_name":"Zhizhong Su","orcid":"https://orcid.org/0000-0003-2312-9985"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Su, Zhizhong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5130216908","display_name":"Wei Xu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xu, Wei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.7311000227928162,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.7311000227928162,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.065700002014637,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.027000000700354576,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/generality","display_name":"Generality","score":0.8748999834060669},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.743399977684021},{"id":"https://openalex.org/keywords/scalability","display_name":"Scalability","score":0.6531999707221985},{"id":"https://openalex.org/keywords/generative-grammar","display_name":"Generative grammar","score":0.49390000104904175},{"id":"https://openalex.org/keywords/benchmark","display_name":"Benchmark (surveying)","score":0.45739999413490295},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.40459999442100525},{"id":"https://openalex.org/keywords/imitation","display_name":"Imitation","score":0.3961000144481659},{"id":"https://openalex.org/keywords/object","display_name":"Object (grammar)","score":0.3901999890804291},{"id":"https://openalex.org/keywords/transfer-problem","display_name":"Transfer problem","score":0.37310001254081726}],"concepts":[{"id":"https://openalex.org/C2780767217","wikidata":"https://www.wikidata.org/wiki/Q5532421","display_name":"Generality","level":2,"score":0.8748999834060669},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7608000040054321},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.743399977684021},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.6531999707221985},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5778999924659729},{"id":"https://openalex.org/C39890363","wikidata":"https://www.wikidata.org/wiki/Q36108","display_name":"Generative grammar","level":2,"score":0.49390000104904175},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.45739999413490295},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.40959998965263367},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.40459999442100525},{"id":"https://openalex.org/C126388530","wikidata":"https://www.wikidata.org/wiki/Q1131737","display_name":"Imitation","level":2,"score":0.3961000144481659},{"id":"https://openalex.org/C2781238097","wikidata":"https://www.wikidata.org/wiki/Q175026","display_name":"Object (grammar)","level":2,"score":0.3901999890804291},{"id":"https://openalex.org/C2779066501","wikidata":"https://www.wikidata.org/wiki/Q1761267","display_name":"Transfer problem","level":2,"score":0.37310001254081726},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.3407000005245209},{"id":"https://openalex.org/C167966045","wikidata":"https://www.wikidata.org/wiki/Q5532625","display_name":"Generative model","level":3,"score":0.3382999897003174},{"id":"https://openalex.org/C2779530757","wikidata":"https://www.wikidata.org/wiki/Q1207505","display_name":"Quality (philosophy)","level":2,"score":0.32499998807907104},{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.32010000944137573},{"id":"https://openalex.org/C148220186","wikidata":"https://www.wikidata.org/wiki/Q7111912","display_name":"Outcome (game theory)","level":2,"score":0.31709998846054077},{"id":"https://openalex.org/C99844830","wikidata":"https://www.wikidata.org/wiki/Q102441924","display_name":"Scaling","level":2,"score":0.3156999945640564},{"id":"https://openalex.org/C9652623","wikidata":"https://www.wikidata.org/wiki/Q190109","display_name":"Field (mathematics)","level":2,"score":0.31450000405311584},{"id":"https://openalex.org/C2775945657","wikidata":"https://www.wikidata.org/wiki/Q381442","display_name":"Structuring","level":2,"score":0.3077000081539154},{"id":"https://openalex.org/C34413123","wikidata":"https://www.wikidata.org/wiki/Q170978","display_name":"Robotics","level":3,"score":0.3050000071525574},{"id":"https://openalex.org/C19273510","wikidata":"https://www.wikidata.org/wiki/Q263847","display_name":"Artificial life","level":2,"score":0.30469998717308044},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.29490000009536743},{"id":"https://openalex.org/C2779916870","wikidata":"https://www.wikidata.org/wiki/Q14467155","display_name":"Gaze","level":2,"score":0.2856000065803528},{"id":"https://openalex.org/C36503486","wikidata":"https://www.wikidata.org/wiki/Q11235244","display_name":"Domain (mathematical analysis)","level":2,"score":0.2851000130176544},{"id":"https://openalex.org/C150899416","wikidata":"https://www.wikidata.org/wiki/Q1820378","display_name":"Transfer of learning","level":2,"score":0.27469998598098755},{"id":"https://openalex.org/C2778012447","wikidata":"https://www.wikidata.org/wiki/Q1034415","display_name":"Scope (computer science)","level":2,"score":0.2712000012397766},{"id":"https://openalex.org/C2777212361","wikidata":"https://www.wikidata.org/wiki/Q5127848","display_name":"Class (philosophy)","level":2,"score":0.25440001487731934},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.2542000114917755}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.18532","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.18532","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.18532","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.18532","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.7581430077552795,"display_name":"Decent work and economic growth","id":"https://metadata.un.org/sdg/8"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"The":[0],"strong":[1],"performance":[2],"of":[3,51,74,138,188,215],"large":[4],"vision-language":[5],"models":[6,21,128,225],"(VLMs)":[7],"trained":[8],"with":[9,117,130,194],"reinforcement":[10],"learning":[11],"(RL)":[12],"has":[13],"motivated":[14],"similar":[15],"approaches":[16],"for":[17],"fine-tuning":[18],"vision-language-action":[19],"(VLA)":[20],"in":[22,30,61,86,174],"robotics.":[23],"Many":[24],"recent":[25],"works":[26],"fine-tune":[27],"VLAs":[28,108],"directly":[29,235],"the":[31,37,49,52,62,71,186,189,213,217],"real":[32],"world":[33,64,123,223],"to":[34,70,92,167,202],"avoid":[35],"addressing":[36],"sim-to-real":[38,44,182],"gap.":[39],"While":[40],"real-world":[41,198],"RL":[42,111],"circumvents":[43],"issues,":[45],"it":[46],"inherently":[47],"limits":[48],"generality":[50,115],"resulting":[53],"VLA,":[54],"as":[55],"scaling":[56],"scene":[57,133,233],"and":[58,116,145,149,204],"object":[59],"diversity":[60,234],"physical":[63],"is":[65,99],"prohibitively":[66],"difficult.":[67],"This":[68],"leads":[69],"paradoxical":[72],"outcome":[73],"transforming":[75],"a":[76,131,156,171,206],"broadly":[77],"pretrained":[78,157],"model":[79],"into":[80],"an":[81,227],"overfitted,":[82],"scene-specific":[83],"policy.":[84],"Training":[85],"simulation":[87,163],"can":[88,109],"instead":[89],"provide":[90],"access":[91],"diverse":[93,139],"scenes,":[94],"but":[95],"designing":[96],"those":[97],"scenes":[98,141],"also":[100],"costly.":[101],"In":[102],"this":[103],"work,":[104],"we":[105,135,210],"show":[106],"that":[107,231],"be":[110],"fine-tuned":[112],"without":[113],"sacrificing":[114],"reduced":[118],"labor":[119],"by":[120,185],"leveraging":[121,216],"3D":[122,222],"generative":[124,224],"models.":[125],"Using":[126],"these":[127],"together":[129,193],"language-driven":[132],"designer,":[134],"generate":[136],"hundreds":[137],"interactive":[140],"containing":[142],"unique":[143],"objects":[144],"backgrounds,":[146],"enabling":[147],"scalable":[148],"highly":[150],"parallel":[151],"policy":[152],"learning.":[153],"Starting":[154],"from":[155,165,200,221],"imitation":[158],"baseline,":[159],"our":[160],"approach":[161],"increases":[162],"success":[164,199],"9.7%":[166],"79.8%":[168],"while":[169],"achieving":[170,205],"1.25$\\times$":[172],"speedup":[173],"task":[175],"completion":[176],"time.":[177],"We":[178],"further":[179,211],"demonstrate":[180],"successful":[181],"transfer":[183],"enabled":[184],"quality":[187],"generated":[190],"digital":[191],"twins":[192],"domain":[195],"randomization,":[196],"improving":[197],"21.7%":[201],"75%":[203],"1.13$\\times$":[207],"speedup.":[208],"Finally,":[209],"highlight":[212],"benefits":[214],"effectively":[218],"unlimited":[219],"data":[220],"through":[226],"ablation":[228],"study":[229],"showing":[230],"increasing":[232],"improves":[236],"zero-shot":[237],"generalization.":[238]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-03-21T00:00:00"}
