{"id":"https://openalex.org/W4415315922","doi":"https://doi.org/10.48550/arxiv.2509.12531","title":"Pre-trained Visual Representations Generalize Where it Matters in Model-Based Reinforcement Learning","display_name":"Pre-trained Visual Representations Generalize Where it Matters in Model-Based Reinforcement Learning","publication_year":2025,"publication_date":"2025-09-16","ids":{"openalex":"https://openalex.org/W4415315922","doi":"https://doi.org/10.48550/arxiv.2509.12531"},"language":"en","primary_location":{"id":"pmh:oai:arXiv.org:2509.12531","is_oa":true,"landing_page_url":"http://arxiv.org/abs/2509.12531","pdf_url":"https://arxiv.org/pdf/2509.12531","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},"type":"preprint","indexed_in":["arxiv","datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://arxiv.org/pdf/2509.12531","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5048822654","display_name":"Scott Jones","orcid":"https://orcid.org/0000-0001-8310-6393"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jones, Scott","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Zhou, Liyou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhou, Liyou","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5026454775","display_name":"Sebastian W. Pattinson","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Pattinson, Sebastian W.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8816999793052673,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8816999793052673,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/robustness","display_name":"Robustness (evolution)","score":0.7878999710083008},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7847999930381775},{"id":"https://openalex.org/keywords/generalization","display_name":"Generalization","score":0.5216000080108643},{"id":"https://openalex.org/keywords/encoder","display_name":"Encoder","score":0.5087000131607056},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.4713999927043915},{"id":"https://openalex.org/keywords/policy-learning","display_name":"Policy learning","score":0.4284999966621399},{"id":"https://openalex.org/keywords/active-vision","display_name":"Active vision","score":0.4284000098705292}],"concepts":[{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.7878999710083008},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7847999930381775},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.732200026512146},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.65420001745224},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.5216000080108643},{"id":"https://openalex.org/C118505674","wikidata":"https://www.wikidata.org/wiki/Q42586063","display_name":"Encoder","level":2,"score":0.5087000131607056},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.4713999927043915},{"id":"https://openalex.org/C2779436431","wikidata":"https://www.wikidata.org/wiki/Q30672407","display_name":"Policy learning","level":2,"score":0.4284999966621399},{"id":"https://openalex.org/C193611912","wikidata":"https://www.wikidata.org/wiki/Q4677596","display_name":"Active vision","level":2,"score":0.4284000098705292},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.41909998655319214},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.36880001425743103},{"id":"https://openalex.org/C36503486","wikidata":"https://www.wikidata.org/wiki/Q11235244","display_name":"Domain (mathematical analysis)","level":2,"score":0.36550000309944153},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.35670000314712524},{"id":"https://openalex.org/C207685749","wikidata":"https://www.wikidata.org/wiki/Q2088941","display_name":"Domain knowledge","level":2,"score":0.3149999976158142},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.30550000071525574},{"id":"https://openalex.org/C12725497","wikidata":"https://www.wikidata.org/wiki/Q810247","display_name":"Baseline (sea)","level":2,"score":0.28610000014305115},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.2734000086784363},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.2705000042915344},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.27000001072883606},{"id":"https://openalex.org/C2986089797","wikidata":"https://www.wikidata.org/wiki/Q6501338","display_name":"Visual attention","level":3,"score":0.2515999972820282}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:oai:arXiv.org:2509.12531","is_oa":true,"landing_page_url":"http://arxiv.org/abs/2509.12531","pdf_url":"https://arxiv.org/pdf/2509.12531","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},{"id":"doi:10.48550/arxiv.2509.12531","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2509.12531","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:oai:arXiv.org:2509.12531","is_oa":true,"landing_page_url":"http://arxiv.org/abs/2509.12531","pdf_url":"https://arxiv.org/pdf/2509.12531","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"In":[0],"visuomotor":[1],"policy":[2,6,22,46,159],"learning,":[3,160],"the":[4,8,118,135,141],"control":[5],"for":[7,164],"robotic":[9,170],"agent":[10],"is":[11,65],"derived":[12],"directly":[13],"from":[14,29,113],"visual":[15,35,93,158],"inputs.":[16],"The":[17],"typical":[18],"approach,":[19],"where":[20],"a":[21,45,109],"and":[23],"vision":[24,40],"encoder":[25],"are":[26,151],"trained":[27,112],"jointly":[28],"scratch,":[30],"generalizes":[31],"poorly":[32],"to":[33,43,77],"novel":[34],"scene":[36],"changes.":[37],"Using":[38],"pre-trained":[39],"models":[41],"(PVMs)":[42],"inform":[44],"network":[47],"improves":[48],"robustness":[49,156],"in":[50,57,80,87,99,154,157,168],"model-free":[51],"reinforcement":[52,59],"learning":[53,60,171],"(MFRL).":[54],"Recent":[55],"developments":[56],"Model-based":[58],"(MBRL)":[61],"suggest":[62],"that":[63,130,149],"MBRL":[64],"more":[66],"sample-efficient":[67],"than":[68,108],"MFRL.":[69],"However,":[70],"counterintuitively,":[71],"existing":[72],"work":[73],"has":[74],"found":[75],"PVMs":[76,104,150],"be":[78],"ineffective":[79],"MBRL.":[81],"Here,":[82],"we":[83],"investigate":[84,117],"PVM's":[85],"effectiveness":[86],"MBRL,":[88],"specifically":[89],"on":[90],"generalization":[91],"under":[92,140],"domain":[94],"shifts.":[95,145],"We":[96,115],"show":[97,129],"that,":[98],"scenarios":[100],"with":[101],"severe":[102],"shifts,":[103],"perform":[105],"much":[106],"better":[107],"baseline":[110],"model":[111],"scratch.":[114],"further":[116],"effects":[119],"of":[120,123,125],"varying":[121],"levels":[122],"fine-tuning":[124,132],"PVMs.":[126],"Our":[127,146],"results":[128,147],"partial":[131],"can":[133],"maintain":[134],"highest":[136],"average":[137],"task":[138],"performance":[139],"most":[142],"extreme":[143],"distribution":[144],"demonstrate":[148],"highly":[152],"successful":[153],"promoting":[155],"providing":[161],"compelling":[162],"evidence":[163],"their":[165],"wider":[166],"adoption":[167],"model-based":[169],"applications.":[172]},"counts_by_year":[],"updated_date":"2026-08-05T07:39:15.569665","created_date":"2025-10-18T00:00:00"}
