{"id":"https://openalex.org/W7160961069","doi":"https://doi.org/10.48550/arxiv.2605.09727","title":"One for All: A Non-Linear Transformer can Enable Cross-Domain Generalization for In-Context Reinforcement Learning","display_name":"One for All: A Non-Linear Transformer can Enable Cross-Domain Generalization for In-Context Reinforcement Learning","publication_year":2026,"publication_date":"2026-05-10","ids":{"openalex":"https://openalex.org/W7160961069","doi":"https://doi.org/10.48550/arxiv.2605.09727"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.09727","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.09727","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.09727","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5076274939","display_name":"Bowen He","orcid":"https://orcid.org/0000-0002-3162-7098"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"He, Bowen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5031584101","display_name":"Juncheng Dong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Dong, Juncheng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135961267","display_name":"Lin Lin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lin, Lin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5135938611","display_name":"Xiang Cheng","orcid":"https://orcid.org/0009-0003-2287-266X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cheng, Xiang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.647599995136261,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.647599995136261,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.20509999990463257,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.011900000274181366,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6942999958992004},{"id":"https://openalex.org/keywords/transformer","display_name":"Transformer","score":0.6815999746322632},{"id":"https://openalex.org/keywords/generalization","display_name":"Generalization","score":0.40230000019073486},{"id":"https://openalex.org/keywords/hilbert-space","display_name":"Hilbert space","score":0.38609999418258667},{"id":"https://openalex.org/keywords/reproducing-kernel-hilbert-space","display_name":"Reproducing kernel Hilbert space","score":0.3546999990940094},{"id":"https://openalex.org/keywords/operator","display_name":"Operator (biology)","score":0.3294000029563904}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6942999958992004},{"id":"https://openalex.org/C66322947","wikidata":"https://www.wikidata.org/wiki/Q11658","display_name":"Transformer","level":3,"score":0.6815999746322632},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5321000218391418},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5077000260353088},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.40230000019073486},{"id":"https://openalex.org/C62799726","wikidata":"https://www.wikidata.org/wiki/Q190056","display_name":"Hilbert space","level":2,"score":0.38609999418258667},{"id":"https://openalex.org/C80884492","wikidata":"https://www.wikidata.org/wiki/Q3345678","display_name":"Reproducing kernel Hilbert space","level":3,"score":0.3546999990940094},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.34220001101493835},{"id":"https://openalex.org/C17020691","wikidata":"https://www.wikidata.org/wiki/Q139677","display_name":"Operator (biology)","level":5,"score":0.3294000029563904},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.31049999594688416},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.31040000915527344},{"id":"https://openalex.org/C2776434776","wikidata":"https://www.wikidata.org/wiki/Q19246213","display_name":"Domain adaptation","level":3,"score":0.28290000557899475},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.26409998536109924},{"id":"https://openalex.org/C74193536","wikidata":"https://www.wikidata.org/wiki/Q574844","display_name":"Kernel (algebra)","level":2,"score":0.26109999418258667}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.09727","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.09727","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.09727","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.09727","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"A":[0],"central":[1],"challenge":[2],"in":[3,86,121],"reinforcement":[4],"learning":[5,46],"(RL)":[6],"is":[7,73],"to":[8,41,68,76,82],"learn":[9],"models":[10],"that":[11,64,130],"generalize":[12],"beyond":[13],"the":[14,116,149,163],"tasks":[15,43],"on":[16,153],"which":[17],"they":[18,146],"are":[19],"trained,":[20],"a":[21,36,52,55,61,66,69,99,104,122,140],"goal":[22],"traditionally":[23],"pursued":[24],"through":[25],"multi-task":[26],"and":[27,78,109],"meta":[28],"RL.":[29,87],"Recently,":[30],"transformer":[31,56,117],"architectures":[32],"have":[33],"emerged":[34],"as":[35,60,118],"promising":[37],"approach,":[38],"enabling":[39],"adaptation":[40],"new":[42],"via":[44],"in-context":[45],"without":[47],"explicit":[48],"parameter":[49],"updates.":[50],"From":[51],"functional":[53,62],"perspective,":[54],"can":[57,136],"be":[58,137],"viewed":[59],"operator":[63,81],"maps":[65],"context":[67],"task-specific":[70],"function.":[71],"It":[72],"thus":[74],"fundamental":[75],"understand":[77],"design":[79],"this":[80,89,93,158],"support":[83,157],"stronger":[84],"generalization":[85,97],"In":[88],"work,":[90],"we":[91,128],"address":[92],"resulting":[94],"question":[95],"of":[96,143,162],"from":[98,133],"kernel-based":[100,110],"perspective":[101],"by":[102],"establishing":[103],"connection":[105],"between":[106],"non-linear":[107],"transformers":[108],"temporal":[111],"difference":[112],"learning.":[113],"By":[114],"interpreting":[115],"performing":[119],"regression":[120],"Reproducing":[123],"Kernel":[124],"Hilbert":[125],"Space":[126],"(RKHS),":[127],"show":[129],"value":[131],"functions":[132],"different":[134],"domains":[135,156],"represented":[138],"using":[139],"shared":[141],"set":[142],"weights,":[144],"provided":[145],"lie":[147],"within":[148],"same":[150],"RKHS.":[151],"Experiments":[152],"multiple":[154],"MetaWorld":[155],"interpretation,":[159],"demonstrating":[160],"convergence":[161],"temporal-difference":[164],"objective.":[165]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-05-13T00:00:00"}
