{"id":"https://openalex.org/W7166688171","doi":"https://doi.org/10.48550/arxiv.2606.29980","title":"Exploration and Online Transfer with Behavioral Foundation Models","display_name":"Exploration and Online Transfer with Behavioral Foundation Models","publication_year":2026,"publication_date":"2026-06-29","ids":{"openalex":"https://openalex.org/W7166688171","doi":"https://doi.org/10.48550/arxiv.2606.29980"},"language":"en","primary_location":{"id":"pmh:oai:HAL:hal-05669745v2","is_oa":false,"landing_page_url":"https://hal.science/hal-05669745","pdf_url":null,"source":{"id":"https://openalex.org/S4306402512","display_name":"HAL (Le Centre pour la Communication Scientifique Directe)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I1294671590","host_organization_name":"Centre National de la Recherche Scientifique","host_organization_lineage":["https://openalex.org/I1294671590"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"Conf\u00e9rence sur l'Apprentissage automatique, Universit\u00e9 de Montpellier, Jul 2026, Montpellier, France","raw_type":"info:eu-repo/semantics/conferenceObject"},"type":"conference-paper","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.29980","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5057955697","display_name":"Louis Bagot","orcid":"https://orcid.org/0000-0001-6300-6993"},"institutions":[{"id":"https://openalex.org/I54594937","display_name":"Sysmex (Japan)","ror":"https://ror.org/00gfstq19","country_code":"JP","type":"company","lineage":["https://openalex.org/I54594937"]}],"countries":["JP"],"is_corresponding":false,"raw_author_name":"Bagot, Louis","raw_affiliation_strings":["SyCoSMA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"SyCoSMA","institution_ids":["https://openalex.org/I54594937"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5029055546","display_name":"Mathieu Lefort","orcid":"https://orcid.org/0000-0001-8581-0536"},"institutions":[{"id":"https://openalex.org/I2802519937","display_name":"Institut de Recherche en Informatique et Syst\u00e8mes Al\u00e9atoires","ror":"https://ror.org/00myn0z94","country_code":"FR","type":"facility","lineage":["https://openalex.org/I1294671590","https://openalex.org/I1294671590","https://openalex.org/I1326498283","https://openalex.org/I205703379","https://openalex.org/I2802204017","https://openalex.org/I2802519937","https://openalex.org/I28221208","https://openalex.org/I4210127572","https://openalex.org/I4210159245","https://openalex.org/I56067802"]},{"id":"https://openalex.org/I4210157684","display_name":"Institut f\u00fcr Regionale Innovation und Sozialforschung","ror":"https://ror.org/04r7vw960","country_code":"DE","type":"facility","lineage":["https://openalex.org/I4210157684"]}],"countries":["DE","FR"],"is_corresponding":false,"raw_author_name":"Lefort, Mathieu","raw_affiliation_strings":["LIRIS, SyCoSMA, IRISA, MALT, UR"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"LIRIS, SyCoSMA, IRISA, MALT, UR","institution_ids":["https://openalex.org/I2802519937","https://openalex.org/I4210157684"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5134878852","display_name":"Laetitia Matignon","orcid":null},"institutions":[{"id":"https://openalex.org/I54594937","display_name":"Sysmex (Japan)","ror":"https://ror.org/00gfstq19","country_code":"JP","type":"company","lineage":["https://openalex.org/I54594937"]}],"countries":["JP"],"is_corresponding":false,"raw_author_name":"Matignon, La\u00ebtitia","raw_affiliation_strings":["SyCoSMA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"SyCoSMA","institution_ids":["https://openalex.org/I54594937"]}]}],"institutions":[],"countries_distinct_count":3,"institutions_distinct_count":3,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.85079365,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.4794999957084656,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},"topics":[{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.4794999957084656,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.3903999924659729,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.01810000091791153,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/generality","display_name":"Generality","score":0.8111000061035156},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7384999990463257},{"id":"https://openalex.org/keywords/transfer-of-learning","display_name":"Transfer of learning","score":0.5819000005722046},{"id":"https://openalex.org/keywords/context","display_name":"Context (archaeology)","score":0.5792999863624573},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.5507000088691711},{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.5360000133514404},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.5256999731063843},{"id":"https://openalex.org/keywords/frame","display_name":"Frame (networking)","score":0.47130000591278076}],"concepts":[{"id":"https://openalex.org/C2780767217","wikidata":"https://www.wikidata.org/wiki/Q5532421","display_name":"Generality","level":2,"score":0.8111000061035156},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7384999990463257},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.722599983215332},{"id":"https://openalex.org/C150899416","wikidata":"https://www.wikidata.org/wiki/Q1820378","display_name":"Transfer of learning","level":2,"score":0.5819000005722046},{"id":"https://openalex.org/C2779343474","wikidata":"https://www.wikidata.org/wiki/Q3109175","display_name":"Context (archaeology)","level":2,"score":0.5792999863624573},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.5507000088691711},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.5360000133514404},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.5256999731063843},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5171999931335449},{"id":"https://openalex.org/C126042441","wikidata":"https://www.wikidata.org/wiki/Q1324888","display_name":"Frame (networking)","level":2,"score":0.47130000591278076},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.40070000290870667},{"id":"https://openalex.org/C2776960227","wikidata":"https://www.wikidata.org/wiki/Q2586354","display_name":"Knowledge transfer","level":2,"score":0.34529998898506165},{"id":"https://openalex.org/C182306322","wikidata":"https://www.wikidata.org/wiki/Q1779371","display_name":"Order (exchange)","level":2,"score":0.3450999855995178},{"id":"https://openalex.org/C2780966255","wikidata":"https://www.wikidata.org/wiki/Q5474306","display_name":"Foundation (evidence)","level":2,"score":0.3375999927520752},{"id":"https://openalex.org/C2986087404","wikidata":"https://www.wikidata.org/wiki/Q15946010","display_name":"Online learning","level":2,"score":0.3246999979019165},{"id":"https://openalex.org/C2776731479","wikidata":"https://www.wikidata.org/wiki/Q15142682","display_name":"Policy transfer","level":2,"score":0.321399986743927},{"id":"https://openalex.org/C2780102126","wikidata":"https://www.wikidata.org/wiki/Q10928179","display_name":"Online and offline","level":2,"score":0.31450000405311584},{"id":"https://openalex.org/C2776175482","wikidata":"https://www.wikidata.org/wiki/Q1195816","display_name":"Transfer (computing)","level":2,"score":0.29910001158714294},{"id":"https://openalex.org/C2780490138","wikidata":"https://www.wikidata.org/wiki/Q7079636","display_name":"Offline learning","level":3,"score":0.29159998893737793},{"id":"https://openalex.org/C2777938197","wikidata":"https://www.wikidata.org/wiki/Q7834022","display_name":"Transfer of training","level":2,"score":0.2612000107765198},{"id":"https://openalex.org/C2779178101","wikidata":"https://www.wikidata.org/wiki/Q6987274","display_name":"Negative transfer","level":3,"score":0.25850000977516174}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:oai:HAL:hal-05669745v2","is_oa":false,"landing_page_url":"https://hal.science/hal-05669745","pdf_url":null,"source":{"id":"https://openalex.org/S4306402512","display_name":"HAL (Le Centre pour la Communication Scientifique Directe)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I1294671590","host_organization_name":"Centre National de la Recherche Scientifique","host_organization_lineage":["https://openalex.org/I1294671590"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"Conf\u00e9rence sur l'Apprentissage automatique, Universit\u00e9 de Montpellier, Jul 2026, Montpellier, France","raw_type":"info:eu-repo/semantics/conferenceObject"},{"id":"doi:10.48550/arxiv.2606.29980","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.29980","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.29980","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.29980","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Zero-shot":[0],"Transfer":[1],"in":[2,54,98,156,170,200,222],"Reinforcement":[3],"Learning":[4],"(RL)":[5],"aims":[6],"to":[7,79,90,95,114,122,158,164,184,194,240,289],"train":[8],"an":[9,275],"agent":[10,70],"that":[11,177,190,263],"can":[12,181,265],"generate":[13,115,185],"optimal":[14,242],"policies":[15],"for":[16],"any":[17],"reward":[18,76,102,125,228,250],"function,":[19],"without":[20],"additional":[21],"learning":[22,150,198],"at":[23,209],"transfer":[24,67,139,169],"time,":[25],"while":[26],"training":[27],"only":[28],"on":[29,285],"reward-free":[30],"trajectories.":[31],"For":[32],"their":[33],"generality":[34],"over":[35],"tasks,":[36],"such":[37,116],"models":[38],"are":[39],"sometimes":[40],"called":[41],"``Behavioral":[42],"Foundation":[43],"Models''":[44],"(BFMs).":[45],"While":[46],"they":[47],"have":[48],"shown":[49],"strong":[50],"performances":[51],"and":[52,60,229,261,281],"improvements":[53],"recent":[55],"years,":[56],"the":[57,66,69,75,92,101,124,129,134,144,174,178,212,218,223,235,241,245,269,272,291],"current":[58,135],"framework":[59,136,284],"algorithms":[61],"still":[62],"assume":[63],"that,":[64],"during":[65],"phase,":[68],"is":[71,103,111,120,140,192],"informed":[72],"offline":[73,138],"about":[74],"(the":[77],"task":[78],"solve)":[80],"through":[81,126,151,268],"a":[82,104,117,203,216,227,230,254,286],"dataset":[83],"of":[84,137,148,202,248,271,274,293],"state-reward":[85],"pairs,":[86],"which":[87,153,225],"it":[88,110,119,191,221],"uses":[89],"pick":[91],"best":[93],"policy":[94],"deploy.":[96],"However,":[97],"practice":[99],"if":[100],"black-box":[105],"(e.g.":[106],"direct":[107],"user":[108],"feedback),":[109],"not":[112,141],"possible":[113,193],"dataset:":[118],"necessary":[121],"observe":[123],"interactions":[127],"with":[128,143,173],"environment.":[130],"In":[131,244],"other":[132],"words,":[133],"aligned":[142],"traditional":[145],"RL":[146],"setting":[147],"online":[149,168,197],"trial-and-error,":[152],"requires":[154],"exploration":[155,186,264],"order":[157],"find":[159],"rewards.":[160],"This":[161],"paper":[162],"proposes":[163],"tackle":[165],"this":[166,196],"new":[167,231],"zero-shot":[171],"RL,":[172],"key":[175],"insight":[176],"BFM":[179,219],"itself":[180],"be":[182,266],"used":[183],"policies.":[187],"We":[188,278],"show":[189,262],"frame":[195],"problem":[199],"terms":[201],"bandit-like":[204],"exploration-exploitation":[205],"problem.":[206],"More":[207],"precisely,":[208],"each":[210],"step":[211],"bandit":[213],"algorithm":[214],"recommends":[215],"policy,":[217],"executes":[220],"environment,":[224],"yields":[226],"state;":[232],"we":[233,238,252],"repeat":[234],"process":[236],"until":[237],"converge":[239],"policy.":[243],"popular":[246],"context":[247],"linear":[249],"approximation,":[251],"derive":[253],"formulation":[255],"inspired":[256],"by":[257],"Upper":[258],"Confidence":[259],"Bound":[260],"achieved":[267],"minimization":[270],"eigenvalues":[273],"uncertainty":[276],"matrix.":[277],"evaluate":[279],"qualitatively":[280],"quantitatively":[282],"our":[283,294],"simple":[287],"environment":[288],"validate":[290],"concept":[292],"method.":[295]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-07-01T00:00:00"}
