{"id":"https://openalex.org/W7165653854","doi":"https://doi.org/10.48550/arxiv.2606.21271","title":"Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization","display_name":"Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization","publication_year":2026,"publication_date":"2026-06-19","ids":{"openalex":"https://openalex.org/W7165653854","doi":"https://doi.org/10.48550/arxiv.2606.21271"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.21271","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.21271","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.21271","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5099860126","display_name":"Marco Prattic\u00f2","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Prattic\u00f2, Marco","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5050747663","display_name":"Pietro Novelli","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Novelli, Pietro","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139217434","display_name":"Massimiliano Pontil","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Pontil, Massimiliano","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5048960946","display_name":"Carlo Ciliberto","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ciliberto, Carlo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6772000193595886,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6772000193595886,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.0674000009894371,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.01360000018030405,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7196999788284302},{"id":"https://openalex.org/keywords/maximization","display_name":"Maximization","score":0.6015999913215637},{"id":"https://openalex.org/keywords/entropy","display_name":"Entropy (arrow of time)","score":0.47540000081062317},{"id":"https://openalex.org/keywords/occupancy","display_name":"Occupancy","score":0.4652999937534332},{"id":"https://openalex.org/keywords/cross-entropy-method","display_name":"Cross-entropy method","score":0.38359999656677246},{"id":"https://openalex.org/keywords/entropy-maximization","display_name":"Entropy maximization","score":0.37709999084472656},{"id":"https://openalex.org/keywords/downstream","display_name":"Downstream (manufacturing)","score":0.3434000015258789},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.33379998803138733}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7196999788284302},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7039999961853027},{"id":"https://openalex.org/C2776330181","wikidata":"https://www.wikidata.org/wiki/Q18358244","display_name":"Maximization","level":2,"score":0.6015999913215637},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5260999798774719},{"id":"https://openalex.org/C106301342","wikidata":"https://www.wikidata.org/wiki/Q4117933","display_name":"Entropy (arrow of time)","level":2,"score":0.47540000081062317},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.47369998693466187},{"id":"https://openalex.org/C160331591","wikidata":"https://www.wikidata.org/wiki/Q7075743","display_name":"Occupancy","level":2,"score":0.4652999937534332},{"id":"https://openalex.org/C75782508","wikidata":"https://www.wikidata.org/wiki/Q3333633","display_name":"Cross-entropy method","level":4,"score":0.38359999656677246},{"id":"https://openalex.org/C127233936","wikidata":"https://www.wikidata.org/wiki/Q1417473","display_name":"Entropy maximization","level":3,"score":0.37709999084472656},{"id":"https://openalex.org/C2776207758","wikidata":"https://www.wikidata.org/wiki/Q5303302","display_name":"Downstream (manufacturing)","level":2,"score":0.3434000015258789},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.33379998803138733},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.3093000054359436},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.30790001153945923},{"id":"https://openalex.org/C4679612","wikidata":"https://www.wikidata.org/wiki/Q866298","display_name":"Aggregate (composite)","level":2,"score":0.30399999022483826},{"id":"https://openalex.org/C9679016","wikidata":"https://www.wikidata.org/wiki/Q1417473","display_name":"Principle of maximum entropy","level":2,"score":0.30000001192092896},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.28690001368522644},{"id":"https://openalex.org/C189950617","wikidata":"https://www.wikidata.org/wiki/Q937228","display_name":"Property (philosophy)","level":2,"score":0.2612999975681305},{"id":"https://openalex.org/C2779843651","wikidata":"https://www.wikidata.org/wiki/Q7390335","display_name":"SIGNAL (programming language)","level":2,"score":0.25699999928474426},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.25099998712539673}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.21271","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.21271","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.21271","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.21271","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Sparse":[0],"rewards":[1,108],"pose":[2],"a":[3,39,96,148,165],"central":[4],"challenge":[5],"in":[6,126],"reinforcement":[7,80],"learning,":[8,81],"since":[9],"agents":[10],"receive":[11],"no":[12],"informative":[13],"signal":[14,41],"until":[15],"they":[16],"reach":[17],"their":[18],"goal.":[19],"Intrinsic-reward":[20],"methods":[21,48],"address":[22],"this":[23,92],"issue":[24],"by":[25],"optimizing":[26],"non-stationary":[27],"objectives":[28],"such":[29],"as":[30],"novelty,":[31],"prediction":[32],"error,":[33],"or":[34,62],"skill":[35],"diversity,":[36],"thereby":[37],"injecting":[38],"supervision":[40],"into":[42,179],"the":[43,52,67,86,119,139],"problem.":[44],"While":[45],"effective,":[46],"these":[47],"often":[49],"require":[50],"that":[51,103],"extrinsic":[53],"(sparse)":[54],"reward":[55],"can":[56,123],"be":[57,124],"evaluated":[58],"--":[59],"either":[60],"online":[61],"during":[63,187],"offline":[64],"relabeling":[65],"of":[66,128,142,174],"stored":[68],"transitions.":[69],"This":[70],"limitation":[71],"is":[72],"particularly":[73],"vexing":[74],"for":[75,118,169,205],"multi-task,":[76],"meta-,":[77],"and":[78,122,159,182,191,202],"continual":[79],"where":[82],"agents'":[83],"interactions":[84],"with":[85,147,157,177],"environment":[87],"are":[88],"usually":[89],"reward-free.":[90],"In":[91,189],"work,":[93],"we":[94],"present":[95],"method":[97],"to":[98,106,144],"pre-train":[99],"transferable":[100],"exploration":[101],"policies":[102],"rapidly":[104],"adapt":[105],"sparse":[107,193],"at":[109],"downstream":[110,206],"task":[111],"time.":[112],"Our":[113],"objective":[114],"maximizes":[115],"state-space":[116],"covering":[117],"occupancy":[120,146],"measure,":[121],"framed":[125],"terms":[127],"entropy":[129,160],"maximization.":[130],"Its":[131],"algorithmic":[132],"implementation,":[133],"ROVER,":[134],"leverages":[135],"recent":[136],"advances":[137],"on":[138],"operatorial":[140],"formulation":[141],"RL":[143],"estimate":[145],"learned":[149],"resolvent":[150],"world":[151],"model,":[152],"bypassing":[153],"common":[154],"hurdles":[155],"associated":[156],"density":[158],"estimation.":[161],"ROVER":[162,196],"further":[163],"introduces":[164],"virtual":[166],"\"sink\"":[167],"state":[168],"unexplored":[170],"regions,":[171],"balancing":[172],"coverage":[173,201],"known":[175],"states":[176],"expansion":[178],"unseen":[180],"ones":[181],"preventing":[183],"cyclic":[184],"expansion-collapse":[185],"behavior":[186],"learning.":[188],"tabular":[190],"pixel-based":[192],"navigation":[194],"tasks,":[195],"produces":[197],"more":[198],"uniform":[199],"aggregate":[200],"stronger":[203],"initializations":[204],"tasks":[207],"than":[208],"standard":[209],"reward-free":[210],"baselines.":[211]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-06-24T00:00:00"}
