{"id":"https://openalex.org/W7139931807","doi":"https://doi.org/10.48550/arxiv.2603.18326","title":"Escaping Offline Pessimism: Vector-Field Reward Shaping for Safe Frontier Exploration","display_name":"Escaping Offline Pessimism: Vector-Field Reward Shaping for Safe Frontier Exploration","publication_year":2026,"publication_date":"2026-03-18","ids":{"openalex":"https://openalex.org/W7139931807","doi":"https://doi.org/10.48550/arxiv.2603.18326"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.18326","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.18326","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.18326","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5130223702","display_name":"Amirhossein Roknilamouki","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Roknilamouki, Amirhossein","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5130235493","display_name":"Arnob Ghosh","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ghosh, Arnob","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5082165966","display_name":"Eylem Ekici","orcid":"https://orcid.org/0000-0002-6227-8951"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ekici, Eylem","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5130217267","display_name":"Ness B. Shroff","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shroff, Ness B.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.39800000190734863,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.39800000190734863,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11099","display_name":"Autonomous Vehicle Technology and Safety","score":0.2168000042438507,"subfield":{"id":"https://openalex.org/subfields/2203","display_name":"Automotive Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.08649999648332596,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7226999998092651},{"id":"https://openalex.org/keywords/traverse","display_name":"Traverse","score":0.6525999903678894},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.482699990272522},{"id":"https://openalex.org/keywords/boundary","display_name":"Boundary (topology)","score":0.44690001010894775},{"id":"https://openalex.org/keywords/unexpected-events","display_name":"Unexpected events","score":0.36160001158714294},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.3540000021457672},{"id":"https://openalex.org/keywords/aliasing","display_name":"Aliasing","score":0.34139999747276306},{"id":"https://openalex.org/keywords/data-collection","display_name":"Data collection","score":0.3352999985218048}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7226999998092651},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.65420001745224},{"id":"https://openalex.org/C176809094","wikidata":"https://www.wikidata.org/wiki/Q15401496","display_name":"Traverse","level":2,"score":0.6525999903678894},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.482699990272522},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4693000018596649},{"id":"https://openalex.org/C62354387","wikidata":"https://www.wikidata.org/wiki/Q875399","display_name":"Boundary (topology)","level":2,"score":0.44690001010894775},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3695000112056732},{"id":"https://openalex.org/C2776544517","wikidata":"https://www.wikidata.org/wiki/Q189447","display_name":"Unexpected events","level":2,"score":0.36160001158714294},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.3540000021457672},{"id":"https://openalex.org/C4069607","wikidata":"https://www.wikidata.org/wiki/Q868732","display_name":"Aliasing","level":3,"score":0.34139999747276306},{"id":"https://openalex.org/C133462117","wikidata":"https://www.wikidata.org/wiki/Q4929239","display_name":"Data collection","level":2,"score":0.3352999985218048},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.32109999656677246},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.3197999894618988},{"id":"https://openalex.org/C55166926","wikidata":"https://www.wikidata.org/wiki/Q2892946","display_name":"Oracle","level":2,"score":0.31299999356269836},{"id":"https://openalex.org/C61797465","wikidata":"https://www.wikidata.org/wiki/Q1188986","display_name":"Term (time)","level":2,"score":0.3116999864578247},{"id":"https://openalex.org/C6683253","wikidata":"https://www.wikidata.org/wiki/Q7075535","display_name":"Obstacle avoidance","level":4,"score":0.2973000109195709},{"id":"https://openalex.org/C106131492","wikidata":"https://www.wikidata.org/wiki/Q3072260","display_name":"Filter (signal processing)","level":2,"score":0.28349998593330383},{"id":"https://openalex.org/C126042441","wikidata":"https://www.wikidata.org/wiki/Q1324888","display_name":"Frame (networking)","level":2,"score":0.27790001034736633},{"id":"https://openalex.org/C196340769","wikidata":"https://www.wikidata.org/wiki/Q7698910","display_name":"Temporal difference learning","level":3,"score":0.26750001311302185},{"id":"https://openalex.org/C2776378700","wikidata":"https://www.wikidata.org/wiki/Q3030775","display_name":"Distraction","level":2,"score":0.2549999952316284}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.18326","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.18326","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.18326","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.18326","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"While":[0],"offline":[1,41,123],"reinforcement":[2,29],"learning":[3],"provides":[4],"reliable":[5],"policies":[6],"for":[7,68,112],"real-world":[8],"deployment,":[9],"its":[10],"inherent":[11],"pessimism":[12],"severely":[13],"restricts":[14],"an":[15,50,118],"agent's":[16],"ability":[17],"to":[18,52,65,79,106],"explore":[19],"and":[20,43,143],"collect":[21],"novel":[22,100],"data":[23,208],"online.":[24],"Drawing":[25],"inspiration":[26],"from":[27,122],"safe":[28,69,109],"learning,":[30],"exploring":[31],"near":[32],"the":[33,40,47,85,92,136,151,156,174],"boundary":[34,110,175],"of":[35,155],"regions":[36,67],"well":[37],"covered":[38],"by":[39,46,181],"dataset":[42],"reliably":[44],"modeled":[45],"simulator":[48],"allows":[49],"agent":[51,86,137],"take":[53],"manageable":[54],"risks--venturing":[55],"into":[56],"informative":[57,207],"but":[58],"moderate-uncertainty":[59],"states":[60],"while":[61,176,204],"remaining":[62],"close":[63],"enough":[64],"familiar":[66],"recovery.":[70],"However,":[71],"naively":[72],"rewarding":[73],"this":[74,165],"boundary-seeking":[75],"behavior":[76,172],"can":[77],"lead":[78],"a":[80,99,131,139,144,191],"degenerate":[81,178],"parking":[82],"behavior,":[83],"where":[84],"simply":[87],"stops":[88],"once":[89],"it":[90],"reaches":[91],"frontier.":[93],"To":[94],"solve":[95],"this,":[96],"we":[97,162,196],"propose":[98],"vector-field":[101],"reward":[102,126,166,185],"shaping":[103,186],"paradigm":[104],"designed":[105],"induce":[107],"continuous,":[108],"exploration":[111],"non-adaptive":[113],"deployed":[114],"policies.":[115],"Operating":[116],"on":[117,190],"uncertainty":[119,141,157,202],"oracle":[120],"trained":[121],"data,":[124],"our":[125,183],"combines":[127],"two":[128],"complementary":[129],"components:":[130],"gradient-alignment":[132],"term":[133,146],"that":[134,147,164,198],"attracts":[135],"toward":[138],"target":[140],"level,":[142],"rotational-flow":[145],"promotes":[148],"motion":[149],"along":[150,173],"local":[152],"tangent":[153],"plane":[154],"manifold.":[158],"Through":[159],"theoretical":[160],"analysis,":[161],"show":[163],"structure":[167],"naturally":[168],"induces":[169],"sustained":[170],"exploratory":[171],"preventing":[177],"solutions.":[179],"Empirically,":[180],"integrating":[182],"proposed":[184],"with":[187,210],"Soft":[188],"Actor-Critic":[189],"2D":[192],"continuous":[193],"navigation":[194],"task,":[195],"validate":[197],"agents":[199],"successfully":[200],"traverse":[201],"boundaries":[203],"balancing":[205],"safe,":[206],"collection":[209],"primary":[211],"task":[212],"completion.":[213]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-03-21T00:00:00"}
