{"id":"https://openalex.org/W7140335015","doi":"https://doi.org/10.48550/arxiv.2603.22292","title":"Beyond Hard Constraints: Budget-Conditioned Reachability For Safe Offline Reinforcement Learning","display_name":"Beyond Hard Constraints: Budget-Conditioned Reachability For Safe Offline Reinforcement Learning","publication_year":2026,"publication_date":"2026-03-08","ids":{"openalex":"https://openalex.org/W7140335015","doi":"https://doi.org/10.48550/arxiv.2603.22292"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.22292","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.22292","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.22292","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5093902735","display_name":"Janaka Chathuranga Brahmanage","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Brahmanage, Janaka Chathuranga","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5130571468","display_name":"Akshat Kumar","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kumar, Akshat","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.7340999841690063,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.7340999841690063,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.08540000021457672,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11622","display_name":"Maritime Navigation and Safety","score":0.0414000004529953,"subfield":{"id":"https://openalex.org/subfields/2212","display_name":"Ocean Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reachability","display_name":"Reachability","score":0.9275000095367432},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.7271999716758728},{"id":"https://openalex.org/keywords/maximization","display_name":"Maximization","score":0.6072999835014343},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.5735999941825867},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5667999982833862},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.5288000106811523},{"id":"https://openalex.org/keywords/partially-observable-markov-decision-process","display_name":"Partially observable Markov decision process","score":0.4537999927997589},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.43860000371932983}],"concepts":[{"id":"https://openalex.org/C136643341","wikidata":"https://www.wikidata.org/wiki/Q1361526","display_name":"Reachability","level":2,"score":0.9275000095367432},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7441999912261963},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.7271999716758728},{"id":"https://openalex.org/C2776330181","wikidata":"https://www.wikidata.org/wiki/Q18358244","display_name":"Maximization","level":2,"score":0.6072999835014343},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.5735999941825867},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5667999982833862},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.5288000106811523},{"id":"https://openalex.org/C17098449","wikidata":"https://www.wikidata.org/wiki/Q176814","display_name":"Partially observable Markov decision process","level":4,"score":0.4537999927997589},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.43860000371932983},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.38420000672340393},{"id":"https://openalex.org/C37736160","wikidata":"https://www.wikidata.org/wiki/Q1801315","display_name":"Adversarial system","level":2,"score":0.36160001158714294},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3598000109195709},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.35910001397132874},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.34310001134872437},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.33629998564720154},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.3343999981880188},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.3010999858379364},{"id":"https://openalex.org/C22171661","wikidata":"https://www.wikidata.org/wiki/Q1074380","display_name":"Stochastic game","level":2,"score":0.273499995470047},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.25699999928474426},{"id":"https://openalex.org/C115988155","wikidata":"https://www.wikidata.org/wiki/Q3262192","display_name":"Decision problem","level":2,"score":0.25429999828338623}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.22292","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.22292","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.22292","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.22292","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.4213666617870331,"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Sequential":[0],"decision":[1],"making":[2],"using":[3],"Markov":[4],"Decision":[5],"Process":[6],"underpins":[7],"many":[8],"realworld":[9],"applications.":[10],"Both":[11],"model-based":[12],"and":[13,81,151],"model":[14],"free":[15],"methods":[16,75],"have":[17],"achieved":[18],"strong":[19],"results":[20],"in":[21],"these":[22],"settings.":[23],"However,":[24],"real-world":[25],"tasks":[26],"must":[27],"balance":[28],"reward":[29,102],"maximization":[30,103],"with":[31],"safety":[32,49,79,106,116],"constraints,":[33,80],"often":[34],"conflicting":[35],"objectives,":[36],"that":[37,61,100,131,159],"can":[38],"lead":[39],"to":[40,86],"unstable":[41,119],"min/max,":[42],"adversarial":[43],"optimization.":[44],"A":[45],"promising":[46],"alternative":[47],"is":[48],"reachability":[50,73,85,98],"analysis,":[51],"which":[52],"precomputes":[53],"a":[54,96,125,133,137,152],"forward-invariant":[55],"safe":[56,69,128,134,148],"state,":[57],"action":[58],"set,":[59],"ensuring":[60],"an":[62],"agent":[63],"starting":[64],"inside":[65],"this":[66,113],"set":[67,99,114],"remains":[68],"indefinitely.":[70],"Yet,":[71],"most":[72],"based":[74],"address":[76,91],"only":[77],"hard":[78],"little":[82],"work":[83],"extends":[84],"cumulative":[87,105],"cost":[88,107],"constraints.":[89,108],"To":[90],"this,":[92],"first,":[93],"we":[94,110],"define":[95],"safetyconditioned":[97],"decouples":[101],"from":[104,136],"Second,":[109],"show":[111],"how":[112],"enforces":[115],"constraints":[117],"without":[118,140],"min/max":[120],"or":[121,163],"Lagrangian":[122],"optimization,":[123],"yielding":[124],"novel":[126],"offline":[127,147],"RL":[129,149],"algorithm":[130],"learns":[132],"policy":[135],"fixed":[138],"dataset":[139],"environment":[141],"interaction.":[142],"Finally,":[143],"experiments":[144],"on":[145],"standard":[146],"benchmarks,":[150],"real":[153],"world":[154],"maritime":[155],"navigation":[156],"task":[157],"demonstrate":[158],"our":[160],"method":[161],"matches":[162],"outperforms":[164],"state":[165],"of":[166],"the":[167],"art":[168],"baselines":[169],"while":[170],"maintaining":[171],"safety.":[172]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-03-26T00:00:00"}
