{"id":"https://openalex.org/W7158795812","doi":"https://doi.org/10.48550/arxiv.2604.26516","title":"Lyapunov-Guided Self-Alignment: Test-Time Adaptation for Offline Safe Reinforcement Learning","display_name":"Lyapunov-Guided Self-Alignment: Test-Time Adaptation for Offline Safe Reinforcement Learning","publication_year":2026,"publication_date":"2026-04-29","ids":{"openalex":"https://openalex.org/W7158795812","doi":"https://doi.org/10.48550/arxiv.2604.26516"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.26516","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.26516","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.26516","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5134926519","display_name":"Seungyub Han","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Han, Seungyub","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5100684518","display_name":"Hyungjin Kim","orcid":"https://orcid.org/0000-0003-0722-0033"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kim, Hyungjin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5134928145","display_name":"Jungwoo Lee","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lee, Jungwoo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.4523000121116638,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.4523000121116638,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.3395000100135803,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.04410000145435333,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8138999938964844},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.5903000235557556},{"id":"https://openalex.org/keywords/transformer","display_name":"Transformer","score":0.4699999988079071},{"id":"https://openalex.org/keywords/adaptation","display_name":"Adaptation (eye)","score":0.4586000144481659},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.40369999408721924},{"id":"https://openalex.org/keywords/bayesian-probability","display_name":"Bayesian probability","score":0.38580000400543213},{"id":"https://openalex.org/keywords/bayesian-inference","display_name":"Bayesian inference","score":0.3833000063896179}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8138999938964844},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6087999939918518},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6053000092506409},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.5903000235557556},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5339000225067139},{"id":"https://openalex.org/C66322947","wikidata":"https://www.wikidata.org/wiki/Q11658","display_name":"Transformer","level":3,"score":0.4699999988079071},{"id":"https://openalex.org/C139807058","wikidata":"https://www.wikidata.org/wiki/Q352374","display_name":"Adaptation (eye)","level":2,"score":0.4586000144481659},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.40369999408721924},{"id":"https://openalex.org/C107673813","wikidata":"https://www.wikidata.org/wiki/Q812534","display_name":"Bayesian probability","level":2,"score":0.38580000400543213},{"id":"https://openalex.org/C160234255","wikidata":"https://www.wikidata.org/wiki/Q812535","display_name":"Bayesian inference","level":3,"score":0.3833000063896179},{"id":"https://openalex.org/C2776544517","wikidata":"https://www.wikidata.org/wiki/Q189447","display_name":"Unexpected events","level":2,"score":0.33340001106262207},{"id":"https://openalex.org/C49937458","wikidata":"https://www.wikidata.org/wiki/Q2599292","display_name":"Probabilistic logic","level":2,"score":0.3305000066757202},{"id":"https://openalex.org/C89611455","wikidata":"https://www.wikidata.org/wiki/Q6804646","display_name":"Mechanism (biology)","level":2,"score":0.28760001063346863},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.27970001101493835},{"id":"https://openalex.org/C127413603","wikidata":"https://www.wikidata.org/wiki/Q11023","display_name":"Engineering","level":0,"score":0.2727000117301941},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.2711000144481659},{"id":"https://openalex.org/C199190896","wikidata":"https://www.wikidata.org/wiki/Q3509276","display_name":"Learning classifier system","level":3,"score":0.27090001106262207}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.26516","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.26516","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.26516","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.26516","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Offline":[0],"reinforcement":[1],"learning":[2],"(RL)":[3],"agents":[4],"often":[5],"fail":[6],"when":[7],"deployed,":[8],"as":[9,74,111],"the":[10,46,54,65,78],"gap":[11],"between":[12],"training":[13],"datasets":[14],"and":[15,61,99,120,127],"real":[16],"environments":[17],"leads":[18],"to":[19,80],"unsafe":[20],"behavior.":[21],"To":[22],"address":[23],"this,":[24],"we":[25],"present":[26],"SAS":[27,92,123],"(Self-Alignment":[28],"for":[29],"Safety),":[30],"a":[31,104],"transformer-based":[32],"framework":[33],"that":[34],"enables":[35],"test-time":[36],"adaptation":[37],"in":[38],"offline":[39],"safe":[40],"RL":[41,106],"without":[42],"retraining.":[43],"In":[44,90],"SAS,":[45],"main":[47],"mechanism":[48],"is":[49],"self-alignment:":[50],"at":[51],"test":[52],"time,":[53],"pretrained":[55],"agent":[56,79],"generates":[57],"several":[58],"imagined":[59],"trajectories":[60],"selects":[62],"those":[63],"satisfying":[64],"Lyapunov":[66],"condition.":[67],"These":[68],"feasible":[69],"segments":[70],"are":[71],"then":[72],"recycled":[73],"in-context":[75],"prompts,":[76,98],"allowing":[77],"realign":[81],"its":[82,100],"behavior":[83],"toward":[84],"safety":[85],"while":[86,129],"avoiding":[87],"parameter":[88],"updates.":[89],"effect,":[91],"turns":[93],"Lyapunov-guided":[94],"imagination":[95],"into":[96],"control-invariant":[97],"transformer":[101],"architecture":[102],"admits":[103],"hierarchical":[105],"interpretation":[107],"where":[108],"prompting":[109],"functions":[110],"Bayesian":[112],"inference":[113],"over":[114],"latent":[115],"skills.":[116],"Across":[117],"Safety":[118],"Gymnasium":[119],"MuJoCo":[121],"benchmarks,":[122],"consistently":[124],"reduces":[125],"cost":[126],"failure":[128],"maintaining":[130],"or":[131],"improving":[132],"return.":[133]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-05-01T00:00:00"}
