{"id":"https://openalex.org/W7160296391","doi":"https://doi.org/10.48550/arxiv.2605.01195","title":"TAIL-Safe: Task-Agnostic Safety Monitoring for Imitation Learning Policies","display_name":"TAIL-Safe: Task-Agnostic Safety Monitoring for Imitation Learning Policies","publication_year":2026,"publication_date":"2026-05-02","ids":{"openalex":"https://openalex.org/W7160296391","doi":"https://doi.org/10.48550/arxiv.2605.01195"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.01195","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.01195","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.01195","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5135296735","display_name":"Riad Ahmed","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ahmed, Riad","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5035462171","display_name":"Momotaz Begum","orcid":"https://orcid.org/0000-0002-1073-2008"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Begum, Momotaz","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.595300018787384,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.595300018787384,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.18119999766349792,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10784","display_name":"Muscle activation and electromyography studies","score":0.040800001472234726,"subfield":{"id":"https://openalex.org/subfields/2204","display_name":"Biomedical Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.4740000069141388},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.47200000286102295},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.46650001406669617},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.460099995136261},{"id":"https://openalex.org/keywords/construct","display_name":"Construct (python library)","score":0.4219000041484833},{"id":"https://openalex.org/keywords/software-deployment","display_name":"Software deployment","score":0.4025000035762787},{"id":"https://openalex.org/keywords/field","display_name":"Field (mathematics)","score":0.3743000030517578},{"id":"https://openalex.org/keywords/invariant","display_name":"Invariant (physics)","score":0.3634999990463257}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6769999861717224},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5429999828338623},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4853000044822693},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.4740000069141388},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.47200000286102295},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.46650001406669617},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.460099995136261},{"id":"https://openalex.org/C2780801425","wikidata":"https://www.wikidata.org/wiki/Q5164392","display_name":"Construct (python library)","level":2,"score":0.4219000041484833},{"id":"https://openalex.org/C105339364","wikidata":"https://www.wikidata.org/wiki/Q2297740","display_name":"Software deployment","level":2,"score":0.4025000035762787},{"id":"https://openalex.org/C9652623","wikidata":"https://www.wikidata.org/wiki/Q190109","display_name":"Field (mathematics)","level":2,"score":0.3743000030517578},{"id":"https://openalex.org/C190470478","wikidata":"https://www.wikidata.org/wiki/Q2370229","display_name":"Invariant (physics)","level":2,"score":0.3634999990463257},{"id":"https://openalex.org/C46355384","wikidata":"https://www.wikidata.org/wiki/Q726686","display_name":"Compromise","level":2,"score":0.350600004196167},{"id":"https://openalex.org/C168167062","wikidata":"https://www.wikidata.org/wiki/Q1117970","display_name":"Component (thermodynamics)","level":2,"score":0.3395000100135803},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.32429999113082886},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.31869998574256897},{"id":"https://openalex.org/C120936955","wikidata":"https://www.wikidata.org/wiki/Q2155640","display_name":"Empirical research","level":2,"score":0.31790000200271606},{"id":"https://openalex.org/C148220186","wikidata":"https://www.wikidata.org/wiki/Q7111912","display_name":"Outcome (game theory)","level":2,"score":0.2976999878883362},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2759999930858612},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.2721000015735626},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.26330000162124634},{"id":"https://openalex.org/C34413123","wikidata":"https://www.wikidata.org/wiki/Q170978","display_name":"Robotics","level":3,"score":0.2558000087738037},{"id":"https://openalex.org/C61326573","wikidata":"https://www.wikidata.org/wiki/Q1496376","display_name":"Gaussian process","level":3,"score":0.2551000118255615},{"id":"https://openalex.org/C38652104","wikidata":"https://www.wikidata.org/wiki/Q3510521","display_name":"Computer security","level":1,"score":0.25440001487731934}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.01195","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.01195","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.01195","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.01195","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/16","score":0.6160311102867126,"display_name":"Peace, Justice and strong institutions"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Recent":[0],"imitation":[1],"learning":[2,15],"(IL)":[3],"algorithms":[4],"such":[5],"as":[6],"flow-matching":[7,221],"and":[8,38,138],"diffusion":[9],"policies":[10,21,54],"demonstrate":[11,219],"remarkable":[12],"performance":[13],"in":[14,55,110],"complex":[16],"manipulation":[17],"tasks.":[18],"However,":[19],"these":[20],"often":[22],"fail":[23,224],"even":[24],"when":[25,232],"operating":[26],"within":[27],"their":[28],"training":[29],"distribution":[30],"due":[31],"to":[32,35,44,51,72,94,125,178,181,186,210],"extreme":[33],"sensitivity":[34],"initial":[36],"conditions":[37],"irreducible":[39],"approximation":[40],"errors":[41],"that":[42,121,174,201,220],"lead":[43],"compounding":[45],"drift.":[46],"This":[47,87],"makes":[48],"it":[49,75,82],"unsafe":[50],"deploy":[52],"IL":[53,99],"the":[56,70,80,106,112,156,179,183,235],"field":[57],"where":[58,105],"out-of-distribution":[59],"scenarios":[60],"are":[61],"prevalent.":[62],"A":[63],"prerequisite":[64],"for":[65,96],"safe":[66,102],"deployment":[67],"is":[68],"enabling":[69],"policy":[71,107,158,184],"determine":[73],"whether":[74],"can":[76],"execute":[77],"a":[78,91,97,101,117,126,167,194,215],"task":[79,230],"way":[81],"was":[83],"learned":[84,113],"from":[85,104],"demonstrations.":[86],"paper":[88],"presents":[89],"TAIL-Safe,":[90],"principled":[92],"approach":[93],"identify,":[95],"trained":[98],"policy,":[100],"set":[103,142,151],"empirically":[108],"succeeds":[109],"completing":[111],"task.":[114],"We":[115],"propose":[116],"Lipschitz-continuous":[118],"Q-value":[119],"function":[120,145],"maps":[122],"state-action":[123,153],"pairs":[124],"long-term":[127],"safety":[128],"score":[129],"based":[130],"on":[131],"three":[132],"short-term":[133],"task-agnostic":[134],"criteria:":[135],"visibility,":[136],"recognizability,":[137],"graspability.":[139],"The":[140],"zero-superlevel":[141],"of":[143,205],"this":[144,163,190],"characterizes":[146],"an":[147,160],"empirical":[148],"control":[149],"invariant":[150],"over":[152],"pairs.":[154],"When":[155],"nominal":[157],"proposes":[159],"action":[161],"outside":[162],"set,":[164],"we":[165,192],"apply":[166],"recovery":[168],"mechanism":[169],"inspired":[170],"by":[171,234],"Nagumo's":[172],"theorem":[173],"uses":[175],"gradient":[176],"ascent":[177],"Q-function":[180],"steer":[182],"back":[185],"safety.":[187],"To":[188],"learn":[189],"Q-function,":[191],"construct":[193],"high-fidelity":[195],"digital":[196],"twin":[197],"using":[198],"Gaussian":[199],"Splatting":[200],"enables":[202],"systematic":[203],"collection":[204],"failure":[206],"data":[207],"without":[208],"risk":[209],"physical":[211],"hardware.":[212],"Experiments":[213],"with":[214],"Franka":[216],"Emika":[217],"robot":[218],"policies,":[222],"which":[223],"under":[225],"run-time":[226],"perturbations,":[227],"achieve":[228],"consistent":[229],"success":[231],"guided":[233],"proposed":[236],"TAIL-Safe.":[237]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-06T00:00:00"}
