{"id":"https://openalex.org/W4416178153","doi":"https://doi.org/10.1109/secdev66745.2025.00030","title":"Understanding Minimal-Time Attacks on Reinforcement Learning Agents","display_name":"Understanding Minimal-Time Attacks on Reinforcement Learning Agents","publication_year":2025,"publication_date":"2025-10-14","ids":{"openalex":"https://openalex.org/W4416178153","doi":"https://doi.org/10.1109/secdev66745.2025.00030"},"language":null,"primary_location":{"id":"doi:10.1109/secdev66745.2025.00030","is_oa":false,"landing_page_url":"https://doi.org/10.1109/secdev66745.2025.00030","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE Secure Development Conference (SecDev)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5029290586","display_name":"Veena Krish","orcid":"https://orcid.org/0000-0002-4151-5620"},"institutions":[{"id":"https://openalex.org/I59553526","display_name":"Stony Brook University","ror":"https://ror.org/05qghxh33","country_code":"US","type":"education","lineage":["https://openalex.org/I59553526"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Veena Krish","raw_affiliation_strings":["Stony Brook University,Computer Science,Stony Brook,NY,USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Stony Brook University,Computer Science,Stony Brook,NY,USA","institution_ids":["https://openalex.org/I59553526"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5021423602","display_name":"Amir Rahmati","orcid":"https://orcid.org/0000-0001-7361-1898"},"institutions":[{"id":"https://openalex.org/I59553526","display_name":"Stony Brook University","ror":"https://ror.org/05qghxh33","country_code":"US","type":"education","lineage":["https://openalex.org/I59553526"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Amir Rahmati","raw_affiliation_strings":["Stony Brook University,Computer Science,Stony Brook,NY,USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Stony Brook University,Computer Science,Stony Brook,NY,USA","institution_ids":["https://openalex.org/I59553526"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I59553526"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"186","last_page":"195"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.9873999953269958,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.9873999953269958,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.002400000113993883,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.002199999988079071,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/leverage","display_name":"Leverage (statistics)","score":0.73089998960495},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.652899980545044},{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.5878000259399414},{"id":"https://openalex.org/keywords/adversarial-system","display_name":"Adversarial system","score":0.4828999936580658},{"id":"https://openalex.org/keywords/threat-model","display_name":"Threat model","score":0.3479999899864197},{"id":"https://openalex.org/keywords/order","display_name":"Order (exchange)","score":0.30630001425743103}],"concepts":[{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.73089998960495},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6801999807357788},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.652899980545044},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.5878000259399414},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5077000260353088},{"id":"https://openalex.org/C38652104","wikidata":"https://www.wikidata.org/wiki/Q3510521","display_name":"Computer security","level":1,"score":0.4893999993801117},{"id":"https://openalex.org/C37736160","wikidata":"https://www.wikidata.org/wiki/Q1801315","display_name":"Adversarial system","level":2,"score":0.4828999936580658},{"id":"https://openalex.org/C140547941","wikidata":"https://www.wikidata.org/wiki/Q7797194","display_name":"Threat model","level":2,"score":0.3479999899864197},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.33320000767707825},{"id":"https://openalex.org/C182306322","wikidata":"https://www.wikidata.org/wiki/Q1779371","display_name":"Order (exchange)","level":2,"score":0.30630001425743103},{"id":"https://openalex.org/C41550386","wikidata":"https://www.wikidata.org/wiki/Q529909","display_name":"Multi-agent system","level":2,"score":0.30300000309944153},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2879999876022339},{"id":"https://openalex.org/C34413123","wikidata":"https://www.wikidata.org/wiki/Q170978","display_name":"Robotics","level":3,"score":0.27570000290870667}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/secdev66745.2025.00030","is_oa":false,"landing_page_url":"https://doi.org/10.1109/secdev66745.2025.00030","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE Secure Development Conference (SecDev)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1],"(RL)":[2],"agents":[3,32,127],"are":[4,33,254],"known":[5],"to":[6,9,12,25,29,35,82,107,199],"be":[7,231,263],"vulnerable":[8,34],"small":[10,136],"perturbations":[11],"observations":[13],"that":[14,160,227,243],"can":[15,131,230,262],"disproportionately":[16],"degrade":[17,108,201],"performance.":[18],"An":[19],"active":[20],"area":[21],"of":[22,43,50,138,205,217],"research":[23],"seeks":[24],"understand":[26],"the":[27,51,76,80,84,102,109,129,162,202,206],"extent":[28],"which":[30,190],"these":[31,54,91,126],"stealthy":[36],"attacks":[37,55,92,235,247],"by":[38,249],"targeting":[39],"a":[40,120,135,166],"limited":[41],"number":[42,137],"time":[44,73],"steps":[45,74],"associated":[46],"with":[47,220,234],"\u201ccritical":[48],"moments\u201d":[49],"agent.":[52,207],"However,":[53],"suffer":[56],"from":[57],"two":[58],"major":[59],"shortcomings:":[60],"(i)":[61],"they":[62,70],"assume":[63],"an":[64,158],"often":[65,93],"unrealistic":[66],"threat":[67,123,144],"model":[68,124],"as":[69,255,257],"target":[71],"disparate":[72],"across":[75],"agent's":[77,110],"trajectory,":[78],"requiring":[79],"attacker":[81,130],"manipulate":[83],"agent":[85,163,228],"at":[86,194],"arbitrary":[87],"times,":[88],"and":[89,96,185,223,225,261],"(ii)":[90],"require":[94],"complex":[95],"prohibitively":[97],"time-consuming":[98],"methods":[99],"for":[100,125,134],"crafting":[101],"adversarial":[103],"attack":[104,133,159],"in":[105,182,189,265],"order":[106],"performance":[111,204,229],"within":[112,165],"short":[113,167],"bursts.":[114],"In":[115,169],"this":[116,143],"work,":[117],"we":[118,146,175,186],"propose":[119,147],"more":[121,266],"restrictive":[122],"where":[128],"only":[132],"consecutive":[139,238],"steps.":[140],"Based":[141],"on":[142,214],"model,":[145],"<tex":[148,172,211,251],"xmlns:mml=\"http://www.w3.org/1998/Math/MathML\"":[149,153,155,173,212,252],"xmlns:xlink=\"http://www.w3.org/1999/xlink\">$\\operatorname{Sequ}":[150],"\\Lambda$</tex>":[151],"<sup":[152],"xmlns:xlink=\"http://www.w3.org/1999/xlink\">1</sup><sup":[154],"xmlns:xlink=\"http://www.w3.org/1999/xlink\">1</sup>Sequential":[156],"Attack,":[157],"targets":[161],"sequentially":[164],"window.":[168],"developing":[170],"Sequ":[171,210,250],"xmlns:xlink=\"http://www.w3.org/1999/xlink\">$\\Lambda$</tex>,":[174],"leverage":[176],"key":[177,196],"ideas":[178],"behind":[179,192],"critical-moment":[180],"approaches":[181],"our":[183],"design,":[184],"discover":[187],"situations":[188],"assumptions":[191],"attacking":[193],"sporadic,":[195],"moments":[197],"fail":[198],"adequately":[200],"testtime":[203],"We":[208],"evaluate":[209],"xmlns:xlink=\"http://www.w3.org/1999/xlink\">$\\Lambda$</tex>":[213,253],"Mujoco":[215],"environments":[216],"robotics":[218],"simulations":[219],"continuous":[221],"state-":[222],"action-spaces":[224],"show":[226,242],"drastically":[232],"degraded":[233],"during":[236],"brief":[237],"windows.":[239],"Our":[240],"results":[241],"short-duration":[244],"critical":[245],"window":[246],"created":[248],"effective":[256],"their":[258],"non-consecutive":[259],"counterparts":[260],"deployed":[264],"realistic":[267],"settings.":[268]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-11-13T00:00:00"}
