{"id":"https://openalex.org/W7120243862","doi":"https://doi.org/10.48550/arxiv.2601.05152","title":"Safe Continual Reinforcement Learning Methods for Nonstationary Environments. Towards a Survey of the State of the Art","display_name":"Safe Continual Reinforcement Learning Methods for Nonstationary Environments. Towards a Survey of the State of the Art","publication_year":2026,"publication_date":"2026-01-08","ids":{"openalex":"https://openalex.org/W7120243862","doi":"https://doi.org/10.48550/arxiv.2601.05152"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2601.05152","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2601.05152","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2601.05152","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5050619633","display_name":"Timofey Tomashevskiy","orcid":null},"institutions":[],"countries":[],"is_corresponding":true,"raw_author_name":"Tomashevskiy, Timofey","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":["https://openalex.org/A5050619633"],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6233999729156494,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6233999729156494,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.061900001019239426,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.04670000076293945,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.9200999736785889},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.7163000106811523},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.5259000062942505},{"id":"https://openalex.org/keywords/adaptation","display_name":"Adaptation (eye)","score":0.46650001406669617},{"id":"https://openalex.org/keywords/categorization","display_name":"Categorization","score":0.3978999853134155},{"id":"https://openalex.org/keywords/markov-chain","display_name":"Markov chain","score":0.350600004196167}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.9200999736785889},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.7163000106811523},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.5259000062942505},{"id":"https://openalex.org/C139807058","wikidata":"https://www.wikidata.org/wiki/Q352374","display_name":"Adaptation (eye)","level":2,"score":0.46650001406669617},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.4230000078678131},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4104999899864197},{"id":"https://openalex.org/C94124525","wikidata":"https://www.wikidata.org/wiki/Q912550","display_name":"Categorization","level":2,"score":0.3978999853134155},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.350600004196167},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3384999930858612},{"id":"https://openalex.org/C112930515","wikidata":"https://www.wikidata.org/wiki/Q4389547","display_name":"Risk analysis (engineering)","level":1,"score":0.3303000032901764},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.3034999966621399},{"id":"https://openalex.org/C17098449","wikidata":"https://www.wikidata.org/wiki/Q176814","display_name":"Partially observable Markov decision process","level":4,"score":0.30320000648498535},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.30070000886917114},{"id":"https://openalex.org/C2986087404","wikidata":"https://www.wikidata.org/wiki/Q15946010","display_name":"Online learning","level":2,"score":0.2922999858856201},{"id":"https://openalex.org/C199190896","wikidata":"https://www.wikidata.org/wiki/Q3509276","display_name":"Learning classifier system","level":3,"score":0.26589998602867126},{"id":"https://openalex.org/C127413603","wikidata":"https://www.wikidata.org/wiki/Q11023","display_name":"Engineering","level":0,"score":0.2605000138282776},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.25949999690055847}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2601.05152","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2601.05152","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2601.05152","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2601.05152","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","score":0.7566404342651367,"id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"This":[0],"work":[1],"provides":[2],"a":[3],"state-of-the-art":[4],"survey":[5],"of":[6,37,48],"continual":[7,24,38,88,100,103,108,113,123,178],"safe":[8,26,40,49,77,82,87,96,102,107,112,116,122,126,129,131,137,145,157,161,165,167,170],"online":[9,25,39,65,78,117,124,158,162],"reinforcement":[10,27,41,66,89,104,109,114,127,138,146,159,163,172],"learning":[11,28,42,50,67,79,90,105,110,118,147,179],"(COSRL)":[12],"methods.":[13],"We":[14,30,59],"discuss":[15,72],"theoretical":[16],"aspects,":[17],"challenges,":[18],"and":[19,34,69,148],"open":[20],"questions":[21],"in":[22,84],"building":[23],"algorithms.":[29,80],"provide":[31],"the":[32,35,46],"taxonomy":[33],"details":[36],"methods":[43],"based":[44],"on":[45],"type":[47],"mechanism":[51],"that":[52],"takes":[53],"adaptation":[54],"to":[55],"nonstationarity":[56],"into":[57],"account.":[58],"categorize":[60],"safety":[61,175],"constraints":[62,98,176],"formulation":[63],"for":[64,74,99,177],"algorithms,":[68],"finally,":[70],"we":[71],"prospects":[73],"creating":[75],"reliable,":[76],"Keywords:":[81],"RL":[83],"nonstationary":[85],"environments,":[86],"under":[91,119],"nonstationarity,":[92],"HM-MDP,":[93],"NSMDP,":[94],"POMDP,":[95,97],"learning,":[101,115,128,139,160,164,169,173],"review,":[106],"survey,":[111],"distribution":[120],"shift,":[121],"adaptation,":[125,132],"exploration,":[130],"constrained":[133],"Markov":[134,142,150],"decision":[135,143,151],"processes,":[136,152],"partially":[140],"observable":[141],"process,":[144],"hidden":[149],"Safe":[153],"Online":[154],"Reinforcement":[155],"Learning,":[156],"meta-learning,":[166],"meta-reinforcement":[168],"context-based":[171],"formulating":[174]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-01-10T00:00:00"}
