{"id":"https://openalex.org/W3090054192","doi":"https://doi.org/10.3233/faia200200","title":"Model-Free Non-Stationarity Detection and Adaptation in Reinforcement Learning","display_name":"Model-Free Non-Stationarity Detection and Adaptation in Reinforcement Learning","publication_year":2020,"publication_date":"2020-01-01","ids":{"openalex":"https://openalex.org/W3090054192","doi":"https://doi.org/10.3233/faia200200","mag":"3090054192"},"language":"en","primary_location":{"id":"doi:10.3233/faia200200","is_oa":true,"landing_page_url":"https://doi.org/10.3233/faia200200","pdf_url":null,"source":{"id":"https://openalex.org/S4210201731","display_name":"Frontiers in artificial intelligence and applications","issn_l":"0922-6389","issn":["0922-6389","1879-8314"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"journal"},"license":"cc-by-nc","license_id":"https://openalex.org/licenses/cc-by-nc","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Frontiers in Artificial Intelligence and Applications","raw_type":"book-chapter"},"type":"book-chapter","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"hybrid","oa_url":"https://doi.org/10.3233/faia200200","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5091606728","display_name":"Giuseppe Canonaco","orcid":"https://orcid.org/0000-0001-8647-6269"},"institutions":[{"id":"https://openalex.org/I93860229","display_name":"Politecnico di Milano","ror":"https://ror.org/01nffqt88","country_code":"IT","type":"education","lineage":["https://openalex.org/I93860229"]}],"countries":["IT"],"is_corresponding":false,"raw_author_name":"Canonaco Giuseppe","raw_affiliation_strings":["Politecnico di Milano, Milan, Italy"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Politecnico di Milano, Milan, Italy","institution_ids":["https://openalex.org/I93860229"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5017130830","display_name":"Marcello Restelli","orcid":"https://orcid.org/0000-0002-6322-1076"},"institutions":[{"id":"https://openalex.org/I93860229","display_name":"Politecnico di Milano","ror":"https://ror.org/01nffqt88","country_code":"IT","type":"education","lineage":["https://openalex.org/I93860229"]}],"countries":["IT"],"is_corresponding":false,"raw_author_name":"Restelli Marcello","raw_affiliation_strings":["Politecnico di Milano, Milan, Italy"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Politecnico di Milano, Milan, Italy","institution_ids":["https://openalex.org/I93860229"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5035547226","display_name":"Manuel Roveri","orcid":"https://orcid.org/0000-0001-7828-7687"},"institutions":[{"id":"https://openalex.org/I93860229","display_name":"Politecnico di Milano","ror":"https://ror.org/01nffqt88","country_code":"IT","type":"education","lineage":["https://openalex.org/I93860229"]}],"countries":["IT"],"is_corresponding":false,"raw_author_name":"Roveri Manuel","raw_affiliation_strings":["Politecnico di Milano, Milan, Italy"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Politecnico di Milano, Milan, Italy","institution_ids":["https://openalex.org/I93860229"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I93860229"],"apc_list":null,"apc_paid":null,"fwci":0.5603,"has_fulltext":false,"cited_by_count":2,"citation_normalized_percentile":{"value":0.70075931,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":94,"max":96},"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9987999796867371,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9987999796867371,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.9905999898910522,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10791","display_name":"Advanced Control Systems Optimization","score":0.9819999933242798,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7264420986175537},{"id":"https://openalex.org/keywords/adaptation","display_name":"Adaptation (eye)","score":0.7244783043861389},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.560236930847168},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.492095410823822},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.3461671471595764},{"id":"https://openalex.org/keywords/psychology","display_name":"Psychology","score":0.31033849716186523},{"id":"https://openalex.org/keywords/social-psychology","display_name":"Social psychology","score":0.12354686856269836},{"id":"https://openalex.org/keywords/neuroscience","display_name":"Neuroscience","score":0.053785741329193115}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7264420986175537},{"id":"https://openalex.org/C139807058","wikidata":"https://www.wikidata.org/wiki/Q352374","display_name":"Adaptation (eye)","level":2,"score":0.7244783043861389},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.560236930847168},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.492095410823822},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3461671471595764},{"id":"https://openalex.org/C15744967","wikidata":"https://www.wikidata.org/wiki/Q9418","display_name":"Psychology","level":0,"score":0.31033849716186523},{"id":"https://openalex.org/C77805123","wikidata":"https://www.wikidata.org/wiki/Q161272","display_name":"Social psychology","level":1,"score":0.12354686856269836},{"id":"https://openalex.org/C169760540","wikidata":"https://www.wikidata.org/wiki/Q207011","display_name":"Neuroscience","level":1,"score":0.053785741329193115}],"mesh":[],"locations_count":2,"locations":[{"id":"doi:10.3233/faia200200","is_oa":true,"landing_page_url":"https://doi.org/10.3233/faia200200","pdf_url":null,"source":{"id":"https://openalex.org/S4210201731","display_name":"Frontiers in artificial intelligence and applications","issn_l":"0922-6389","issn":["0922-6389","1879-8314"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"journal"},"license":"cc-by-nc","license_id":"https://openalex.org/licenses/cc-by-nc","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Frontiers in Artificial Intelligence and Applications","raw_type":"book-chapter"},{"id":"pmh:oai:re.public.polimi.it:11311/1146220","is_oa":true,"landing_page_url":"http://hdl.handle.net/11311/1146220","pdf_url":null,"source":{"id":"https://openalex.org/S4306400312","display_name":"Virtual Community of Pathological Anatomy (University of Castilla La Mancha)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I79189158","host_organization_name":"University of Castilla-La Mancha","host_organization_lineage":["https://openalex.org/I79189158"],"host_organization_lineage_names":[],"type":"repository"},"license":"other-oa","license_id":"https://openalex.org/licenses/other-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"","raw_type":"info:eu-repo/semantics/conferenceObject"}],"best_oa_location":{"id":"doi:10.3233/faia200200","is_oa":true,"landing_page_url":"https://doi.org/10.3233/faia200200","pdf_url":null,"source":{"id":"https://openalex.org/S4210201731","display_name":"Frontiers in artificial intelligence and applications","issn_l":"0922-6389","issn":["0922-6389","1879-8314"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"journal"},"license":"cc-by-nc","license_id":"https://openalex.org/licenses/cc-by-nc","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Frontiers in Artificial Intelligence and Applications","raw_type":"book-chapter"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":13,"referenced_works":["https://openalex.org/W1514587017","https://openalex.org/W2115524942","https://openalex.org/W2119567691","https://openalex.org/W2125612430","https://openalex.org/W2163533082","https://openalex.org/W2342662072","https://openalex.org/W2732645484","https://openalex.org/W2803725374","https://openalex.org/W2945119207","https://openalex.org/W2949847538","https://openalex.org/W3011869697","https://openalex.org/W3103182070","https://openalex.org/W4285719527"],"related_works":["https://openalex.org/W4391375266","https://openalex.org/W2748952813","https://openalex.org/W4310083477","https://openalex.org/W2328553770","https://openalex.org/W2920061524","https://openalex.org/W1977959518","https://openalex.org/W2038908348","https://openalex.org/W2107890255","https://openalex.org/W2106552856","https://openalex.org/W2145821588"],"abstract_inverted_index":{"In":[0,90],"most":[1],"Reinforcement":[2],"Learning":[3],"(RL)":[4],"studies,":[5],"the":[6,32,70,77,80,104,108,119,123,162,168,195],"considered":[7],"task":[8],"is":[9,172],"assumed":[10],"to":[11,29,100,113,118,141,154,184,188,203],"be":[12,139],"stationary,":[13],"i.e.,":[14],"it":[15,186],"does":[16,41],"not":[17,42],"change":[18,68],"its":[19,22,205],"behavior":[20],"or":[21,61,106],"characteristics":[23],"over":[24,53,88,157,214],"time,":[25],"as":[26],"this":[27,39,91,152],"allows":[28],"generate":[30],"all":[31],"convergence":[33],"properties":[34],"of":[35,79,122,131,161,209],"RL":[36,71,97,182,217],"techniques.":[37],"Unfortunately,":[38],"assumption":[40],"hold":[43],"in":[44,57,69,74,103,107,207],"real-world":[45],"scenarios":[46],"where":[47],"systems":[48],"and":[49,111,212],"environments":[50],"typically":[51],"evolve":[52],"time.":[54,89],"For":[55],"instance,":[56],"robotic":[58],"applications,":[59],"sensor":[60],"actuator":[62],"faults":[63],"would":[64],"induce":[65],"a":[66,84,129,135,179,215],"sudden":[67],"settings,":[72],"while":[73],"financial":[75],"applications":[76],"evolution":[78],"market":[81],"can":[82,138],"cause":[83],"more":[85],"gradual":[86],"variation":[87],"paper,":[92],"we":[93,127,150],"present":[94],"an":[95,175],"adaptive":[96],"algorithm":[98,183,197],"able":[99,187],"detect":[101,142],"changes":[102,115,143],"environment":[105],"reward":[109],"function":[110],"react":[112],"these":[114],"by":[116,159],"adapting":[117],"new":[120],"conditions":[121],"task.":[124],"At":[125],"first,":[126],"develop":[128],"figure":[130],"merit":[132],"onto":[133],"which":[134],"hypothesis":[136],"test":[137,153],"applied":[140],"between":[144],"two":[145,199],"different":[146],"learning":[147],"iterations.":[148],"Then,":[149],"extended":[151],"sequentially":[155],"operate":[156],"time":[158],"means":[160],"CUmulative":[163],"SUM":[164],"(CUSUM)":[165],"approach.":[166],"Finally,":[167],"proposed":[169,196],"change-detection":[170],"mechanism":[171],"combined":[173],"(following":[174],"adaptive-active":[176],"approach)":[177],"with":[178,190],"well":[180],"known":[181],"make":[185],"deal":[189],"non-stationary":[191],"tasks.":[192],"We":[193],"tested":[194],"on":[198],"well-known":[200],"continuous-control":[201],"tasks":[202],"check":[204],"effectiveness":[206],"terms":[208],"non-stationarity":[210],"detection":[211],"adaptation":[213],"vanilla":[216],"algorithm.":[218]},"counts_by_year":[{"year":2023,"cited_by_count":2}],"updated_date":"2025-11-06T03:46:38.306776","created_date":"2020-10-08T00:00:00"}
