{"id":"https://openalex.org/W7128386493","doi":"https://doi.org/10.48550/arxiv.2602.06326","title":"Online Adaptive Reinforcement Learning with Echo State Networks for Non-Stationary Dynamics","display_name":"Online Adaptive Reinforcement Learning with Echo State Networks for Non-Stationary Dynamics","publication_year":2026,"publication_date":"2026-02-06","ids":{"openalex":"https://openalex.org/W7128386493","doi":"https://doi.org/10.48550/arxiv.2602.06326"},"language":null,"primary_location":{"id":"pmh:doi:10.48550/arxiv.2602.06326","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"publisher-specific-oa","license_id":"https://openalex.org/licenses/publisher-specific-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"type":"article","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":null,"any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5125422611","display_name":"Aoi Yoshimura","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yoshimura, Aoi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5025420478","display_name":"Gouhei Tanaka","orcid":"https://orcid.org/0000-0002-6223-4406"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tanaka, Gouhei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.16265815,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12611","display_name":"Neural Networks and Reservoir Computing","score":0.9387000203132629,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T12611","display_name":"Neural Networks and Reservoir Computing","score":0.9387000203132629,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11206","display_name":"Model Reduction and Neural Networks","score":0.0340999998152256,"subfield":{"id":"https://openalex.org/subfields/3109","display_name":"Statistical and Nonlinear Physics"},"field":{"id":"https://openalex.org/fields/31","display_name":"Physics and Astronomy"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10502","display_name":"Advanced Memory and Neural Computing","score":0.0026000000070780516,"subfield":{"id":"https://openalex.org/subfields/2208","display_name":"Electrical and Electronic Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7735000252723694},{"id":"https://openalex.org/keywords/adaptation","display_name":"Adaptation (eye)","score":0.6854000091552734},{"id":"https://openalex.org/keywords/context","display_name":"Context (archaeology)","score":0.6349999904632568},{"id":"https://openalex.org/keywords/enhanced-data-rates-for-gsm-evolution","display_name":"Enhanced Data Rates for GSM Evolution","score":0.5551000237464905},{"id":"https://openalex.org/keywords/echo","display_name":"Echo (communications protocol)","score":0.48829999566078186},{"id":"https://openalex.org/keywords/state","display_name":"State (computer science)","score":0.4410000145435333},{"id":"https://openalex.org/keywords/limiting","display_name":"Limiting","score":0.4311000108718872},{"id":"https://openalex.org/keywords/domain-adaptation","display_name":"Domain adaptation","score":0.38429999351501465}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7735000252723694},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7598999738693237},{"id":"https://openalex.org/C139807058","wikidata":"https://www.wikidata.org/wiki/Q352374","display_name":"Adaptation (eye)","level":2,"score":0.6854000091552734},{"id":"https://openalex.org/C2779343474","wikidata":"https://www.wikidata.org/wiki/Q3109175","display_name":"Context (archaeology)","level":2,"score":0.6349999904632568},{"id":"https://openalex.org/C162307627","wikidata":"https://www.wikidata.org/wiki/Q204833","display_name":"Enhanced Data Rates for GSM Evolution","level":2,"score":0.5551000237464905},{"id":"https://openalex.org/C2779426996","wikidata":"https://www.wikidata.org/wiki/Q18389128","display_name":"Echo (communications protocol)","level":2,"score":0.48829999566078186},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.47049999237060547},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.4410000145435333},{"id":"https://openalex.org/C188198153","wikidata":"https://www.wikidata.org/wiki/Q1613840","display_name":"Limiting","level":2,"score":0.4311000108718872},{"id":"https://openalex.org/C2776434776","wikidata":"https://www.wikidata.org/wiki/Q19246213","display_name":"Domain adaptation","level":3,"score":0.38429999351501465},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.37059998512268066},{"id":"https://openalex.org/C36503486","wikidata":"https://www.wikidata.org/wiki/Q11235244","display_name":"Domain (mathematical analysis)","level":2,"score":0.35179999470710754},{"id":"https://openalex.org/C135796866","wikidata":"https://www.wikidata.org/wiki/Q7315328","display_name":"Reservoir computing","level":4,"score":0.3481000065803528},{"id":"https://openalex.org/C145912823","wikidata":"https://www.wikidata.org/wiki/Q113558","display_name":"Dynamics (music)","level":2,"score":0.3424000144004822},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.3402999937534332},{"id":"https://openalex.org/C172025690","wikidata":"https://www.wikidata.org/wiki/Q5332763","display_name":"Echo state network","level":4,"score":0.3271999955177307},{"id":"https://openalex.org/C107464732","wikidata":"https://www.wikidata.org/wiki/Q235781","display_name":"Adaptive control","level":3,"score":0.3190000057220459},{"id":"https://openalex.org/C2986087404","wikidata":"https://www.wikidata.org/wiki/Q15946010","display_name":"Online learning","level":2,"score":0.30000001192092896},{"id":"https://openalex.org/C52970973","wikidata":"https://www.wikidata.org/wiki/Q2497134","display_name":"Adaptive system","level":2,"score":0.2939999997615814},{"id":"https://openalex.org/C120314980","wikidata":"https://www.wikidata.org/wiki/Q180634","display_name":"Distributed computing","level":1,"score":0.2865999937057495},{"id":"https://openalex.org/C2779679103","wikidata":"https://www.wikidata.org/wiki/Q5251805","display_name":"Degradation (telecommunications)","level":2,"score":0.2624000012874603},{"id":"https://openalex.org/C196921405","wikidata":"https://www.wikidata.org/wiki/Q786431","display_name":"Online algorithm","level":2,"score":0.25769999623298645},{"id":"https://openalex.org/C123757187","wikidata":"https://www.wikidata.org/wiki/Q9195957","display_name":"Network dynamics","level":2,"score":0.2558000087738037},{"id":"https://openalex.org/C79403827","wikidata":"https://www.wikidata.org/wiki/Q3988","display_name":"Real-time computing","level":1,"score":0.25189998745918274},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.2500999867916107}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:doi:10.48550/arxiv.2602.06326","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"publisher-specific-oa","license_id":"https://openalex.org/licenses/publisher-specific-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},{"id":"doi:10.48550/arxiv.2602.06326","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2602.06326","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:doi:10.48550/arxiv.2602.06326","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"publisher-specific-oa","license_id":"https://openalex.org/licenses/publisher-specific-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1],"(RL)":[2],"policies":[3],"trained":[4],"in":[5,15,195],"simulation":[6],"often":[7],"suffer":[8],"from":[9],"severe":[10,128],"performance":[11],"degradation":[12],"when":[13],"deployed":[14],"real-world":[16,203],"environments":[17,197],"due":[18],"to":[19,31,50,114,179],"non-stationary":[20,196],"dynamics.":[21],"While":[22],"Domain":[23],"Randomization":[24],"(DR)":[25],"and":[26,52,93,124,129,137,151,183,198,206],"meta-RL":[27],"have":[28],"been":[29],"proposed":[30,120,146,186],"address":[32],"this":[33,56],"issue,":[34],"they":[35],"typically":[36],"rely":[37],"on":[38,68,122],"extensive":[39],"pretraining,":[40,111],"privileged":[41,115],"information,":[42],"or":[43,112],"high":[44],"computational":[45,181],"cost,":[46],"limiting":[47],"their":[48],"applicability":[49],"real-time":[51],"edge":[53,207],"systems.":[54],"In":[55],"paper,":[57],"we":[58,72],"propose":[59],"a":[60,89,162,189],"lightweight":[61],"online":[62,98,193],"adaptation":[63,81,108,160,194],"framework":[64,187],"for":[65,192,202],"RL":[66],"based":[67],"Reservoir":[69],"Computing.":[70],"Specifically,":[71],"integrate":[73],"an":[74,80],"Echo":[75],"State":[76],"Networks":[77],"(ESNs)":[78],"as":[79],"module":[82],"that":[83,144],"encodes":[84],"recent":[85],"observation":[86],"histories":[87],"into":[88],"latent":[90],"context":[91],"representation,":[92],"update":[94],"its":[95,180],"readout":[96],"weights":[97],"using":[99],"Recursive":[100],"Least":[101],"Squares":[102],"(RLS).":[103],"This":[104],"design":[105],"enables":[106],"rapid":[107],"without":[109,174],"backpropagation,":[110],"access":[113],"information.":[116],"We":[117],"evaluate":[118],"the":[119,145,167,176,185],"method":[121,168],"CartPole":[123],"HalfCheetah":[125],"tasks":[126],"with":[127],"abrupt":[130],"environment":[131,172],"changes,":[132],"including":[133],"periodic":[134],"external":[135],"disturbances":[136],"extreme":[138],"friction":[139],"variations.":[140],"Experimental":[141],"results":[142],"demonstrate":[143],"approach":[147],"significantly":[148],"outperforms":[149],"DR":[150],"representative":[152],"adaptive":[153],"baselines":[154],"under":[155],"out-of-distribution":[156],"dynamics,":[157],"achieving":[158],"stable":[159],"within":[161],"few":[163],"control":[164,205],"steps.":[165],"Notably,":[166],"successfully":[169],"handles":[170],"intra-episode":[171],"changes":[173],"resetting":[175],"policy.":[177],"Due":[178],"efficiency":[182],"stability,":[184],"provides":[188],"practical":[190],"solution":[191],"is":[199],"well":[200],"suited":[201],"robotic":[204],"deployment.":[208]},"counts_by_year":[],"updated_date":"2026-07-15T18:14:33.161393","created_date":"2026-02-10T00:00:00"}
