{"id":"https://openalex.org/W7148742965","doi":"https://doi.org/10.48550/arxiv.2604.01913","title":"The Rank and Gradient Lost in Non-stationarity: Sample Weight Decay for Mitigating Plasticity Loss in Reinforcement Learning","display_name":"The Rank and Gradient Lost in Non-stationarity: Sample Weight Decay for Mitigating Plasticity Loss in Reinforcement Learning","publication_year":2026,"publication_date":"2026-04-02","ids":{"openalex":"https://openalex.org/W7148742965","doi":"https://doi.org/10.48550/arxiv.2604.01913"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.01913","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.01913","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.01913","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5132845668","display_name":"Zihao Wu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wu, Zihao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5132884861","display_name":"Hongyao Tang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tang, Hongyao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5132880784","display_name":"Yi Ma","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ma, Yi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5132872093","display_name":"Jiashun Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Jiashun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5132894475","display_name":"Yan Zheng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zheng, Yan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5132865881","display_name":"Jianye Hao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Hao, Jianye","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.34599998593330383,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.34599998593330383,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.24979999661445618,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.07850000262260437,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/plasticity","display_name":"Plasticity","score":0.7565000057220459},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5555999875068665},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.4997999966144562},{"id":"https://openalex.org/keywords/sample","display_name":"Sample (material)","score":0.3856000006198883},{"id":"https://openalex.org/keywords/mechanism","display_name":"Mechanism (biology)","score":0.3853999972343445},{"id":"https://openalex.org/keywords/perspective","display_name":"Perspective (graphical)","score":0.373199999332428},{"id":"https://openalex.org/keywords/homeostatic-plasticity","display_name":"Homeostatic plasticity","score":0.37290000915527344},{"id":"https://openalex.org/keywords/rank","display_name":"Rank (graph theory)","score":0.36980000138282776}],"concepts":[{"id":"https://openalex.org/C79186407","wikidata":"https://www.wikidata.org/wiki/Q472074","display_name":"Plasticity","level":2,"score":0.7565000057220459},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5555999875068665},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5084999799728394},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.4997999966144562},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4034000039100647},{"id":"https://openalex.org/C198531522","wikidata":"https://www.wikidata.org/wiki/Q485146","display_name":"Sample (material)","level":2,"score":0.3856000006198883},{"id":"https://openalex.org/C89611455","wikidata":"https://www.wikidata.org/wiki/Q6804646","display_name":"Mechanism (biology)","level":2,"score":0.3853999972343445},{"id":"https://openalex.org/C12713177","wikidata":"https://www.wikidata.org/wiki/Q1900281","display_name":"Perspective (graphical)","level":2,"score":0.373199999332428},{"id":"https://openalex.org/C5687787","wikidata":"https://www.wikidata.org/wiki/Q5889850","display_name":"Homeostatic plasticity","level":5,"score":0.37290000915527344},{"id":"https://openalex.org/C164226766","wikidata":"https://www.wikidata.org/wiki/Q7293202","display_name":"Rank (graph theory)","level":2,"score":0.36980000138282776},{"id":"https://openalex.org/C47611674","wikidata":"https://www.wikidata.org/wiki/Q849491","display_name":"Neuroplasticity","level":2,"score":0.3499000072479248},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.33410000801086426},{"id":"https://openalex.org/C120936955","wikidata":"https://www.wikidata.org/wiki/Q2155640","display_name":"Empirical research","level":2,"score":0.3305000066757202},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.3181999921798706},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.28299999237060547},{"id":"https://openalex.org/C74193536","wikidata":"https://www.wikidata.org/wiki/Q574844","display_name":"Kernel (algebra)","level":2,"score":0.27880001068115234},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.2782999873161316},{"id":"https://openalex.org/C193415008","wikidata":"https://www.wikidata.org/wiki/Q639681","display_name":"Network architecture","level":2,"score":0.2775000035762787},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.25220000743865967},{"id":"https://openalex.org/C189430467","wikidata":"https://www.wikidata.org/wiki/Q7293293","display_name":"Ranking (information retrieval)","level":2,"score":0.251800000667572}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.01913","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.01913","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.01913","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.01913","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Deep":[0],"reinforcement":[1],"learning":[2,239],"(RL)":[3],"suffers":[4],"from":[5,59,125],"plasticity":[6,32,56,96,160,192,234],"loss":[7,33,57,94,161,193,235],"severely":[8],"due":[9],"to":[10,19,21,42,97,158,171,183,191],"the":[11,17,46,55,60,69,77,83,93,100,104,112,126,133,153,164,206],"nature":[12],"of":[13,30,63,79,85,95,103,115,135,208,244],"non-stationarity,":[14],"which":[15,168],"impairs":[16],"ability":[18],"adapt":[20],"new":[22],"data":[23,80],"and":[24,36,82,111,129,143,156,214,222,236,251],"learn":[25],"continually.":[26],"Unfortunately,":[27],"our":[28,90],"understanding":[29],"how":[31],"arises,":[34],"dissipates,":[35],"can":[37],"be":[38],"dissolved":[39],"remains":[40],"limited":[41],"empirical":[43,123],"findings,":[44],"leaving":[45],"theoretical":[47,61,127],"end":[48],"underexplored.To":[49],"address":[50],"this":[51,147],"gap,":[52],"we":[53,149,204],"study":[54],"problem":[58],"perspective":[62,128],"network":[64,139,249],"optimization.":[65],"By":[66],"formally":[67],"characterizing":[68],"two":[70,98],"culprit":[71],"factors":[72],"in":[73,219],"online":[74],"RL":[75,196,246],"process:":[76],"non-stationarity":[78,84],"distributions":[81],"targets":[86],"induced":[87],"by":[88,162],"bootstrapping,":[89],"theory":[91],"attributes":[92],"mechanisms:":[99],"rank":[101],"collapse":[102],"Neural":[105],"Tangent":[106],"Kernel":[107],"(NTK)":[108],"Gram":[109],"matrix":[110],"$\u0398(\\frac{1}{k})$":[113],"decay":[114],"gradient":[116,165,185],"magnitude.":[117],"The":[118,227],"first":[119],"mechanism":[120,155],"echoes":[121],"prior":[122],"findings":[124],"sheds":[130],"light":[131],"on":[132,152,199,256],"effects":[134],"existing":[136,172],"methods,":[137],"e.g.,":[138],"reset,":[140],"neuron":[141],"recycle,":[142],"noise":[144],"injection.":[145],"Against":[146],"backdrop,":[148],"focus":[150],"primarily":[151],"second":[154],"aim":[157],"alleviate":[159],"addressing":[163],"attenuation":[166],"issue,":[167],"is":[169],"orthogonal":[170],"methods.":[173],"We":[174],"propose":[175],"Sample":[176],"Weight":[177],"Decay":[178],"--":[179],"a":[180,188],"lightweight":[181],"method":[182],"restore":[184],"magnitude,":[186],"as":[187],"general":[189],"remedy":[190],"for":[194],"deep":[195,245],"methods":[197],"based":[198],"experience":[200],"replay.":[201],"In":[202],"experiments,":[203],"evaluate":[205],"efficacy":[207],"\\methodName":[209,231],"upon":[210],"TD3,":[211],"\\myadded{Double":[212],"DQN}":[213],"SAC":[215],"with":[216],"SimBa":[217],"architecture":[218],"MuJoCo,":[220],"\\myadded{ALE}":[221],"DeepMind":[223],"Control":[224],"Suite":[225],"tasks.":[226,260],"results":[228],"demonstrate":[229],"that":[230],"effectively":[232],"alleviates":[233],"consistently":[237],"improves":[238],"performance":[240,255],"across":[241],"various":[242],"configurations":[243],"algorithms,":[247],"UTD,":[248],"architectures,":[250],"environments,":[252],"achieving":[253],"SOTA":[254],"challenging":[257],"DMC":[258],"Humanoid":[259]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-04-04T00:00:00"}
