{"id":"https://openalex.org/W7147468229","doi":"https://doi.org/10.48550/arxiv.2603.27346","title":"D-SPEAR: Dual-Stream Prioritized Experience Adaptive Replay for Stable Reinforcement Learning in Robotic Manipulation","display_name":"D-SPEAR: Dual-Stream Prioritized Experience Adaptive Replay for Stable Reinforcement Learning in Robotic Manipulation","publication_year":2026,"publication_date":"2026-03-28","ids":{"openalex":"https://openalex.org/W7147468229","doi":"https://doi.org/10.48550/arxiv.2603.27346"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.27346","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.27346","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.27346","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5132711122","display_name":"Yu Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Yu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5088726212","display_name":"Karl Mason","orcid":"https://orcid.org/0000-0002-8966-9100"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Mason, Karl","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.965399980545044,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.965399980545044,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.006500000134110451,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.00559999980032444,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.748199999332428},{"id":"https://openalex.org/keywords/robustness","display_name":"Robustness (evolution)","score":0.6438000202178955},{"id":"https://openalex.org/keywords/adaptive-sampling","display_name":"Adaptive sampling","score":0.5817999839782715},{"id":"https://openalex.org/keywords/sampling","display_name":"Sampling (signal processing)","score":0.4226999878883362},{"id":"https://openalex.org/keywords/robot","display_name":"Robot","score":0.40139999985694885},{"id":"https://openalex.org/keywords/robotic-arm","display_name":"Robotic arm","score":0.36000001430511475},{"id":"https://openalex.org/keywords/variation","display_name":"Variation (astronomy)","score":0.35359999537467957},{"id":"https://openalex.org/keywords/training-set","display_name":"Training set","score":0.33709999918937683}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7645999789237976},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.748199999332428},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.6438000202178955},{"id":"https://openalex.org/C2781395549","wikidata":"https://www.wikidata.org/wiki/Q4680762","display_name":"Adaptive sampling","level":3,"score":0.5817999839782715},{"id":"https://openalex.org/C140779682","wikidata":"https://www.wikidata.org/wiki/Q210868","display_name":"Sampling (signal processing)","level":3,"score":0.4226999878883362},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.40139999985694885},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.38679999113082886},{"id":"https://openalex.org/C150415221","wikidata":"https://www.wikidata.org/wiki/Q40687","display_name":"Robotic arm","level":2,"score":0.36000001430511475},{"id":"https://openalex.org/C2778334786","wikidata":"https://www.wikidata.org/wiki/Q1586270","display_name":"Variation (astronomy)","level":2,"score":0.35359999537467957},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.33709999918937683},{"id":"https://openalex.org/C2777211547","wikidata":"https://www.wikidata.org/wiki/Q17141490","display_name":"Training (meteorology)","level":2,"score":0.2946999967098236},{"id":"https://openalex.org/C89611455","wikidata":"https://www.wikidata.org/wiki/Q6804646","display_name":"Mechanism (biology)","level":2,"score":0.2874000072479248},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2793000042438507},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.27799999713897705},{"id":"https://openalex.org/C2986053828","wikidata":"https://www.wikidata.org/wiki/Q355217","display_name":"Time budget","level":2,"score":0.2614000141620636},{"id":"https://openalex.org/C107464732","wikidata":"https://www.wikidata.org/wiki/Q235781","display_name":"Adaptive control","level":3,"score":0.257999986410141},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.25290000438690186},{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.25279998779296875}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.27346","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.27346","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.27346","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.27346","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Robotic":[0],"manipulation":[1,139],"remains":[2],"challenging":[3,137],"for":[4,87],"reinforcement":[5],"learning":[6],"due":[7,42],"to":[8,43,99],"contact-rich":[9],"dynamics,":[10],"long":[11],"horizons,":[12],"and":[13,23,35,56,73,109,121,147,161,167,180],"training":[14,168],"instability.":[15],"Although":[16],"off-policy":[17,156],"actor-critic":[18],"algorithms":[19],"such":[20],"as":[21],"SAC":[22],"TD3":[24],"perform":[25],"well":[26],"in":[27,38,163],"simulation,":[28],"they":[29],"often":[30],"suffer":[31],"from":[32,141],"policy":[33,101],"oscillations":[34],"performance":[36,166],"collapse":[37],"realistic":[39],"settings,":[40],"partly":[41],"experience":[44],"replay":[45,68,80,86,182],"strategies":[46],"that":[47,70,151],"ignore":[48],"the":[49,54,57,92,114,142,174,178],"differing":[50],"data":[51],"requirements":[52],"of":[53,116,118,177],"actor":[55,72,93],"critic.":[58],"We":[59,133],"propose":[60],"D-SPEAR:":[61],"Dual-Stream":[62],"Prioritized":[63],"Experience":[64],"Adaptive":[65],"Replay,":[66],"a":[67,78,122],"framework":[69],"decouples":[71],"critic":[74,83,124],"sampling":[75,111],"while":[76],"maintaining":[77],"shared":[79],"buffer.":[81],"The":[82],"leverages":[84],"prioritized":[85,110],"efficient":[88],"value":[89],"learning,":[90],"whereas":[91],"is":[94],"updated":[95],"using":[96],"low-error":[97],"transitions":[98],"stabilize":[100],"optimization.":[102],"An":[103],"adaptive":[104],"anchor":[105],"mechanism":[106],"balances":[107],"uniform":[108],"based":[112],"on":[113,136],"coefficient":[115],"variation":[117],"TD":[119],"errors,":[120],"Huber-based":[123],"objective":[125],"further":[126],"improves":[127],"robustness":[128],"under":[129],"heterogeneous":[130],"reward":[131],"scales.":[132],"evaluate":[134],"D-SPEAR":[135,152],"robotic":[138],"tasks":[140],"robosuite":[143],"benchmark,":[144],"including":[145,158],"Block-Lifting":[146],"Door-Opening.":[148],"Results":[149],"demonstrate":[150],"consistently":[153],"outperforms":[154],"strong":[155],"baselines,":[157],"SAC,":[159],"TD3,":[160],"DDPG,":[162],"both":[164],"final":[165],"stability,":[169],"with":[170],"ablation":[171],"studies":[172],"confirming":[173],"complementary":[175],"roles":[176],"actorside":[179],"critic-side":[181],"streams.":[183]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-04-02T00:00:00"}
