{"id":"https://openalex.org/W7166819629","doi":"https://doi.org/10.48550/arxiv.2606.31691","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","display_name":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","publication_year":2026,"publication_date":"2026-06-30","ids":{"openalex":"https://openalex.org/W7166819629","doi":"https://doi.org/10.48550/arxiv.2606.31691"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.31691","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.31691","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.31691","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139823067","display_name":"Guanchen Lu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lu, Guanchen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139732959","display_name":"Yajuan Dun","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Dun, Yajuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139739472","display_name":"Yi Zhou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhou, Yi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5113454519","display_name":"L I Tao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tao, Letian","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5067909017","display_name":"Jingliang Duan","orcid":"https://orcid.org/0000-0002-3697-1576"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Duan, Jingliang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139838338","display_name":"Jie Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Jie","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139843757","display_name":"Guofa Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Guofa","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10879","display_name":"Robotic Locomotion and Control","score":0.5162000060081482,"subfield":{"id":"https://openalex.org/subfields/2204","display_name":"Biomedical Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10879","display_name":"Robotic Locomotion and Control","score":0.5162000060081482,"subfield":{"id":"https://openalex.org/subfields/2204","display_name":"Biomedical Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.20909999310970306,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10709","display_name":"Social Robot Interaction and HRI","score":0.054499998688697815,"subfield":{"id":"https://openalex.org/subfields/3207","display_name":"Social Psychology"},"field":{"id":"https://openalex.org/fields/32","display_name":"Psychology"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7394999861717224},{"id":"https://openalex.org/keywords/convergence","display_name":"Convergence (economics)","score":0.6190999746322632},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.5843999981880188},{"id":"https://openalex.org/keywords/sampling","display_name":"Sampling (signal processing)","score":0.5730999708175659},{"id":"https://openalex.org/keywords/scalability","display_name":"Scalability","score":0.5633000135421753},{"id":"https://openalex.org/keywords/adaptability","display_name":"Adaptability","score":0.5238999724388123},{"id":"https://openalex.org/keywords/gaussian-process","display_name":"Gaussian process","score":0.49380001425743103},{"id":"https://openalex.org/keywords/margin","display_name":"Margin (machine learning)","score":0.48500001430511475},{"id":"https://openalex.org/keywords/representation","display_name":"Representation (politics)","score":0.4781000018119812},{"id":"https://openalex.org/keywords/adaptive-sampling","display_name":"Adaptive sampling","score":0.4706999957561493}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7394999861717224},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6492999792098999},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.6190999746322632},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.5843999981880188},{"id":"https://openalex.org/C140779682","wikidata":"https://www.wikidata.org/wiki/Q210868","display_name":"Sampling (signal processing)","level":3,"score":0.5730999708175659},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.5633000135421753},{"id":"https://openalex.org/C177606310","wikidata":"https://www.wikidata.org/wiki/Q5674297","display_name":"Adaptability","level":2,"score":0.5238999724388123},{"id":"https://openalex.org/C61326573","wikidata":"https://www.wikidata.org/wiki/Q1496376","display_name":"Gaussian process","level":3,"score":0.49380001425743103},{"id":"https://openalex.org/C774472","wikidata":"https://www.wikidata.org/wiki/Q6760393","display_name":"Margin (machine learning)","level":2,"score":0.48500001430511475},{"id":"https://openalex.org/C2776359362","wikidata":"https://www.wikidata.org/wiki/Q2145286","display_name":"Representation (politics)","level":3,"score":0.4781000018119812},{"id":"https://openalex.org/C2781395549","wikidata":"https://www.wikidata.org/wiki/Q4680762","display_name":"Adaptive sampling","level":3,"score":0.4706999957561493},{"id":"https://openalex.org/C198531522","wikidata":"https://www.wikidata.org/wiki/Q485146","display_name":"Sample (material)","level":2,"score":0.4603999853134155},{"id":"https://openalex.org/C196083921","wikidata":"https://www.wikidata.org/wiki/Q7915758","display_name":"Variance (accounting)","level":2,"score":0.45350000262260437},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.44780001044273376},{"id":"https://openalex.org/C2776036281","wikidata":"https://www.wikidata.org/wiki/Q48769818","display_name":"Constraint (computer-aided design)","level":2,"score":0.4472000002861023},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.43560001254081726},{"id":"https://openalex.org/C52740198","wikidata":"https://www.wikidata.org/wiki/Q1539564","display_name":"Importance sampling","level":3,"score":0.4341000020503998},{"id":"https://openalex.org/C163716315","wikidata":"https://www.wikidata.org/wiki/Q901177","display_name":"Gaussian","level":2,"score":0.41190001368522644},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3871000111103058},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.38119998574256897},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.37610000371932983},{"id":"https://openalex.org/C185429906","wikidata":"https://www.wikidata.org/wiki/Q1130160","display_name":"Estimator","level":2,"score":0.35929998755455017},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.358599990606308},{"id":"https://openalex.org/C2776291640","wikidata":"https://www.wikidata.org/wiki/Q2912517","display_name":"Value (mathematics)","level":2,"score":0.3287000060081482},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.32850000262260437},{"id":"https://openalex.org/C2776502983","wikidata":"https://www.wikidata.org/wiki/Q690182","display_name":"Contrast (vision)","level":2,"score":0.3276999890804291},{"id":"https://openalex.org/C79186407","wikidata":"https://www.wikidata.org/wiki/Q472074","display_name":"Plasticity","level":2,"score":0.3199999928474426},{"id":"https://openalex.org/C164660894","wikidata":"https://www.wikidata.org/wiki/Q2037833","display_name":"Piecewise","level":2,"score":0.29750001430511475},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.29429998993873596},{"id":"https://openalex.org/C61797465","wikidata":"https://www.wikidata.org/wiki/Q1188986","display_name":"Term (time)","level":2,"score":0.2930000126361847},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.25999999046325684},{"id":"https://openalex.org/C52970973","wikidata":"https://www.wikidata.org/wiki/Q2497134","display_name":"Adaptive system","level":2,"score":0.2590999901294708},{"id":"https://openalex.org/C204323151","wikidata":"https://www.wikidata.org/wiki/Q905424","display_name":"Range (aeronautics)","level":2,"score":0.25870001316070557},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.25760000944137573},{"id":"https://openalex.org/C2780598303","wikidata":"https://www.wikidata.org/wiki/Q65921492","display_name":"Flexibility (engineering)","level":2,"score":0.25459998846054077}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.31691","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.31691","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.31691","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.31691","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Scalable":[0],"reinforcement":[1,141],"learning":[2,142],"has":[3],"popularized":[4],"high-throughput":[5],"sampling":[6,64,168],"architectures,":[7],"which":[8,78,103,162],"significantly":[9],"compresses":[10],"the":[11,21,31,38,57,75,105,132,186],"training":[12,134,188],"time":[13],"for":[14,62,92],"off-policy":[15],"methods":[16,35],"in":[17,123],"robotic":[18],"locomotion.":[19],"However,":[20],"rapid":[22],"increase":[23],"of":[24,33,40,56,116],"data":[25],"volume":[26],"and":[27,36,53,130,170,178,196],"update":[28],"frequency":[29],"undermines":[30],"stability":[32],"value-based":[34],"diminishes":[37],"plasticity":[39,106],"policy":[41],"networks.":[42],"To":[43],"address":[44],"these":[45],"challenges,":[46],"this":[47],"work":[48],"presents":[49],"FastDSAC,":[50],"a":[51,69,126,153],"fast":[52,140],"high-performance":[54],"variant":[55],"Distributional":[58],"Actor-Critic":[59],"algorithm":[60],"designed":[61],"parallel":[63],"scenarios.":[65],"Specifically,":[66],"we":[67],"introduce":[68],"truncated":[70],"Gaussian":[71,155],"distribution":[72],"to":[73,138,200],"approximate":[74],"learned":[76],"policy,":[77],"effectively":[79],"excludes":[80],"out-of-distribution":[81],"actions":[82],"that":[83,144,181],"strain":[84],"target":[85],"value":[86,148,164],"estimation":[87,165],"while":[88],"keeping":[89],"necessary":[90],"stochasticity":[91],"exploration.":[93],"The":[94],"proposed":[95],"action":[96],"constraint":[97],"functions":[98],"as":[99],"an":[100],"implicit":[101],"regularization,":[102],"counteracts":[104],"loss":[107],"typically":[108],"caused":[109],"by":[110,167],"aggressive":[111],"gradient":[112],"updates.":[113],"This":[114],"preservation":[115],"network":[117],"adaptability":[118],"enhances":[119],"sample":[120],"efficiency,":[121],"particularly":[122],"scenarios":[124],"with":[125,158],"high":[127],"update-to-data":[128],"ratio,":[129],"accelerates":[131],"early":[133],"process.":[135],"In":[136],"contrast":[137],"prior":[139],"approaches":[143],"rely":[145],"on":[146,175],"discrete":[147],"distributions,":[149],"our":[150],"method":[151],"utilizes":[152],"continuous":[154],"representation":[156],"equipped":[157],"adaptive":[159],"variance":[160],"regulation,":[161],"improves":[163],"accuracy":[166],"confident":[169],"informative":[171],"transitions.":[172],"Extensive":[173],"experiments":[174],"MuJoCo":[176],"Playground":[177],"HumanoidBench":[179],"demonstrate":[180],"FastDSAC":[182],"not":[183],"only":[184],"stabilizes":[185],"overall":[187],"process":[189],"but":[190],"also":[191],"achieves":[192],"superior":[193],"asymptotic":[194],"performance":[195],"faster":[197],"convergence":[198],"compared":[199],"state-of-the-art":[201],"baselines.":[202]},"counts_by_year":[],"updated_date":"2026-07-02T06:18:51.028212","created_date":"2026-07-02T00:00:00"}
