{"id":"https://openalex.org/W7135061923","doi":"https://doi.org/10.48550/arxiv.2603.10199","title":"Actor-Accelerated Policy Dual Averaging for Reinforcement Learning in Continuous Action Spaces","display_name":"Actor-Accelerated Policy Dual Averaging for Reinforcement Learning in Continuous Action Spaces","publication_year":2026,"publication_date":"2026-03-10","ids":{"openalex":"https://openalex.org/W7135061923","doi":"https://doi.org/10.48550/arxiv.2603.10199"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.10199","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.10199","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.10199","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5128853481","display_name":"Ji Gao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Gao, Ji","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5044731263","display_name":"Caleb Ju","orcid":"https://orcid.org/0000-0002-9532-9030"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ju, Caleb","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5042544900","display_name":"Guanghui Lan","orcid":"https://orcid.org/0000-0002-2103-087X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lan, Guanghui","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5128877323","display_name":"Zhaohui Tong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tong, Zhaohui","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9366999864578247,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9366999864578247,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.013500000350177288,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.00989999994635582,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7556999921798706},{"id":"https://openalex.org/keywords/convergence","display_name":"Convergence (economics)","score":0.6996999979019165},{"id":"https://openalex.org/keywords/dual","display_name":"Dual (grammatical number)","score":0.5932000279426575},{"id":"https://openalex.org/keywords/function-approximation","display_name":"Function approximation","score":0.517300009727478},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.5138000249862671},{"id":"https://openalex.org/keywords/bridge","display_name":"Bridge (graph theory)","score":0.4666000008583069},{"id":"https://openalex.org/keywords/selection","display_name":"Selection (genetic algorithm)","score":0.45829999446868896},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.45669999718666077},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.45419999957084656}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7556999921798706},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.6996999979019165},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6656000018119812},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.6344000101089478},{"id":"https://openalex.org/C2780980858","wikidata":"https://www.wikidata.org/wiki/Q110022","display_name":"Dual (grammatical number)","level":2,"score":0.5932000279426575},{"id":"https://openalex.org/C91873725","wikidata":"https://www.wikidata.org/wiki/Q3445816","display_name":"Function approximation","level":3,"score":0.517300009727478},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.5138000249862671},{"id":"https://openalex.org/C100776233","wikidata":"https://www.wikidata.org/wiki/Q2532492","display_name":"Bridge (graph theory)","level":2,"score":0.4666000008583069},{"id":"https://openalex.org/C81917197","wikidata":"https://www.wikidata.org/wiki/Q628760","display_name":"Selection (genetic algorithm)","level":2,"score":0.45829999446868896},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.45669999718666077},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.45419999957084656},{"id":"https://openalex.org/C151201525","wikidata":"https://www.wikidata.org/wiki/Q177239","display_name":"Limit (mathematics)","level":2,"score":0.4366999864578247},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.4345000088214874},{"id":"https://openalex.org/C153258448","wikidata":"https://www.wikidata.org/wiki/Q1199743","display_name":"Gradient descent","level":3,"score":0.4291999936103821},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.42719998955726624},{"id":"https://openalex.org/C14646407","wikidata":"https://www.wikidata.org/wiki/Q1430750","display_name":"Bellman equation","level":2,"score":0.41769999265670776},{"id":"https://openalex.org/C166109690","wikidata":"https://www.wikidata.org/wiki/Q4677422","display_name":"Action selection","level":3,"score":0.3564999997615814},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.3357999920845032},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.33079999685287476},{"id":"https://openalex.org/C105339364","wikidata":"https://www.wikidata.org/wiki/Q2297740","display_name":"Software deployment","level":2,"score":0.30979999899864197},{"id":"https://openalex.org/C122383733","wikidata":"https://www.wikidata.org/wiki/Q865920","display_name":"Approximation error","level":2,"score":0.2840000092983246},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.27379998564720154},{"id":"https://openalex.org/C148764684","wikidata":"https://www.wikidata.org/wiki/Q621751","display_name":"Approximation algorithm","level":2,"score":0.27149999141693115},{"id":"https://openalex.org/C77618280","wikidata":"https://www.wikidata.org/wiki/Q1155772","display_name":"Scheme (mathematics)","level":2,"score":0.2653999924659729},{"id":"https://openalex.org/C41045048","wikidata":"https://www.wikidata.org/wiki/Q202843","display_name":"Linear programming","level":2,"score":0.25690001249313354},{"id":"https://openalex.org/C61797465","wikidata":"https://www.wikidata.org/wiki/Q1188986","display_name":"Term (time)","level":2,"score":0.25440001487731934},{"id":"https://openalex.org/C57869625","wikidata":"https://www.wikidata.org/wiki/Q1783502","display_name":"Rate of convergence","level":3,"score":0.2506999969482422}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.10199","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.10199","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.10199","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.10199","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/16","display_name":"Peace, Justice and strong institutions","score":0.7512572407722473}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Policy":[0,7,135],"Dual":[1],"Averaging":[2],"(PDA)":[3],"offers":[4],"a":[5,69,90],"principled":[6],"Mirror":[8],"Descent":[9],"(PMD)":[10],"framework":[11],"that":[12,93],"more":[13],"naturally":[14],"admits":[15],"value":[16],"function":[17,158],"approximation":[18,97],"than":[19],"standard":[20],"PMD,":[21],"enabling":[22],"the":[23,75,78,100,142,145],"use":[24],"of":[25,77,102,148],"approximate":[26,74],"advantage":[27],"(or":[28],"Q-)":[29],"functions":[30],"while":[31,84],"retaining":[32],"strong":[33],"convergence":[34,86,101],"guarantees.":[35,87],"However,":[36],"applying":[37],"PDA":[38,103,123,149],"in":[39,115,154],"continuous":[40],"state":[41],"and":[42,118,150],"action":[43,49],"spaces":[44],"remains":[45],"computationally":[46],"challenging,":[47],"since":[48],"selection":[50],"involves":[51],"solving":[52],"an":[53],"optimization":[54,79],"sub-problem":[55],"at":[56],"each":[57],"decision":[58],"step.":[59],"In":[60],"this":[61],"paper,":[62],"we":[63],"propose":[64],"\\textit{actor-accelerated":[65],"PDA},":[66],"which":[67],"uses":[68],"learned":[70],"policy":[71],"network":[72],"to":[73,128],"solution":[76],"sub-problems,":[80],"yielding":[81],"faster":[82],"runtimes":[83],"maintaining":[85],"We":[88,107],"provide":[89],"theoretical":[91,146],"analysis":[92],"quantifies":[94],"how":[95],"actor":[96],"error":[98],"impacts":[99],"under":[104],"suitable":[105],"assumptions.":[106],"then":[108],"evaluate":[109],"its":[110,151],"performance":[111,126],"on":[112],"several":[113],"benchmarks":[114],"robotics,":[116],"control,":[117],"operations":[119],"research":[120],"problems.":[121],"Actor-accelerated":[122],"achieves":[124],"superior":[125],"compared":[127],"popular":[129],"on-policy":[130],"baselines":[131],"such":[132],"as":[133],"Proximal":[134],"Optimization":[136],"(PPO).":[137],"Overall,":[138],"our":[139],"results":[140],"bridge":[141],"gap":[143],"between":[144],"advantages":[147],"practical":[152],"deployment":[153],"continuous-action":[155],"problems":[156],"with":[157],"approximation.":[159]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-03-13T00:00:00"}
