{"id":"https://openalex.org/W4416038088","doi":"https://doi.org/10.1137/25m1742199","title":"Accuracy of Discretely Sampled Stochastic Policies in Continuous-Time Reinforcement Learning","display_name":"Accuracy of Discretely Sampled Stochastic Policies in Continuous-Time Reinforcement Learning","publication_year":2026,"publication_date":"2026-06-11","ids":{"openalex":"https://openalex.org/W4416038088","doi":"https://doi.org/10.1137/25m1742199"},"language":"en","primary_location":{"id":"doi:10.1137/25m1742199","is_oa":false,"landing_page_url":"https://doi.org/10.1137/25m1742199","pdf_url":null,"source":{"id":"https://openalex.org/S897311980","display_name":"SIAM Journal on Control and Optimization","issn_l":"0363-0129","issn":["0363-0129","1095-7138"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310320508","host_organization_name":"Society for Industrial and Applied Mathematics","host_organization_lineage":["https://openalex.org/P4310320508"],"host_organization_lineage_names":["Society for Industrial and Applied Mathematics"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"SIAM Journal on Control and Optimization","raw_type":"journal-article"},"type":"article","indexed_in":["arxiv","crossref","datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://arxiv.org/pdf/2503.09981","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5009431073","display_name":"Yanwei Jia","orcid":"https://orcid.org/0000-0002-6089-9842"},"institutions":[{"id":"https://openalex.org/I177725633","display_name":"Chinese University of Hong Kong","ror":"https://ror.org/00t33hh48","country_code":"HK","type":"education","lineage":["https://openalex.org/I177725633"]}],"countries":["HK"],"is_corresponding":false,"raw_author_name":"Yanwei Jia","raw_affiliation_strings":["Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong, Shatin, NT, Hong Kong"],"raw_orcid":"https://orcid.org/0000-0002-6089-9842","affiliations":[{"raw_affiliation_string":"Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong, Shatin, NT, Hong Kong","institution_ids":["https://openalex.org/I177725633"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5083779857","display_name":"David Ouyang","orcid":"https://orcid.org/0000-0002-3813-7518"},"institutions":[{"id":"https://openalex.org/I99065089","display_name":"Tsinghua University","ror":"https://ror.org/03cve4549","country_code":"CN","type":"education","lineage":["https://openalex.org/I99065089"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Du Ouyang","raw_affiliation_strings":["Department of Mathematical Sciences, Tsinghua University, Beijing, 100084, China"],"raw_orcid":"https://orcid.org/0009-0009-9211-4171","affiliations":[{"raw_affiliation_string":"Department of Mathematical Sciences, Tsinghua University, Beijing, 100084, China","institution_ids":["https://openalex.org/I99065089"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5100324338","display_name":"Yufei Zhang","orcid":"https://orcid.org/0000-0002-2952-7688"},"institutions":[{"id":"https://openalex.org/I47508984","display_name":"Imperial College London","ror":"https://ror.org/041kmwe10","country_code":"GB","type":"education","lineage":["https://openalex.org/I47508984"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Yufei Zhang","raw_affiliation_strings":["Department of Mathematics, Imperial College London, London, SW7 2AZ, United Kingdom"],"raw_orcid":"https://orcid.org/0000-0001-9843-1404","affiliations":[{"raw_affiliation_string":"Department of Mathematics, Imperial College London, London, SW7 2AZ, United Kingdom","institution_ids":["https://openalex.org/I47508984"]}]}],"institutions":[],"countries_distinct_count":3,"institutions_distinct_count":3,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.01522591,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":"64","issue":"3","first_page":"1889","last_page":"1929"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6093999743461609,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6093999743461609,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.2531999945640564,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.02759999968111515,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/estimator","display_name":"Estimator","score":0.6894999742507935},{"id":"https://openalex.org/keywords/piecewise","display_name":"Piecewise","score":0.5968999862670898},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5916000008583069},{"id":"https://openalex.org/keywords/rate-of-convergence","display_name":"Rate of convergence","score":0.5532000064849854},{"id":"https://openalex.org/keywords/convergence","display_name":"Convergence (economics)","score":0.516700029373169},{"id":"https://openalex.org/keywords/sampling","display_name":"Sampling (signal processing)","score":0.47440001368522644},{"id":"https://openalex.org/keywords/variance","display_name":"Variance (accounting)","score":0.4672999978065491},{"id":"https://openalex.org/keywords/stochastic-control","display_name":"Stochastic control","score":0.4652999937534332},{"id":"https://openalex.org/keywords/realization","display_name":"Realization (probability)","score":0.4595000147819519}],"concepts":[{"id":"https://openalex.org/C185429906","wikidata":"https://www.wikidata.org/wiki/Q1130160","display_name":"Estimator","level":2,"score":0.6894999742507935},{"id":"https://openalex.org/C164660894","wikidata":"https://www.wikidata.org/wiki/Q2037833","display_name":"Piecewise","level":2,"score":0.5968999862670898},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5916000008583069},{"id":"https://openalex.org/C57869625","wikidata":"https://www.wikidata.org/wiki/Q1783502","display_name":"Rate of convergence","level":3,"score":0.5532000064849854},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.516700029373169},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.5027999877929688},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.4837000072002411},{"id":"https://openalex.org/C140779682","wikidata":"https://www.wikidata.org/wiki/Q210868","display_name":"Sampling (signal processing)","level":3,"score":0.47440001368522644},{"id":"https://openalex.org/C196083921","wikidata":"https://www.wikidata.org/wiki/Q7915758","display_name":"Variance (accounting)","level":2,"score":0.4672999978065491},{"id":"https://openalex.org/C170131372","wikidata":"https://www.wikidata.org/wiki/Q7617811","display_name":"Stochastic control","level":3,"score":0.4652999937534332},{"id":"https://openalex.org/C2781089630","wikidata":"https://www.wikidata.org/wiki/Q21856745","display_name":"Realization (probability)","level":2,"score":0.4595000147819519},{"id":"https://openalex.org/C8272713","wikidata":"https://www.wikidata.org/wiki/Q176737","display_name":"Stochastic process","level":2,"score":0.4503999948501587},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.45019999146461487},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.4449999928474426},{"id":"https://openalex.org/C55689738","wikidata":"https://www.wikidata.org/wiki/Q15963867","display_name":"Discrete time and continuous time","level":2,"score":0.3968000113964081},{"id":"https://openalex.org/C2777027219","wikidata":"https://www.wikidata.org/wiki/Q1284190","display_name":"Constant (computer programming)","level":2,"score":0.39169999957084656},{"id":"https://openalex.org/C85393063","wikidata":"https://www.wikidata.org/wiki/Q596307","display_name":"Stochastic volatility","level":3,"score":0.3677000105381012},{"id":"https://openalex.org/C55479107","wikidata":"https://www.wikidata.org/wiki/Q97663916","display_name":"Stochastic approximation","level":3,"score":0.3626999855041504},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.3513000011444092},{"id":"https://openalex.org/C52740198","wikidata":"https://www.wikidata.org/wiki/Q1539564","display_name":"Importance sampling","level":3,"score":0.3465999960899353},{"id":"https://openalex.org/C158535547","wikidata":"https://www.wikidata.org/wiki/Q5165437","display_name":"Continuous-time stochastic process","level":3,"score":0.3416000008583069},{"id":"https://openalex.org/C127491075","wikidata":"https://www.wikidata.org/wiki/Q7617825","display_name":"Stochastic modelling","level":2,"score":0.3411000072956085},{"id":"https://openalex.org/C92703954","wikidata":"https://www.wikidata.org/wiki/Q176737","display_name":"Discrete-time stochastic process","level":4,"score":0.33079999685287476},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.31220000982284546},{"id":"https://openalex.org/C28826006","wikidata":"https://www.wikidata.org/wiki/Q33521","display_name":"Applied mathematics","level":1,"score":0.3046000003814697},{"id":"https://openalex.org/C91602232","wikidata":"https://www.wikidata.org/wiki/Q756115","display_name":"Volatility (finance)","level":2,"score":0.3034999966621399},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.2815999984741211},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.27619999647140503},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.2628999948501587}],"mesh":[],"locations_count":3,"locations":[{"id":"doi:10.1137/25m1742199","is_oa":false,"landing_page_url":"https://doi.org/10.1137/25m1742199","pdf_url":null,"source":{"id":"https://openalex.org/S897311980","display_name":"SIAM Journal on Control and Optimization","issn_l":"0363-0129","issn":["0363-0129","1095-7138"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310320508","host_organization_name":"Society for Industrial and Applied Mathematics","host_organization_lineage":["https://openalex.org/P4310320508"],"host_organization_lineage_names":["Society for Industrial and Applied Mathematics"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"SIAM Journal on Control and Optimization","raw_type":"journal-article"},{"id":"pmh:oai:arXiv.org:2503.09981","is_oa":true,"landing_page_url":"http://arxiv.org/abs/2503.09981","pdf_url":"https://arxiv.org/pdf/2503.09981","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},{"id":"doi:10.48550/arxiv.2503.09981","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2503.09981","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:oai:arXiv.org:2503.09981","is_oa":true,"landing_page_url":"http://arxiv.org/abs/2503.09981","pdf_url":"https://arxiv.org/pdf/2503.09981","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},"sustainable_development_goals":[],"awards":[{"id":"https://openalex.org/G4638528766","display_name":"Data-Driven Mean-Variance Asset Allocation in Continuous Time","funder_award_id":"24211124","funder_id":"https://openalex.org/F4320321592","funder_display_name":"Research Grants Council, University Grants Committee"}],"funders":[{"id":"https://openalex.org/F4320321592","display_name":"Research Grants Council, University Grants Committee","ror":"https://ror.org/00djwmt25"},{"id":"https://openalex.org/F4320322942","display_name":"Chinese University of Hong Kong","ror":"https://ror.org/00t33hh48"}],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Stochastic":[0],"policies":[1],"(also":[2],"known":[3],"as":[4,55,62],"relaxed":[5],"controls)":[6],"are":[7],"widely":[8],"used":[9],"in":[10,24,142,181],"continuous-time":[11,26],"reinforcement":[12],"learning":[13],"algorithms.":[14],"However,":[15],"executing":[16],"a":[17,25,37,45,114,131],"stochastic":[18,46,85,178],"policy":[19,38,47,160,163],"and":[20,34,52,100,129,156,162,186],"evaluating":[21],"its":[22],"performance":[23],"environment":[27],"remain":[28],"open":[29],"challenges.":[30],"This":[31],"work":[32],"introduces":[33],"rigorously":[35],"analyzes":[36],"execution":[39],"framework":[40,180],"that":[41,61,119],"samples":[42],"actions":[43],"from":[44],"at":[48],"discrete":[49],"time":[50],"points":[51],"implements":[53],"them":[54],"piecewise":[56],"constant":[57],"controls.":[58],"We":[59,87],"prove":[60,113],"the":[63,70,77,84,90,95,98,123,139,143,154,176],"sampling":[64,124],"mesh":[65],"size":[66],"tends":[67],"to":[68,76,83],"zero,":[69],"controlled":[71],"state":[72],"process":[73],"converges":[74],"weakly":[75],"dynamics":[78],"with":[79,126],"coefficients":[80,99],"aggregated":[81],"according":[82],"policy.":[86],"explicitly":[88],"quantify":[89],"convergence":[91,105,117,134],"rate":[92,106,118],"based":[93,166],"on":[94,149,167],"regularity":[96],"of":[97,138,145,158],"establish":[101,130],"an":[102],"optimal":[103],"first-order":[104],"for":[107,135,175],"sufficiently":[108],"regular":[109],"coefficients.":[110],"Additionally,":[111],"we":[112,152],"$1/2$-order":[115,132],"weak":[116],"holds":[120],"uniformly":[121],"over":[122],"noise":[125,141],"high":[127],"probability,":[128],"pathwise":[133],"each":[136],"realization":[137],"system":[140],"absence":[144],"volatility":[146],"control.":[147],"Building":[148],"these":[150],"results,":[151],"analyze":[153],"bias":[155],"variance":[157],"various":[159],"evaluation":[161],"gradient":[164],"estimators":[165],"discrete-time":[168],"observations.":[169],"Our":[170],"results":[171],"provide":[172],"theoretical":[173],"justification":[174],"exploratory":[177],"control":[179],"[H.":[182],"Wang,":[183],"T.":[184],"Zariphopoulou,":[185],"X.Y.":[187],"Zhou,":[188],"J.":[189],"Mach.":[190],"Learn.":[191],"Res.,":[192],"21":[193],"(2020),":[194],"pp.":[195],"1-34].":[196]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2025-10-10T00:00:00"}
