{"id":"https://openalex.org/W7161114893","doi":"https://doi.org/10.1109/tit.2026.3692816","title":"Minimax Optimal Sample Complexity for Iterated CVaR Reinforcement Learning With a Generative Model","display_name":"Minimax Optimal Sample Complexity for Iterated CVaR Reinforcement Learning With a Generative Model","publication_year":2026,"publication_date":"2026-05-14","ids":{"openalex":"https://openalex.org/W7161114893","doi":"https://doi.org/10.1109/tit.2026.3692816"},"language":null,"primary_location":{"id":"doi:10.1109/tit.2026.3692816","is_oa":false,"landing_page_url":"https://doi.org/10.1109/tit.2026.3692816","pdf_url":null,"source":{"id":"https://openalex.org/S4502562","display_name":"IEEE Transactions on Information Theory","issn_l":"0018-9448","issn":["0018-9448","1557-9654"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319808","host_organization_name":"Institute of Electrical and Electronics Engineers","host_organization_lineage":["https://openalex.org/P4310319808"],"host_organization_lineage_names":["Institute of Electrical and Electronics Engineers"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Transactions on Information Theory","raw_type":"journal-article"},"type":"article","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5136101832","display_name":"Zilong Deng","orcid":null},"institutions":[{"id":"https://openalex.org/I55732556","display_name":"Arizona State University","ror":"https://ror.org/03efmqc40","country_code":"US","type":"education","lineage":["https://openalex.org/I55732556"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Zilong Deng","raw_affiliation_strings":["School of Electrical, Computer, and Energy Engineering, Arizona State University, Tempe, AZ, USA"],"raw_orcid":"https://orcid.org/0009-0008-7304-1408","affiliations":[{"raw_affiliation_string":"School of Electrical, Computer, and Energy Engineering, Arizona State University, Tempe, AZ, USA","institution_ids":["https://openalex.org/I55732556"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134160470","display_name":"Alvaro Velasquez","orcid":null},"institutions":[{"id":"https://openalex.org/I188538660","display_name":"University of Colorado Boulder","ror":"https://ror.org/02ttsq026","country_code":"US","type":"education","lineage":["https://openalex.org/I188538660"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Alvaro Velasquez","raw_affiliation_strings":["Department of Computer Science, University of Colorado Boulder, Boulder, CO, USA"],"raw_orcid":"https://orcid.org/0000-0001-6757-105X","affiliations":[{"raw_affiliation_string":"Department of Computer Science, University of Colorado Boulder, Boulder, CO, USA","institution_ids":["https://openalex.org/I188538660"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5012545205","display_name":"Shaofeng Zou","orcid":"https://orcid.org/0000-0002-2821-6941"},"institutions":[{"id":"https://openalex.org/I55732556","display_name":"Arizona State University","ror":"https://ror.org/03efmqc40","country_code":"US","type":"education","lineage":["https://openalex.org/I55732556"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Shaofeng Zou","raw_affiliation_strings":["School of Electrical, Computer, and Energy Engineering, Arizona State University, Tempe, AZ, USA"],"raw_orcid":"https://orcid.org/0000-0002-2821-6941","affiliations":[{"raw_affiliation_string":"School of Electrical, Computer, and Energy Engineering, Arizona State University, Tempe, AZ, USA","institution_ids":["https://openalex.org/I55732556"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.56578606,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":"72","issue":"7","first_page":"5077","last_page":"5103"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7261999845504761,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7261999845504761,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12072","display_name":"Machine Learning and Algorithms","score":0.03929999843239784,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10320","display_name":"Neural Networks and Applications","score":0.030500000342726707,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/cvar","display_name":"CVAR","score":0.7867000102996826},{"id":"https://openalex.org/keywords/minimax","display_name":"Minimax","score":0.685699999332428},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5823000073432922},{"id":"https://openalex.org/keywords/iterated-function","display_name":"Iterated function","score":0.5418000221252441},{"id":"https://openalex.org/keywords/sample","display_name":"Sample (material)","score":0.5031999945640564},{"id":"https://openalex.org/keywords/sample-complexity","display_name":"Sample complexity","score":0.45339998602867126},{"id":"https://openalex.org/keywords/generative-model","display_name":"Generative model","score":0.42899999022483826}],"concepts":[{"id":"https://openalex.org/C2779922397","wikidata":"https://www.wikidata.org/wiki/Q5014755","display_name":"CVAR","level":4,"score":0.7867000102996826},{"id":"https://openalex.org/C149728462","wikidata":"https://www.wikidata.org/wiki/Q751319","display_name":"Minimax","level":2,"score":0.685699999332428},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.5982999801635742},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5823000073432922},{"id":"https://openalex.org/C140479938","wikidata":"https://www.wikidata.org/wiki/Q5254619","display_name":"Iterated function","level":2,"score":0.5418000221252441},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5400999784469604},{"id":"https://openalex.org/C198531522","wikidata":"https://www.wikidata.org/wiki/Q485146","display_name":"Sample (material)","level":2,"score":0.5031999945640564},{"id":"https://openalex.org/C2778445095","wikidata":"https://www.wikidata.org/wiki/Q18354077","display_name":"Sample complexity","level":2,"score":0.45339998602867126},{"id":"https://openalex.org/C167966045","wikidata":"https://www.wikidata.org/wiki/Q5532625","display_name":"Generative model","level":3,"score":0.42899999022483826},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.39629998803138733},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.35409998893737793},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.3352000117301941},{"id":"https://openalex.org/C179799912","wikidata":"https://www.wikidata.org/wiki/Q205084","display_name":"Computational complexity theory","level":2,"score":0.32919999957084656},{"id":"https://openalex.org/C28826006","wikidata":"https://www.wikidata.org/wiki/Q33521","display_name":"Applied mathematics","level":1,"score":0.29100000858306885},{"id":"https://openalex.org/C107673813","wikidata":"https://www.wikidata.org/wiki/Q812534","display_name":"Bayesian probability","level":2,"score":0.29030001163482666},{"id":"https://openalex.org/C197055811","wikidata":"https://www.wikidata.org/wiki/Q207522","display_name":"Probability density function","level":2,"score":0.29030001163482666},{"id":"https://openalex.org/C2780009758","wikidata":"https://www.wikidata.org/wiki/Q6804172","display_name":"Measure (data warehouse)","level":2,"score":0.26809999346733093},{"id":"https://openalex.org/C2777212361","wikidata":"https://www.wikidata.org/wiki/Q5127848","display_name":"Class (philosophy)","level":2,"score":0.265500009059906},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.263700008392334},{"id":"https://openalex.org/C67186912","wikidata":"https://www.wikidata.org/wiki/Q367664","display_name":"Data modeling","level":2,"score":0.257099986076355}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/tit.2026.3692816","is_oa":false,"landing_page_url":"https://doi.org/10.1109/tit.2026.3692816","pdf_url":null,"source":{"id":"https://openalex.org/S4502562","display_name":"IEEE Transactions on Information Theory","issn_l":"0018-9448","issn":["0018-9448","1557-9654"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319808","host_organization_name":"Institute of Electrical and Electronics Engineers","host_organization_lineage":["https://openalex.org/P4310319808"],"host_organization_lineage_names":["Institute of Electrical and Electronics Engineers"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Transactions on Information Theory","raw_type":"journal-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[{"id":"https://openalex.org/G1719972442","display_name":"CAREER:  Robust Reinforcement Learning Under Model Uncertainty: Algorithms and Fundamental Limits","funder_award_id":"2438392","funder_id":"https://openalex.org/F4320306076","funder_display_name":"National Science Foundation"},{"id":"https://openalex.org/G4445825072","display_name":null,"funder_award_id":"D25AP00191-00","funder_id":"https://openalex.org/F4320332180","funder_display_name":"Defense Advanced Research Projects Agency"},{"id":"https://openalex.org/G7062071063","display_name":"Collaborative Research: CIF: Medium: Emerging Directions in Robust Learning and Inference","funder_award_id":"2438429","funder_id":"https://openalex.org/F4320306076","funder_display_name":"National Science Foundation"}],"funders":[{"id":"https://openalex.org/F4320306076","display_name":"National Science Foundation","ror":"https://ror.org/021nxhr62"},{"id":"https://openalex.org/F4320332180","display_name":"Defense Advanced Research Projects Agency","ror":"https://ror.org/02caytj08"}],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Standard":[0],"Reinforcement":[1],"Learning":[2],"(RL)":[3],"algorithms":[4],"are":[5],"typically":[6],"designed":[7],"to":[8,45,102],"maximize":[9],"the":[10,28,42,60,75,85,95,114,118,123,126,131,145],"expected":[11],"accumulative":[12],"reward,":[13],"which":[14],"may":[15],"be":[16,103],"inadequate":[17],"in":[18],"scenarios":[19],"where":[20,41],"risk":[21,51,115,127],"sensitivity":[22],"is":[23,39,44,78,99,129,141,150],"critical.":[24],"In":[25],"this":[26,68],"work,":[27],"problem":[29,69],"of":[30,84,87,134],"risk-sensitive":[31],"RL":[32],"with":[33,70],"Iterated":[34],"Conditional":[35],"Value":[36],"at":[37,54],"Risk":[38],"studied,":[40,143],"objective":[43],"optimize":[46],"outcomes":[47],"under":[48],"a":[49,71,82,107],"specified":[50],"level":[52,116,128],"\u03c4":[53,135],"each":[55],"step.":[56],"This":[57],"work":[58],"provides":[59],"first":[61],"minimax":[62,104,109,146],"optimal":[63,105,147],"sample":[64,76,148],"complexity":[65,77,149],"analysis":[66,112],"for":[67],"generative":[72],"model.":[73],"Specifically,":[74],"firstly":[79],"characterized":[80],"as":[81],"function":[83],"number":[86],"statesS,":[88],"actionsA,":[89],"and":[90,98,144],"effective":[91],"horizon":[92,120],"(1\u2212\u03b3)\u22121(resp.":[93],"horizonHin":[94],"finite-horizon":[96],"setting),":[97],"further":[100],"shown":[101],"via":[106],"novel":[108],"lower":[110],"bound":[111],"when":[113,125],"0Hin":[117],"finite":[119],"setting).":[121],"For":[122],"case":[124,133],"small,":[130],"limiting":[132],"\u2192":[136],"0,":[137],"termed":[138],"worst-path":[139],"RL,":[140],"then":[142],"also":[151],"theoretically":[152],"characterized.":[153]},"counts_by_year":[],"updated_date":"2026-07-29T09:40:50.615796","created_date":"2026-05-15T00:00:00"}
