{"id":"https://openalex.org/W7160895243","doi":"https://doi.org/10.48550/arxiv.2605.08182","title":"Quantile Geometry Regularization for Distributional Reinforcement Learning","display_name":"Quantile Geometry Regularization for Distributional Reinforcement Learning","publication_year":2026,"publication_date":"2026-05-05","ids":{"openalex":"https://openalex.org/W7160895243","doi":"https://doi.org/10.48550/arxiv.2605.08182"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.08182","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.08182","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.08182","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5104264413","display_name":"Zhaofan Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Zhaofan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135951739","display_name":"Minghao Yang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yang, Minghao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135321148","display_name":"Rufeng Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Rufeng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135973899","display_name":"Sihong Xie","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xie, Sihong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5135949581","display_name":"Hui Xiong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xiong, Hui","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.41029998660087585,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.41029998660087585,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.34060001373291016,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.09560000151395798,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/quantile","display_name":"Quantile","score":0.9559000134468079},{"id":"https://openalex.org/keywords/quantile-regression","display_name":"Quantile regression","score":0.5234000086784363},{"id":"https://openalex.org/keywords/regularization","display_name":"Regularization (linguistics)","score":0.5067999958992004},{"id":"https://openalex.org/keywords/monotonic-function","display_name":"Monotonic function","score":0.48890000581741333},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.48260000348091125},{"id":"https://openalex.org/keywords/quantile-function","display_name":"Quantile function","score":0.41609999537467957},{"id":"https://openalex.org/keywords/robustness","display_name":"Robustness (evolution)","score":0.3237999975681305},{"id":"https://openalex.org/keywords/probability-distribution","display_name":"Probability distribution","score":0.3215999901294708}],"concepts":[{"id":"https://openalex.org/C118671147","wikidata":"https://www.wikidata.org/wiki/Q578714","display_name":"Quantile","level":2,"score":0.9559000134468079},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.5587000250816345},{"id":"https://openalex.org/C63817138","wikidata":"https://www.wikidata.org/wiki/Q3455889","display_name":"Quantile regression","level":2,"score":0.5234000086784363},{"id":"https://openalex.org/C2776135515","wikidata":"https://www.wikidata.org/wiki/Q17143721","display_name":"Regularization (linguistics)","level":2,"score":0.5067999958992004},{"id":"https://openalex.org/C72169020","wikidata":"https://www.wikidata.org/wiki/Q194404","display_name":"Monotonic function","level":2,"score":0.48890000581741333},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.48260000348091125},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.4546999931335449},{"id":"https://openalex.org/C47121976","wikidata":"https://www.wikidata.org/wiki/Q3489473","display_name":"Quantile function","level":4,"score":0.41609999537467957},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.3601999878883362},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.3237999975681305},{"id":"https://openalex.org/C149441793","wikidata":"https://www.wikidata.org/wiki/Q200726","display_name":"Probability distribution","level":2,"score":0.3215999901294708},{"id":"https://openalex.org/C98385598","wikidata":"https://www.wikidata.org/wiki/Q1339385","display_name":"Empirical distribution function","level":2,"score":0.3111000061035156},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.3043000102043152},{"id":"https://openalex.org/C149782125","wikidata":"https://www.wikidata.org/wiki/Q160039","display_name":"Econometrics","level":1,"score":0.30219998955726624},{"id":"https://openalex.org/C110121322","wikidata":"https://www.wikidata.org/wiki/Q865811","display_name":"Distribution (mathematics)","level":2,"score":0.2906000018119812},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.29010000824928284},{"id":"https://openalex.org/C2777634741","wikidata":"https://www.wikidata.org/wiki/Q768993","display_name":"Wasserstein metric","level":2,"score":0.28780001401901245},{"id":"https://openalex.org/C152124472","wikidata":"https://www.wikidata.org/wiki/Q1204361","display_name":"Redundancy (engineering)","level":2,"score":0.2849999964237213},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.27799999713897705},{"id":"https://openalex.org/C137668524","wikidata":"https://www.wikidata.org/wiki/Q189813","display_name":"Censoring (clinical trials)","level":2,"score":0.26350000500679016},{"id":"https://openalex.org/C147581598","wikidata":"https://www.wikidata.org/wiki/Q729429","display_name":"Extreme value theory","level":2,"score":0.26350000500679016},{"id":"https://openalex.org/C102366305","wikidata":"https://www.wikidata.org/wiki/Q1097688","display_name":"Nonparametric statistics","level":2,"score":0.2621000111103058},{"id":"https://openalex.org/C43555835","wikidata":"https://www.wikidata.org/wiki/Q2300258","display_name":"Conditional probability distribution","level":2,"score":0.2513999938964844}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.08182","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.08182","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.08182","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.08182","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Quantile-based":[0,27],"distributional":[1,92,112,143],"reinforcement":[2,144],"learning":[3,145],"methods":[4],"learn":[5],"return":[6],"distributions":[7],"through":[8],"sampled":[9,62],"quantile":[10,41,58,76,100,107,117],"regression,":[11],"but":[12],"their":[13],"bootstrapped":[14],"target":[15],"quantiles":[16],"may":[17],"induce":[18],"distorted":[19],"or":[20,125],"degenerate":[21],"distribution":[22],"estimates.":[23],"We":[24,44,65],"propose":[25],"Robust":[26],"Implicit":[28],"Quantile":[29],"Networks":[30],"(RQIQN),":[31],"a":[32,40,47,53,72,80],"lightweight":[33],"Wasserstein":[34,73],"distributionally":[35,74],"robust":[36,75],"enhancement":[37],"boosted":[38],"from":[39],"estimation":[42,59,77],"perspective.":[43],"first":[45],"reinterpret":[46],"snapshot":[48],"of":[49,55],"IQN":[50],"loss":[51],"as":[52],"collection":[54],"local":[56,69],"empirical":[57],"problems":[60],"over":[61],"current":[63],"fractions.":[64],"then":[66],"robustify":[67],"each":[68],"slot":[70],"with":[71],"formulation,":[78],"yielding":[79],"closed-form,":[81],"fraction-dependent":[82],"correction":[83,89],"to":[84],"the":[85,98,121,136],"Bellman":[86],"target.":[87],"This":[88],"directly":[90],"addresses":[91],"degeneration:":[93],"its":[94,103],"median":[95],"antisymmetry":[96],"preserves":[97],"risk-neutral":[99],"average,":[101],"while":[102],"monotonicity":[104],"enlarges":[105],"upper-lower":[106],"gaps":[108],"and":[109,150],"counteracts":[110],"collapsed":[111],"spread.":[113],"RQIQN":[114,138],"thus":[115],"regularizes":[116],"geometry":[118],"without":[119],"changing":[120],"underlying":[122],"value":[123],"objective":[124],"requiring":[126],"additional":[127],"sample":[128],"set":[129],"reconstruction.":[130],"Finally,":[131],"we":[132],"empirically":[133],"show":[134],"that":[135],"proposed":[137],"outperforms":[139],"other":[140],"existing":[141],"quantile-based":[142],"algorithms":[146],"in":[147],"risk-sensitive":[148],"navigation":[149],"Atari":[151],"games.":[152]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-13T00:00:00"}
