{"id":"https://openalex.org/W7160034168","doi":"https://doi.org/10.48550/arxiv.2605.00155","title":"Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback","display_name":"Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback","publication_year":2026,"publication_date":"2026-04-30","ids":{"openalex":"https://openalex.org/W7160034168","doi":"https://doi.org/10.48550/arxiv.2605.00155"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.00155","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.00155","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.00155","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5135206705","display_name":"Yikai Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Yikai","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135207054","display_name":"Shang Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Shang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5134287740","display_name":"Jose Blanchet","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Blanchet, Jose","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.366100013256073,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},"topics":[{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.366100013256073,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.2434999942779541,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.07779999822378159,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/regret","display_name":"Regret","score":0.9496999979019165},{"id":"https://openalex.org/keywords/ambiguity","display_name":"Ambiguity","score":0.6753000020980835},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5455999970436096},{"id":"https://openalex.org/keywords/proxy","display_name":"Proxy (statistics)","score":0.5177000164985657},{"id":"https://openalex.org/keywords/core","display_name":"Core (optical fiber)","score":0.40880000591278076},{"id":"https://openalex.org/keywords/pessimism","display_name":"Pessimism","score":0.4074999988079071},{"id":"https://openalex.org/keywords/ask-price","display_name":"Ask price","score":0.39649999141693115},{"id":"https://openalex.org/keywords/optimization-problem","display_name":"Optimization problem","score":0.3684999942779541}],"concepts":[{"id":"https://openalex.org/C50817715","wikidata":"https://www.wikidata.org/wiki/Q79895177","display_name":"Regret","level":2,"score":0.9496999979019165},{"id":"https://openalex.org/C2780522230","wikidata":"https://www.wikidata.org/wiki/Q1140419","display_name":"Ambiguity","level":2,"score":0.6753000020980835},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5942000150680542},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.5759000182151794},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5455999970436096},{"id":"https://openalex.org/C2780148112","wikidata":"https://www.wikidata.org/wiki/Q1432581","display_name":"Proxy (statistics)","level":2,"score":0.5177000164985657},{"id":"https://openalex.org/C2164484","wikidata":"https://www.wikidata.org/wiki/Q5170150","display_name":"Core (optical fiber)","level":2,"score":0.40880000591278076},{"id":"https://openalex.org/C9992130","wikidata":"https://www.wikidata.org/wiki/Q484954","display_name":"Pessimism","level":2,"score":0.4074999988079071},{"id":"https://openalex.org/C90329073","wikidata":"https://www.wikidata.org/wiki/Q914232","display_name":"Ask price","level":2,"score":0.39649999141693115},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.3684999942779541},{"id":"https://openalex.org/C144521790","wikidata":"https://www.wikidata.org/wiki/Q134164","display_name":"Simplex algorithm","level":3,"score":0.33709999918937683},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.3050000071525574},{"id":"https://openalex.org/C527412718","wikidata":"https://www.wikidata.org/wiki/Q855395","display_name":"Interpretation (philosophy)","level":2,"score":0.2928999960422516},{"id":"https://openalex.org/C193254401","wikidata":"https://www.wikidata.org/wiki/Q2160088","display_name":"Robust optimization","level":2,"score":0.28630000352859497},{"id":"https://openalex.org/C2779530757","wikidata":"https://www.wikidata.org/wiki/Q1207505","display_name":"Quality (philosophy)","level":2,"score":0.28299999237060547},{"id":"https://openalex.org/C45374587","wikidata":"https://www.wikidata.org/wiki/Q12525525","display_name":"Computation","level":2,"score":0.2702000141143799},{"id":"https://openalex.org/C62438384","wikidata":"https://www.wikidata.org/wiki/Q331350","display_name":"Simplex","level":2,"score":0.2687999904155731},{"id":"https://openalex.org/C41045048","wikidata":"https://www.wikidata.org/wiki/Q202843","display_name":"Linear programming","level":2,"score":0.26010000705718994},{"id":"https://openalex.org/C75553542","wikidata":"https://www.wikidata.org/wiki/Q178161","display_name":"A priori and a posteriori","level":2,"score":0.25459998846054077}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.00155","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.00155","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.00155","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.00155","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16","score":0.6987152099609375}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1],"from":[2],"human":[3,27],"feedback":[4],"(RLHF)":[5],"is":[6,20,39,48,183],"a":[7,22,31,81,140,156,163,169],"central":[8],"post-training":[9],"tool":[10],"for":[11,25,78],"aligning":[12],"large":[13],"language":[14],"models,":[15],"but":[16],"its":[17],"training":[18],"reward":[19,60,64,86,93,120],"only":[21],"learned":[23],"proxy":[24,63],"true":[26,68],"utility.":[28],"This":[29],"creates":[30],"decision":[32],"problem":[33,127],"under":[34,116,144],"objective":[35],"misspecification:":[36],"the":[37,113,117,125,136,145,153],"policy":[38,115],"optimized":[40],"against":[41],"an":[42,51],"estimated":[43],"reward,":[44],"while":[45],"deployment":[46],"performance":[47],"governed":[49],"by":[50,150],"unobserved":[52],"population":[53],"preference.":[54],"The":[55],"resulting":[56],"gap":[57],"leads":[58],"to":[59,112,162,173],"over-optimization,":[61],"where":[62],"keeps":[65],"improving":[66],"after":[67],"quality":[69],"deteriorates.":[70],"We":[71,122],"propose":[72],"distributionally":[73,100],"robust":[74,101],"regret":[75,110,131],"optimization":[76],"(DRRO)":[77],"RLHF":[79],"with":[80],"Wasserstein":[82],"ambiguity":[83],"set":[84],"over":[85],"laws,":[87],"using":[88],"promptwise":[89,130],"$\\ell_p$":[90],"distances":[91],"between":[92],"vectors":[94],"as":[95],"transport":[96,147],"costs.":[97],"Unlike":[98],"standard":[99,187],"optimization,":[102],"which":[103],"pessimizes":[104,108],"worst-case":[105,109],"value,":[106],"DRRO":[107,182],"relative":[111],"best":[114],"same":[118],"plausible":[119],"perturbation.":[121],"show":[123,180],"that":[124,167,181],"expressive-policy":[126],"decomposes":[128],"into":[129],"problems.":[132],"For":[133],"each":[134],"prompt,":[135],"inner":[137],"adversary":[138],"has":[139,155],"dual-norm":[141],"closed":[142],"form;":[143],"$\\ell_1$":[146],"cost":[148],"used":[149],"our":[151],"algorithm,":[152],"optimizer":[154],"water-filling":[157],"structure.":[158],"These":[159],"results":[160],"lead":[161],"practical":[164],"policy-gradient":[165],"algorithm":[166],"adds":[168],"simple":[170],"sampled":[171],"bonus":[172],"GRPO-style":[174],"training.":[175],"Theory":[176],"and":[177,189],"experiments":[178],"both":[179],"less":[184],"over-pessimistic":[185],"than":[186,194],"DRO":[188],"mitigates":[190],"over-optimization":[191],"more":[192],"effectively":[193],"existing":[195],"baselines.":[196]},"counts_by_year":[],"updated_date":"2026-07-11T05:44:25.926202","created_date":"2026-05-05T00:00:00"}
