{"id":"https://openalex.org/W7148724596","doi":"https://doi.org/10.48550/arxiv.2604.01946","title":"PAC-Bayesian Reward-Certified Outcome Weighted Learning","display_name":"PAC-Bayesian Reward-Certified Outcome Weighted Learning","publication_year":2026,"publication_date":"2026-04-02","ids":{"openalex":"https://openalex.org/W7148724596","doi":"https://doi.org/10.48550/arxiv.2604.01946"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.01946","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.01946","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.01946","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5069681923","display_name":"Yuya Ishikawa","orcid":"https://orcid.org/0000-0002-5482-4377"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ishikawa, Yuya","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5111191857","display_name":"Shu Tamano","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tamano, Shu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10845","display_name":"Advanced Causal Inference Techniques","score":0.590499997138977,"subfield":{"id":"https://openalex.org/subfields/2613","display_name":"Statistics and Probability"},"field":{"id":"https://openalex.org/fields/26","display_name":"Mathematics"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10845","display_name":"Advanced Causal Inference Techniques","score":0.590499997138977,"subfield":{"id":"https://openalex.org/subfields/2613","display_name":"Statistics and Probability"},"field":{"id":"https://openalex.org/fields/26","display_name":"Mathematics"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T13702","display_name":"Machine Learning in Healthcare","score":0.17810000479221344,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.04879999905824661,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/outcome","display_name":"Outcome (game theory)","score":0.6263999938964844},{"id":"https://openalex.org/keywords/bayesian-probability","display_name":"Bayesian probability","score":0.5315999984741211},{"id":"https://openalex.org/keywords/selection","display_name":"Selection (genetic algorithm)","score":0.5228000283241272},{"id":"https://openalex.org/keywords/upper-and-lower-bounds","display_name":"Upper and lower bounds","score":0.49390000104904175},{"id":"https://openalex.org/keywords/bayes-theorem","display_name":"Bayes' theorem","score":0.4169999957084656},{"id":"https://openalex.org/keywords/reduction","display_name":"Reduction (mathematics)","score":0.4041000008583069},{"id":"https://openalex.org/keywords/prior-probability","display_name":"Prior probability","score":0.4032000005245209},{"id":"https://openalex.org/keywords/calibration","display_name":"Calibration","score":0.3901999890804291}],"concepts":[{"id":"https://openalex.org/C148220186","wikidata":"https://www.wikidata.org/wiki/Q7111912","display_name":"Outcome (game theory)","level":2,"score":0.6263999938964844},{"id":"https://openalex.org/C107673813","wikidata":"https://www.wikidata.org/wiki/Q812534","display_name":"Bayesian probability","level":2,"score":0.5315999984741211},{"id":"https://openalex.org/C81917197","wikidata":"https://www.wikidata.org/wiki/Q628760","display_name":"Selection (genetic algorithm)","level":2,"score":0.5228000283241272},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5012000203132629},{"id":"https://openalex.org/C77553402","wikidata":"https://www.wikidata.org/wiki/Q13222579","display_name":"Upper and lower bounds","level":2,"score":0.49390000104904175},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.484499990940094},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.47749999165534973},{"id":"https://openalex.org/C207201462","wikidata":"https://www.wikidata.org/wiki/Q182505","display_name":"Bayes' theorem","level":3,"score":0.4169999957084656},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.4074999988079071},{"id":"https://openalex.org/C111335779","wikidata":"https://www.wikidata.org/wiki/Q3454686","display_name":"Reduction (mathematics)","level":2,"score":0.4041000008583069},{"id":"https://openalex.org/C177769412","wikidata":"https://www.wikidata.org/wiki/Q278090","display_name":"Prior probability","level":3,"score":0.4032000005245209},{"id":"https://openalex.org/C165838908","wikidata":"https://www.wikidata.org/wiki/Q736777","display_name":"Calibration","level":2,"score":0.3901999890804291},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.39010000228881836},{"id":"https://openalex.org/C57830394","wikidata":"https://www.wikidata.org/wiki/Q278079","display_name":"Posterior probability","level":3,"score":0.35760000348091125},{"id":"https://openalex.org/C160234255","wikidata":"https://www.wikidata.org/wiki/Q812535","display_name":"Bayesian inference","level":3,"score":0.3449999988079071},{"id":"https://openalex.org/C49937458","wikidata":"https://www.wikidata.org/wiki/Q2599292","display_name":"Probabilistic logic","level":2,"score":0.3181999921798706},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.31470000743865967},{"id":"https://openalex.org/C63002673","wikidata":"https://www.wikidata.org/wiki/Q2260590","display_name":"Scoring rule","level":2,"score":0.31349998712539673},{"id":"https://openalex.org/C149441793","wikidata":"https://www.wikidata.org/wiki/Q200726","display_name":"Probability distribution","level":2,"score":0.30399999022483826},{"id":"https://openalex.org/C204323151","wikidata":"https://www.wikidata.org/wiki/Q905424","display_name":"Range (aeronautics)","level":2,"score":0.28439998626708984},{"id":"https://openalex.org/C2781067378","wikidata":"https://www.wikidata.org/wiki/Q17027399","display_name":"Interpretability","level":2,"score":0.2800000011920929},{"id":"https://openalex.org/C39891107","wikidata":"https://www.wikidata.org/wiki/Q5767098","display_name":"Hinge loss","level":3,"score":0.2784000039100647}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.01946","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.01946","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.01946","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.01946","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Estimating":[0],"optimal":[1,130],"individualized":[2],"treatment":[3,183],"rules":[4],"(ITRs)":[5],"via":[6],"outcome":[7],"weighted":[8],"learning":[9,57,103],"(OWL)":[10],"often":[11],"relies":[12],"on":[13,87],"observed":[14],"rewards":[15],"that":[16,99,128,175],"are":[17],"noisy":[18],"or":[19],"optimistic":[20],"proxies":[21],"for":[22,122,169,193],"the":[23,33,46,56,88,114,129,145],"true":[24,89],"latent":[25],"utility.":[26],"Ignoring":[27],"this":[28,61,133],"reward":[29,80,187],"uncertainty":[30,54,74,188],"leads":[31],"to":[32,50,190],"selection":[34,147],"of":[35,116],"policies":[36],"with":[37,163],"inflated":[38],"apparent":[39],"performance,":[40],"yet":[41],"existing":[42],"OWL":[43],"frameworks":[44],"lack":[45],"finite-sample":[47],"guarantees":[48],"required":[49],"systematically":[51],"embed":[52],"such":[53],"into":[55,104],"objective.":[58],"To":[59,143],"address":[60],"issue,":[62],"we":[63,93,126,154],"propose":[64],"PAC-Bayesian":[65],"Reward-Certified":[66],"Outcome":[67],"Weighted":[68],"Learning":[69],"(PROWL).":[70],"Given":[71],"a":[72,78,82,105,117,139,156,164],"one-sided":[73],"certificate,":[75],"PROWL":[76,176],"constructs":[77],"conservative":[79],"and":[81],"strictly":[83],"policy-dependent":[84],"lower":[85,120],"bound":[86,121,134],"expected":[90],"value.":[91],"Theoretically,":[92],"prove":[94],"an":[95],"exact":[96],"certified":[97,166],"reduction":[98],"transforms":[100],"robust":[101],"policy":[102],"unified,":[106],"split-free":[107],"cost-sensitive":[108],"classification":[109],"task.":[110],"This":[111],"formulation":[112],"enables":[113],"derivation":[115],"nonasymptotic":[118],"PAC-Bayes":[119],"randomized":[123],"ITRs,":[124],"where":[125],"establish":[127],"posterior":[131],"maximizing":[132],"is":[135],"exactly":[136],"characterized":[137],"by":[138],"general":[140],"Bayes":[141],"update.":[142],"overcome":[144],"learning-rate":[146],"problem":[148],"inherent":[149],"in":[150,179],"generalized":[151],"Bayesian":[152],"inference,":[153],"introduce":[155],"fully":[157],"automated,":[158],"bounds-based":[159],"calibration":[160],"procedure,":[161],"coupled":[162],"Fisher-consistent":[165],"hinge":[167],"surrogate":[168],"efficient":[170],"optimization.":[171],"Our":[172],"experiments":[173],"demonstrate":[174],"achieves":[177],"improvements":[178],"estimating":[180],"robust,":[181],"high-value":[182],"regimes":[184],"under":[185],"severe":[186],"compared":[189],"standard":[191],"methods":[192],"ITR":[194],"estimation.":[195]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-04-04T00:00:00"}
