{"id":"https://openalex.org/W7164027124","doi":"https://doi.org/10.48550/arxiv.2606.09348","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","display_name":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","publication_year":2026,"publication_date":"2026-06-08","ids":{"openalex":"https://openalex.org/W7164027124","doi":"https://doi.org/10.48550/arxiv.2606.09348"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.09348","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.09348","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.09348","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5138244668","display_name":"Yang Tian","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tian, Yang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138240475","display_name":"Rui Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Rui","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138223136","display_name":"Xumeng Wen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wen, Xumeng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138239936","display_name":"Junjie Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Junjie","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138219742","display_name":"Shizhao Sun","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sun, Shizhao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138237866","display_name":"Lei Song (30203)","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Song, Lei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138286888","display_name":"Jiang Bian","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bian, Jiang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5138201528","display_name":"Bo Zhao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhao, Bo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6694999933242798,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6694999933242798,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.05909999832510948,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.0568000003695488,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/bayesian-probability","display_name":"Bayesian probability","score":0.6395000219345093},{"id":"https://openalex.org/keywords/correctness","display_name":"Correctness","score":0.5807999968528748},{"id":"https://openalex.org/keywords/bayesian-inference","display_name":"Bayesian inference","score":0.47929999232292175},{"id":"https://openalex.org/keywords/decomposition","display_name":"Decomposition","score":0.46779999136924744},{"id":"https://openalex.org/keywords/trajectory","display_name":"Trajectory","score":0.4625999927520752},{"id":"https://openalex.org/keywords/quality","display_name":"Quality (philosophy)","score":0.4440000057220459},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.4397999942302704}],"concepts":[{"id":"https://openalex.org/C107673813","wikidata":"https://www.wikidata.org/wiki/Q812534","display_name":"Bayesian probability","level":2,"score":0.6395000219345093},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6255999803543091},{"id":"https://openalex.org/C55439883","wikidata":"https://www.wikidata.org/wiki/Q360812","display_name":"Correctness","level":2,"score":0.5807999968528748},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.491100013256073},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4853000044822693},{"id":"https://openalex.org/C160234255","wikidata":"https://www.wikidata.org/wiki/Q812535","display_name":"Bayesian inference","level":3,"score":0.47929999232292175},{"id":"https://openalex.org/C124681953","wikidata":"https://www.wikidata.org/wiki/Q339062","display_name":"Decomposition","level":2,"score":0.46779999136924744},{"id":"https://openalex.org/C13662910","wikidata":"https://www.wikidata.org/wiki/Q193139","display_name":"Trajectory","level":2,"score":0.4625999927520752},{"id":"https://openalex.org/C2779530757","wikidata":"https://www.wikidata.org/wiki/Q1207505","display_name":"Quality (philosophy)","level":2,"score":0.4440000057220459},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.4397999942302704},{"id":"https://openalex.org/C148220186","wikidata":"https://www.wikidata.org/wiki/Q7111912","display_name":"Outcome (game theory)","level":2,"score":0.41179999709129333},{"id":"https://openalex.org/C159877910","wikidata":"https://www.wikidata.org/wiki/Q2202883","display_name":"Autoregressive model","level":2,"score":0.35519999265670776},{"id":"https://openalex.org/C77618280","wikidata":"https://www.wikidata.org/wiki/Q1155772","display_name":"Scheme (mathematics)","level":2,"score":0.3434000015258789},{"id":"https://openalex.org/C149782125","wikidata":"https://www.wikidata.org/wiki/Q160039","display_name":"Econometrics","level":1,"score":0.3012000024318695},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.28600001335144043},{"id":"https://openalex.org/C101112237","wikidata":"https://www.wikidata.org/wiki/Q4874481","display_name":"Bayesian statistics","level":4,"score":0.25929999351501465},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.25380000472068787}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.09348","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.09348","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.09348","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.09348","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Long-horizon":[0],"agentic":[1],"tasks":[2],"pose":[3],"a":[4,64,100,105,110,140],"fundamental":[5],"credit":[6,70,154,191],"assignment":[7,71,192],"challenge":[8],"for":[9,68],"outcome-base":[10],"reinforcement":[11],"learning:":[12],"trajectory-level":[13],"rewards":[14],"verify":[15],"final":[16,74],"correctness":[17],"but":[18],"provide":[19],"limited":[20],"guidance":[21],"on":[22],"which":[23],"intermediate":[24,129],"reasoning":[25],"steps":[26],"or":[27,132],"tool":[28],"interactions":[29],"contribute":[30],"to":[31,93,184],"the":[32,81,86,134],"outcome.":[33,136],"The":[34],"difficulty":[35],"is":[36],"especially":[37],"pronounced":[38],"in":[39],"multi-turn":[40],"search":[41],"agents,":[42],"where":[43],"successful":[44],"trajectories":[45,52],"may":[46,53],"contain":[47,54],"misleading":[48],"actions":[49],"and":[50,89,109,142,174,177,199],"failed":[51],"valuable":[55],"evidence-gathering":[56],"steps.":[57],"We":[58],"propose":[59],"PBSD":[60,76,138,167],"(Privileged":[61],"Bayesian":[62,119],"Self-Distillation),":[63],"Bayes-calibrated":[65,152],"self-distillation":[66],"method":[67],"fine-grained":[69,190],"under":[72],"sparse":[73,148],"rewards.":[75],"measures":[77],"trajectory":[78],"quality":[79],"through":[80],"posterior-to-prior":[82],"probability":[83],"ratio":[84,98,103],"of":[85,117],"verified":[87,135],"answer":[88],"applies":[90],"Bayes'":[91],"rule":[92],"convert":[94],"this":[95,118],"hard-to-estimate":[96],"answer-side":[97],"into":[99,151],"tractable":[101],"likelihood":[102],"between":[104],"standard":[106,161],"student":[107],"model":[108],"privileged":[111],"answer-conditioned":[112],"teacher":[113],"model.":[114],"Autoregressive":[115],"decomposition":[116],"evidence":[120],"score":[121],"yields":[122,200],"turn-level":[123,153],"signals":[124],"that":[125,146,166,188],"identify":[126],"whether":[127],"each":[128],"turn":[130],"supports":[131],"undermines":[133],"Consequently,":[137],"provides":[139],"principled":[141],"elegant":[143],"reweighting":[144],"scheme":[145],"transforms":[147],"outcome":[149],"supervision":[150],"signals,":[155],"while":[156],"remaining":[157],"fully":[158],"compatible":[159],"with":[160],"policy":[162,197],"optimization.":[163],"Experiments":[164],"demonstrate":[165],"consistently":[168],"enhances":[169],"performance":[170],"across":[171],"both":[172],"in-domain":[173],"out-of-domain":[175],"settings,":[176],"effectively":[178],"transfers":[179],"knowledge":[180],"from":[181],"short-context":[182],"training":[183],"long-context":[185],"inference,":[186],"suggesting":[187],"its":[189],"mechanism":[193],"facilitates":[194],"more":[195],"effective":[196],"learning":[198],"improved":[201],"generalization.":[202]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-10T00:00:00"}
