{"id":"https://openalex.org/W7131696463","doi":"https://doi.org/10.48550/arxiv.2602.21420","title":"Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning","display_name":"Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning","publication_year":2026,"publication_date":"2026-02-24","ids":{"openalex":"https://openalex.org/W7131696463","doi":"https://doi.org/10.48550/arxiv.2602.21420"},"language":null,"primary_location":{"id":"pmh:doi:10.48550/arxiv.2602.21420","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"publisher-specific-oa","license_id":"https://openalex.org/licenses/publisher-specific-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"type":"article","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":null,"any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5126942858","display_name":"Yuanda Xu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xu, Yuanda","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5027724386","display_name":"Hejian Sang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sang, Hejian","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5126885784","display_name":"Zhengze Zhou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhou, Zhengze","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5126919857","display_name":"Ran He","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"He, Ran","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5126909628","display_name":"Zhipeng Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Zhipeng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.22198137,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.33649998903274536,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.33649998903274536,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.08950000256299973,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10181","display_name":"Natural Language Processing Techniques","score":0.062300000339746475,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7042999863624573},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.4948999881744385},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.4747999906539917},{"id":"https://openalex.org/keywords/normalization","display_name":"Normalization (sociology)","score":0.39590001106262207},{"id":"https://openalex.org/keywords/motivated-reasoning","display_name":"Motivated reasoning","score":0.3310000002384186},{"id":"https://openalex.org/keywords/verifiable-secret-sharing","display_name":"Verifiable secret sharing","score":0.3303999900817871},{"id":"https://openalex.org/keywords/overconfidence-effect","display_name":"Overconfidence effect","score":0.3221000134944916}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7042999863624573},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6182000041007996},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.4948999881744385},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.4747999906539917},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.46309998631477356},{"id":"https://openalex.org/C136886441","wikidata":"https://www.wikidata.org/wiki/Q926129","display_name":"Normalization (sociology)","level":2,"score":0.39590001106262207},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3930000066757202},{"id":"https://openalex.org/C180747234","wikidata":"https://www.wikidata.org/wiki/Q23373","display_name":"Cognitive psychology","level":1,"score":0.3393000066280365},{"id":"https://openalex.org/C2776325391","wikidata":"https://www.wikidata.org/wiki/Q6917865","display_name":"Motivated reasoning","level":3,"score":0.3310000002384186},{"id":"https://openalex.org/C85847156","wikidata":"https://www.wikidata.org/wiki/Q59015987","display_name":"Verifiable secret sharing","level":3,"score":0.3303999900817871},{"id":"https://openalex.org/C51110983","wikidata":"https://www.wikidata.org/wiki/Q16503490","display_name":"Overconfidence effect","level":2,"score":0.3221000134944916},{"id":"https://openalex.org/C155512373","wikidata":"https://www.wikidata.org/wiki/Q287450","display_name":"Residual","level":2,"score":0.30489999055862427},{"id":"https://openalex.org/C62354387","wikidata":"https://www.wikidata.org/wiki/Q875399","display_name":"Boundary (topology)","level":2,"score":0.2953999936580658},{"id":"https://openalex.org/C15744967","wikidata":"https://www.wikidata.org/wiki/Q9418","display_name":"Psychology","level":0,"score":0.2734000086784363},{"id":"https://openalex.org/C149782125","wikidata":"https://www.wikidata.org/wiki/Q160039","display_name":"Econometrics","level":1,"score":0.26899999380111694},{"id":"https://openalex.org/C48444904","wikidata":"https://www.wikidata.org/wiki/Q4116378","display_name":"Self-confidence","level":2,"score":0.26829999685287476},{"id":"https://openalex.org/C167085575","wikidata":"https://www.wikidata.org/wiki/Q6803654","display_name":"Mean squared prediction error","level":2,"score":0.2662999927997589},{"id":"https://openalex.org/C124681953","wikidata":"https://www.wikidata.org/wiki/Q339062","display_name":"Decomposition","level":2,"score":0.25450000166893005},{"id":"https://openalex.org/C168900304","wikidata":"https://www.wikidata.org/wiki/Q171407","display_name":"Valence (chemistry)","level":2,"score":0.25200000405311584}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:doi:10.48550/arxiv.2602.21420","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"publisher-specific-oa","license_id":"https://openalex.org/licenses/publisher-specific-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},{"id":"doi:10.48550/arxiv.2602.21420","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2602.21420","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:doi:10.48550/arxiv.2602.21420","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"publisher-specific-oa","license_id":"https://openalex.org/licenses/publisher-specific-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/16","display_name":"Peace, Justice and strong institutions","score":0.6652907729148865}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"Learning":[1],"with":[2,202],"Verifiable":[3],"Rewards":[4],"(RLVR)":[5],"has":[6,100],"become":[7],"the":[8,39,56,97,119,152,169,182,190,208],"leading":[9],"paradigm":[10],"for":[11],"enhancing":[12],"reasoning":[13,41,94],"in":[14],"Large":[15],"Language":[16],"Models":[17],"(LLMs).":[18],"However,":[19],"standard":[20],"RLVR":[21],"algorithms":[22],"suffer":[23],"from":[24],"a":[25,49,82,127,155,163],"well-documented":[26],"pathology:":[27],"while":[28],"they":[29,36],"improve":[30],"Pass@1":[31],"accuracy":[32],"through":[33],"sharpened":[34],"sampling,":[35],"simultaneously":[37],"narrow":[38],"model's":[40],"boundary":[42],"and":[43,105,179,187,196,205,217],"reduce":[44],"generation":[45],"diversity.":[46],"We":[47,85,172],"identify":[48],"root":[50],"cause":[51],"that":[52,67,87,96,145,166],"existing":[53,203],"methods":[54,66,204],"overlook:":[55],"uniform":[57],"penalization":[58],"of":[59,154],"errors.":[60],"Current":[61],"approaches":[62],"--":[63,76],"whether":[64],"data-filtering":[65],"select":[68],"prompts":[69],"by":[70],"difficulty,":[71],"or":[72],"advantage":[73],"normalization":[74],"schemes":[75],"treat":[77],"all":[78,213],"incorrect":[79],"rollouts":[80],"within":[81,189],"group":[83],"identically.":[84],"show":[86],"this":[88],"uniformity":[89],"allows":[90],"overconfident":[91,160],"errors":[92],"(incorrect":[93],"paths":[95],"RL":[98],"process":[99],"spuriously":[101],"reinforced)":[102],"to":[103,137,159],"persist":[104],"monopolize":[106],"probability":[107],"mass,":[108],"ultimately":[109],"suppressing":[110],"valid":[111],"exploratory":[112],"trajectories.":[113],"To":[114],"address":[115],"this,":[116],"we":[117,143],"propose":[118],"Asymmetric":[120],"Confidence-aware":[121],"Error":[122],"Penalty":[123],"(ACE).":[124],"ACE":[125,199],"introduces":[126],"per-rollout":[128],"confidence":[129],"shift":[130],"metric,":[131],"c_i":[132],"=":[133],"log(pi_theta(y_i|x)":[134],"/":[135],"pi_ref(y_i|x)),":[136],"dynamically":[138],"modulate":[139],"negative":[140],"advantages.":[141],"Theoretically,":[142],"demonstrate":[144],"ACE's":[146],"gradient":[147,153],"can":[148],"be":[149],"decomposed":[150],"into":[151],"selective":[156],"regularizer":[157],"restricted":[158],"errors,":[161],"plus":[162],"well-characterized":[164],"residual":[165],"partially":[167],"moderates":[168],"regularizer's":[170],"strength.":[171],"conduct":[173],"extensive":[174],"experiments":[175],"fine-tuning":[176],"Qwen2.5-Math-7B,":[177],"Qwen3-8B-Base,":[178],"Llama-3.1-8B-Instruct":[180],"on":[181,194],"DAPO-Math-17K":[183],"dataset":[184],"using":[185],"GRPO":[186],"DAPO":[188],"VERL":[191],"framework.":[192],"Evaluated":[193],"MATH-500":[195],"AIME":[197],"2025,":[198],"composes":[200],"seamlessly":[201],"consistently":[206],"improves":[207],"full":[209],"Pass@k":[210],"spectrum":[211],"across":[212],"three":[214],"model":[215],"families":[216],"benchmarks.":[218]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-02-27T00:00:00"}
