{"id":"https://openalex.org/W7162416026","doi":"https://doi.org/10.48550/arxiv.2605.25864","title":"When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards","display_name":"When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards","publication_year":2026,"publication_date":"2026-05-25","ids":{"openalex":"https://openalex.org/W7162416026","doi":"https://doi.org/10.48550/arxiv.2605.25864"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.25864","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.25864","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.25864","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5137074500","display_name":"Li Xin Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Li","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137021476","display_name":"Xiaodong Lu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lu, Xiaodong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137013077","display_name":"Xiaohan Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Xiaohan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137008502","display_name":"Yikun Ban","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ban, Yikun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137073164","display_name":"Jiajun Chai","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chai, Jiajun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136995099","display_name":"Wei Lin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lin, Wei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137042978","display_name":"Tianhao Peng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Peng, Tianhao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5137041984","display_name":"Guojun Yin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yin, Guojun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12535","display_name":"Machine Learning and Data Classification","score":0.34130001068115234,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T12535","display_name":"Machine Learning and Data Classification","score":0.34130001068115234,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.15839999914169312,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11550","display_name":"Text and Document Classification Technologies","score":0.07930000126361847,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7682999968528748},{"id":"https://openalex.org/keywords/verifiable-secret-sharing","display_name":"Verifiable secret sharing","score":0.7522000074386597},{"id":"https://openalex.org/keywords/oracle","display_name":"Oracle","score":0.6355000138282776},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.5895000100135803},{"id":"https://openalex.org/keywords/generality","display_name":"Generality","score":0.5489000082015991},{"id":"https://openalex.org/keywords/active-learning","display_name":"Active learning (machine learning)","score":0.5184999704360962},{"id":"https://openalex.org/keywords/metric","display_name":"Metric (unit)","score":0.4749999940395355},{"id":"https://openalex.org/keywords/annotation","display_name":"Annotation","score":0.44209998846054077}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7800999879837036},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7682999968528748},{"id":"https://openalex.org/C85847156","wikidata":"https://www.wikidata.org/wiki/Q59015987","display_name":"Verifiable secret sharing","level":3,"score":0.7522000074386597},{"id":"https://openalex.org/C55166926","wikidata":"https://www.wikidata.org/wiki/Q2892946","display_name":"Oracle","level":2,"score":0.6355000138282776},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.607200026512146},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.5895000100135803},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.582099974155426},{"id":"https://openalex.org/C2780767217","wikidata":"https://www.wikidata.org/wiki/Q5532421","display_name":"Generality","level":2,"score":0.5489000082015991},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.5184999704360962},{"id":"https://openalex.org/C176217482","wikidata":"https://www.wikidata.org/wiki/Q860554","display_name":"Metric (unit)","level":2,"score":0.4749999940395355},{"id":"https://openalex.org/C2776321320","wikidata":"https://www.wikidata.org/wiki/Q857525","display_name":"Annotation","level":2,"score":0.44209998846054077},{"id":"https://openalex.org/C132758656","wikidata":"https://www.wikidata.org/wiki/Q5307365","display_name":"Dreyfus model of skill acquisition","level":2,"score":0.396699994802475},{"id":"https://openalex.org/C2776760102","wikidata":"https://www.wikidata.org/wiki/Q5139990","display_name":"Code (set theory)","level":3,"score":0.3686000108718872},{"id":"https://openalex.org/C43214815","wikidata":"https://www.wikidata.org/wiki/Q7310987","display_name":"Reliability (semiconductor)","level":3,"score":0.3463999927043915},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.3197000026702881},{"id":"https://openalex.org/C31170391","wikidata":"https://www.wikidata.org/wiki/Q188619","display_name":"Hierarchy","level":2,"score":0.28870001435279846},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.28459998965263367},{"id":"https://openalex.org/C2779305910","wikidata":"https://www.wikidata.org/wiki/Q5172809","display_name":"Corrective feedback","level":2,"score":0.25920000672340393},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.2535000145435333}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.25864","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.25864","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.25864","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.25864","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Large":[0],"Language":[1],"Models":[2],"(LLMs)":[3],"have":[4],"achieved":[5],"remarkable":[6],"advancements":[7],"in":[8,37],"reasoning":[9],"capabilities":[10],"empowered":[11],"by":[12,48],"Reinforcement":[13,72],"Learning":[14,73],"with":[15,74,94],"Verifiable":[16,76],"Rewards":[17,77],"(RLVR).":[18],"Nonetheless,":[19],"RLVR":[20,42],"intrinsically":[21],"relies":[22],"on":[23,50,126],"ground-truth":[24,82],"labels":[25,83],"for":[26,84,133],"reward":[27],"computation,":[28],"the":[29,113,121,138,164],"acquisition":[30,146],"of":[31,88,168],"which":[32,79,136],"is":[33,173],"often":[34,62],"prohibitively":[35],"expensive":[36],"real-world":[38],"scenarios.":[39],"While":[40],"unsupervised":[41],"paradigms":[43],"attempt":[44],"to":[45,56,148],"circumvent":[46],"this":[47,68],"training":[49,57,98,151],"pseudo-labels,":[51,95],"they":[52],"are":[53],"notoriously":[54],"susceptible":[55],"collapse.":[58],"Moreover,":[59],"different":[60],"samples":[61,90],"exhibit":[63],"varying":[64],"annotation":[65,105],"values.":[66],"In":[67],"paper,":[69],"we":[70,111,128],"propose":[71,112],"Active":[75],"(RLAVR),":[78],"actively":[80],"acquires":[81],"a":[85,143],"small":[86],"set":[87],"selected":[89],"and":[91,100,119,160,166],"integrates":[92],"them":[93],"thereby":[96],"stabilizing":[97],"dynamics":[99],"improving":[101],"performance":[102],"under":[103],"limited":[104],"budgets.":[106],"To":[107],"identify":[108],"valuable":[109],"samples,":[110],"Corrective":[114],"Advantage":[115],"Gap":[116],"(CAG)":[117],"metric":[118],"analyze":[120],"sample-level":[122],"supervision":[123],"value.":[124],"Building":[125],"this,":[127],"introduce":[129],"Correction-Aware":[130],"Reliability":[131],"Estimation":[132],"RLAVR":[134],"(CARE),":[135],"translates":[137],"oracle":[139],"CAG":[140],"criterion":[141],"into":[142],"practical":[144],"pre-query":[145],"policy":[147],"substantially":[149],"improve":[150],"stability.":[152],"Extensive":[153],"experiments":[154],"across":[155],"diverse":[156],"domains,":[157],"model":[158,161],"families,":[159],"scales":[162],"demonstrate":[163],"effectiveness":[165],"generality":[167],"our":[169],"approach.":[170],"Our":[171],"code":[172],"available":[174],"at":[175],"https://github.com/Lumina04/CARE.":[176]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-27T00:00:00"}
