{"id":"https://openalex.org/W7165658702","doi":"https://doi.org/10.48550/arxiv.2606.22716","title":"Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards","display_name":"Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards","publication_year":2026,"publication_date":"2026-06-21","ids":{"openalex":"https://openalex.org/W7165658702","doi":"https://doi.org/10.48550/arxiv.2606.22716"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.22716","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.22716","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.22716","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5035555716","display_name":"Jungseob Lee","orcid":"https://orcid.org/0000-0002-9431-6342"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lee, Jungseob","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5033574608","display_name":"Seungyoon Lee","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lee, Seungyoon","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139166120","display_name":"Seongtae Hong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Hong, Seongtae","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139145524","display_name":"Minhyuk Kim","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kim, Minhyuk","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5060151070","display_name":"C W Park","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Park, Chanjun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139188469","display_name":"Heuiseok Lim","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lim, Heuiseok","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.2069000005722046,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.2069000005722046,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.18140000104904175,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.07720000296831131,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/normalization","display_name":"Normalization (sociology)","score":0.6434999704360962},{"id":"https://openalex.org/keywords/security-token","display_name":"Security token","score":0.5480999946594238},{"id":"https://openalex.org/keywords/base","display_name":"Base (topology)","score":0.335999995470047},{"id":"https://openalex.org/keywords/root-cause","display_name":"Root cause","score":0.27730000019073486},{"id":"https://openalex.org/keywords/training","display_name":"Training (meteorology)","score":0.26919999718666077}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6452000141143799},{"id":"https://openalex.org/C136886441","wikidata":"https://www.wikidata.org/wiki/Q926129","display_name":"Normalization (sociology)","level":2,"score":0.6434999704360962},{"id":"https://openalex.org/C48145219","wikidata":"https://www.wikidata.org/wiki/Q1335365","display_name":"Security token","level":2,"score":0.5480999946594238},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.45829999446868896},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.34119999408721924},{"id":"https://openalex.org/C42058472","wikidata":"https://www.wikidata.org/wiki/Q810214","display_name":"Base (topology)","level":2,"score":0.335999995470047},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.32330000400543213},{"id":"https://openalex.org/C84945661","wikidata":"https://www.wikidata.org/wiki/Q7366567","display_name":"Root cause","level":2,"score":0.27730000019073486},{"id":"https://openalex.org/C2777211547","wikidata":"https://www.wikidata.org/wiki/Q17141490","display_name":"Training (meteorology)","level":2,"score":0.26919999718666077},{"id":"https://openalex.org/C171078966","wikidata":"https://www.wikidata.org/wiki/Q111029","display_name":"Root (linguistics)","level":2,"score":0.267300009727478},{"id":"https://openalex.org/C77553402","wikidata":"https://www.wikidata.org/wiki/Q13222579","display_name":"Upper and lower bounds","level":2,"score":0.25780001282691956},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.25450000166893005}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.22716","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.22716","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.22716","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.22716","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Training":[0],"large":[1],"language":[2],"models":[3],"to":[4,22,71,80,92,123,149],"reason":[5],"efficiently":[6],"is":[7],"a":[8,35,93,161],"critical":[9],"challenge.":[10],"While":[11],"integrating":[12],"length-penalizing":[13],"rewards":[14],"into":[15],"Group":[16],"Relative":[17],"Policy":[18],"Optimization":[19],"(GRPO)":[20],"aims":[21],"reduce":[23],"verbosity,":[24],"it":[25],"frequently":[26],"triggers":[27],"reward":[28,40],"collapse,":[29],"severely":[30],"degrading":[31],"reasoning":[32,142],"capabilities.":[33],"Through":[34],"systematic":[36],"evaluation":[37],"of":[38,65],"various":[39],"configurations,":[41],"we":[42,106],"identify":[43],"the":[44,63,89,115,150],"root":[45],"mechanism:":[46],"GRPO's":[47],"group":[48],"normalization":[49,133],"creates":[50],"divergent":[51],"advantages":[52],"when":[53],"incorrect":[54,66],"answers":[55,67,82],"receive":[56],"continuous":[57],"length":[58,64],"penalties.":[59],"Consequently,":[60],"methods":[61],"penalizing":[62],"are":[68],"structurally":[69],"prone":[70],"collapse":[72,95],"under":[73],"sustained":[74],"optimization.":[75,167],"Furthermore,":[76],"restricting":[77],"penalties":[78],"exclusively":[79],"correct":[81,124],"avoids":[83],"this":[84],"primary":[85],"failure,":[86],"but":[87],"leaves":[88],"model":[90,152],"susceptible":[91],"stochastic":[94,128],"driven":[96],"by":[97,119,157],"response":[98],"over-compression.":[99],"To":[100],"robustly":[101],"prevent":[102],"both":[103],"failure":[104],"modes,":[105],"propose":[107],"ACOER":[108,113,144],"(Adaptive":[109],"Correct-Only":[110],"Efficiency":[111],"Reward).":[112],"eliminates":[114],"structural":[116],"penalty":[117,136],"loop":[118],"isolating":[120],"brevity":[121],"bonuses":[122],"completions":[125],"and":[126,134],"prevents":[127],"compression":[129],"via":[130],"dynamic":[131],"budget":[132],"control-loop":[135],"adjustments.":[137],"Evaluated":[138],"across":[139],"diverse":[140],"mathematical":[141],"benchmarks,":[143],"improves":[145],"overall":[146],"accuracy":[147],"compared":[148],"base":[151],"while":[153],"reducing":[154],"token":[155],"generation":[156],"over":[158],"60%,":[159],"establishing":[160],"fundamentally":[162],"stable":[163],"approach":[164],"for":[165],"efficiency-aware":[166]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-24T00:00:00"}
