{"id":"https://openalex.org/W7126155589","doi":"https://doi.org/10.48550/arxiv.2601.21418","title":"Mitigating Overthinking in Large Reasoning Models via Difficulty-aware Reinforcement Learning","display_name":"Mitigating Overthinking in Large Reasoning Models via Difficulty-aware Reinforcement Learning","publication_year":2026,"publication_date":"2026-01-29","ids":{"openalex":"https://openalex.org/W7126155589","doi":"https://doi.org/10.48550/arxiv.2601.21418"},"language":null,"primary_location":{"id":"pmh:doi:10.48550/arxiv.2601.21418","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"publisher-specific-oa","license_id":"https://openalex.org/licenses/publisher-specific-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"type":"article","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":null,"any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5124303587","display_name":"Qian Wan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wan, Qian","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5124435070","display_name":"Ziao Xu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xu, Ziao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5124424151","display_name":"Luona Wei","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wei, Luona","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5074111945","display_name":"Xiaoxuan Shen","orcid":"https://orcid.org/0000-0002-6663-5821"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shen, Xiaoxuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5102741370","display_name":"Jianwen Sun","orcid":"https://orcid.org/0000-0001-8648-527X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sun, Jianwen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.10651171,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.26350000500679016,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.26350000500679016,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.06120000034570694,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10883","display_name":"Ethics and Social Impacts of AI","score":0.048700001090765,"subfield":{"id":"https://openalex.org/subfields/3311","display_name":"Safety Research"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7540000081062317},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.6470999717712402},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.5547000169754028},{"id":"https://openalex.org/keywords/perspective","display_name":"Perspective (graphical)","score":0.5521000027656555},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.551800012588501},{"id":"https://openalex.org/keywords/inefficiency","display_name":"Inefficiency","score":0.39070001244544983},{"id":"https://openalex.org/keywords/opportunistic-reasoning","display_name":"Opportunistic reasoning","score":0.37929999828338623}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7540000081062317},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7455000281333923},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.6470999717712402},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5942000150680542},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.5547000169754028},{"id":"https://openalex.org/C12713177","wikidata":"https://www.wikidata.org/wiki/Q1900281","display_name":"Perspective (graphical)","level":2,"score":0.5521000027656555},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.551800012588501},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.39559999108314514},{"id":"https://openalex.org/C2778869765","wikidata":"https://www.wikidata.org/wiki/Q6028363","display_name":"Inefficiency","level":2,"score":0.39070001244544983},{"id":"https://openalex.org/C86827895","wikidata":"https://www.wikidata.org/wiki/Q7098582","display_name":"Opportunistic reasoning","level":4,"score":0.37929999828338623},{"id":"https://openalex.org/C2780586882","wikidata":"https://www.wikidata.org/wiki/Q7520643","display_name":"Simple (philosophy)","level":2,"score":0.3452000021934509},{"id":"https://openalex.org/C206345919","wikidata":"https://www.wikidata.org/wiki/Q20380951","display_name":"Resource (disambiguation)","level":2,"score":0.3382999897003174},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.31610000133514404},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.2825999855995178},{"id":"https://openalex.org/C2781249084","wikidata":"https://www.wikidata.org/wiki/Q908656","display_name":"Preference","level":2,"score":0.2809000015258789},{"id":"https://openalex.org/C48677424","wikidata":"https://www.wikidata.org/wiki/Q6888088","display_name":"Mode (computer interface)","level":2,"score":0.2734000086784363},{"id":"https://openalex.org/C83725634","wikidata":"https://www.wikidata.org/wiki/Q7268699","display_name":"Qualitative reasoning","level":2,"score":0.26260000467300415},{"id":"https://openalex.org/C115086926","wikidata":"https://www.wikidata.org/wiki/Q17004651","display_name":"Causal reasoning","level":3,"score":0.25200000405311584}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:doi:10.48550/arxiv.2601.21418","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"publisher-specific-oa","license_id":"https://openalex.org/licenses/publisher-specific-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},{"id":"doi:10.48550/arxiv.2601.21418","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2601.21418","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:doi:10.48550/arxiv.2601.21418","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"publisher-specific-oa","license_id":"https://openalex.org/licenses/publisher-specific-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Large":[0],"Reasoning":[1],"Models":[2],"(LRMs)":[3],"achieve":[4],"explicit":[5],"chain-of-thought":[6],"expansion":[7],"by":[8,49,126],"imitating":[9],"deep":[10],"thinking":[11],"behaviors":[12],"of":[13,64,75],"humans,":[14],"demonstrating":[15],"excellent":[16],"performance":[17,167,190],"in":[18],"complex":[19],"task":[20,76,111,148],"scenarios.":[21],"However,":[22],"the":[23,45,50,62,73,122,141,177],"deep-thinking":[24],"mode":[25],"often":[26],"leads":[27],"to":[28,58,85,108,120,179,192],"unnecessarily":[29],"lengthy":[30,162],"reasoning":[31,88,163,166],"and":[32,113,146,168],"resource":[33],"inefficiency":[34],"when":[35],"handling":[36],"simple":[37],"tasks.":[38],"This":[39],"overthinking":[40,60],"phenomenon":[41],"may":[42],"arise":[43],"from":[44,61],"generation":[46,123],"preference":[47],"triggered":[48],"reward":[51,155],"function":[52,156],"during":[53],"post-training.":[54,127],"Existing":[55],"research":[56],"attempts":[57],"mitigate":[59],"perspective":[63],"prompt":[65],"design":[66],"or":[67],"model":[68,110,134,178],"training,":[69],"but":[70],"generally":[71],"underestimates":[72],"importance":[74],"difficulty":[77,129],"awareness,":[78],"which":[79,138],"makes":[80],"it":[81],"difficult":[82],"for":[83,161],"LRMs":[84],"effectively":[86],"allocate":[87],"resources.":[89],"In":[90],"this":[91],"paper,":[92],"we":[93],"propose":[94],"Difficulty-aware":[95],"Policy":[96],"Optimization":[97],"(DiPO),":[98],"a":[99,153,159],"reinforcement":[100,117],"learning-based":[101],"LRM":[102,107],"training":[103],"framework.":[104],"DiPO":[105,175],"encourages":[106],"spontaneously":[109,180],"complexity,":[112],"integrates":[114],"them":[115],"into":[116],"learning":[118],"framework":[119],"adjust":[121,181],"preferences":[124],"introduced":[125],"A":[128],"modeling":[130],"method":[131],"based":[132],"on":[133,143],"self-reasoning":[135],"is":[136],"proposed,":[137],"significantly":[139,184],"reduces":[140],"dependence":[142],"manual":[144],"annotation":[145],"formalize":[147],"complexity.":[149],"We":[150],"further":[151],"develop":[152],"difficulty-signal-enhanced":[154],"that":[157,174],"incorporates":[158],"penalty":[160],"while":[164],"considering":[165],"output":[169],"format.":[170],"Experimental":[171],"results":[172],"indicate":[173],"enables":[176],"inference":[182],"overhead,":[183],"reducing":[185],"redundant":[186],"tokens":[187],"without":[188],"losing":[189],"due":[191],"thought":[193],"compression.":[194]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-02-01T00:00:00"}
