{"id":"https://openalex.org/W7166890661","doi":"https://doi.org/10.18653/v1/2026.acl-long.129","title":"LEASH: Adaptive Length Penalty and Reward Shaping for Efficient Large Reasoning Model","display_name":"LEASH: Adaptive Length Penalty and Reward Shaping for Efficient Large Reasoning Model","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166890661","doi":"https://doi.org/10.18653/v1/2026.acl-long.129"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.acl-long.129","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.129","pdf_url":"https://aclanthology.org/2026.acl-long.129.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.acl-long.129.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139758882","display_name":"Yanhao Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yanhao Li","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139732814","display_name":"Lu Ma","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lu Ma","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5087838116","display_name":"Jiaran Zhang","orcid":"https://orcid.org/0000-0003-1160-9770"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jiaran Zhang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139745203","display_name":"Lexiang Tang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lexiang Tang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139787093","display_name":"Wentao Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wentao Zhang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139829198","display_name":"Guibo Luo","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Guibo Luo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.8786839,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"2846","last_page":"2856"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.09440000355243683,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.09440000355243683,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.09139999747276306,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.08079999685287476,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.2840999960899353},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.2687000036239624},{"id":"https://openalex.org/keywords/constraint","display_name":"Constraint (computer-aided design)","score":0.2655999958515167},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.25929999351501465},{"id":"https://openalex.org/keywords/adaptive-control","display_name":"Adaptive control","score":0.2451999932527542}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5953999757766724},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.42260000109672546},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.2840999960899353},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.27730000019073486},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2687000036239624},{"id":"https://openalex.org/C2776036281","wikidata":"https://www.wikidata.org/wiki/Q48769818","display_name":"Constraint (computer-aided design)","level":2,"score":0.2655999958515167},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.26019999384880066},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.25929999351501465},{"id":"https://openalex.org/C107464732","wikidata":"https://www.wikidata.org/wiki/Q235781","display_name":"Adaptive control","level":3,"score":0.2451999932527542},{"id":"https://openalex.org/C2779343474","wikidata":"https://www.wikidata.org/wiki/Q3109175","display_name":"Context (archaeology)","level":2,"score":0.2425999939441681}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.acl-long.129","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.129","pdf_url":"https://aclanthology.org/2026.acl-long.129.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.acl-long.129","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.129","pdf_url":"https://aclanthology.org/2026.acl-long.129.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[{"id":"https://openalex.org/G2236135741","display_name":null,"funder_award_id":"2024YFE0203100","funder_id":"https://openalex.org/F4320335777","funder_display_name":"National Key Research and Development Program of China"}],"funders":[{"id":"https://openalex.org/F4320335777","display_name":"National Key Research and Development Program of China","ror":null}],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166890661.pdf","grobid_xml":"https://content.openalex.org/works/W7166890661.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Large":[0],"Language":[1],"Models":[2],"(LLMs)":[3],"often":[4],"produce":[5],"unnecessarily":[6],"lengthy":[7],"reasoning":[8,38,68,114,129,138,167],"traces,":[9],"which":[10],"significantly":[11],"increase":[12],"computational":[13,170],"cost":[14],"and":[15,31,48,59,79,121,139,145,156,162],"latency.Existing":[16],"approaches":[17],"typically":[18],"rely":[19],"on":[20,119],"fixed":[21],"length":[22,72,130],"penalties,":[23],"but":[24],"such":[25,142],"penalties":[26],"are":[27,102],"hard":[28],"to":[29,33,35,43,85],"tune":[30],"fail":[32],"adapt":[34],"the":[36,88,93,96,127],"evolving":[37],"abilities":[39],"of":[40],"LLMs,":[41],"leading":[42],"suboptimal":[44],"trade-offs":[45],"between":[46],"accuracy":[47],"conciseness.To":[49],"address":[50],"this":[51],"challenge,":[52],"we":[53],"propose":[54],"LEASH":[55,125],"(adaptive":[56],"LEngth":[57],"penAlty":[58],"reward":[60],"SHaping),":[61],"a":[62,75,81,154],"reinforcement":[63],"learning":[64],"framework":[65],"for":[66,159],"efficient":[67,163],"in":[69],"LLMs.We":[70],"formulate":[71],"control":[73],"as":[74,143],"constrained":[76],"optimization":[77],"problem":[78],"employ":[80],"Lagrangian":[82],"primal-dual":[83],"method":[84],"dynamically":[86],"adjust":[87],"penalty":[89,97],"coefficient.When":[90],"generations":[91],"exceed":[92],"target":[94],"length,":[95],"is":[98,105,173],"intensified;":[99],"when":[100],"they":[101],"shorter,":[103],"it":[104],"relaxed.This":[106],"adaptive":[107],"mechanism":[108],"guides":[109],"models":[110],"toward":[111],"producing":[112],"concise":[113],"without":[115],"sacrificing":[116],"task":[117],"performance.Experiments":[118],"Deepseek-R1-Distill-Qwen-1.5B":[120],"Qwen3-4B-Thinking-2507":[122],"show":[123],"that":[124,165],"reduces":[126],"average":[128],"by":[131],"60%":[132],"across":[133],"diverse":[134],"tasks-including":[135],"indistribution":[136],"mathematical":[137],"outof-distribution":[140],"domains":[141],"coding":[144],"instruction":[146],"following-while":[147],"maintaining":[148],"competitive":[149],"performance.Our":[150],"work":[151],"thus":[152],"presents":[153],"practical":[155],"effective":[157],"paradigm":[158],"developing":[160],"controllable":[161],"LLMs":[164],"balance":[166],"capabilities":[168],"with":[169],"budgets.Our":[171],"code":[172],"available":[174],"at":[175]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-07-02T00:00:00"}
