{"id":"https://openalex.org/W7166869162","doi":"https://doi.org/10.18653/v1/2026.findings-acl.895","title":"Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning","display_name":"Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166869162","doi":"https://doi.org/10.18653/v1/2026.findings-acl.895"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.findings-acl.895","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.895","pdf_url":"https://aclanthology.org/2026.findings-acl.895.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.findings-acl.895.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139844118","display_name":"Xiaoyun Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xiaoyun Zhang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139748622","display_name":"Xiaojian Yuan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xiaojian Yuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139836644","display_name":"Di Huang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Di Huang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139737046","display_name":"Wang You","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang You","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139761432","display_name":"Chen Hu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen Hu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5076546255","display_name":"Jingqing Ruan","orcid":"https://orcid.org/0000-0002-4857-9053"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jingqing Ruan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139741585","display_name":"Kejiang Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kejiang Chen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139770403","display_name":"Xing Hu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xing Hu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.85796361,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"18005","last_page":"18020"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.3188999891281128,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.3188999891281128,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.1177000030875206,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11206","display_name":"Model Reduction and Neural Networks","score":0.07320000231266022,"subfield":{"id":"https://openalex.org/subfields/3109","display_name":"Statistical and Nonlinear Physics"},"field":{"id":"https://openalex.org/fields/31","display_name":"Physics and Astronomy"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/entropy","display_name":"Entropy (arrow of time)","score":0.5748999714851379},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.42570000886917114},{"id":"https://openalex.org/keywords/statistical-learning","display_name":"Statistical learning","score":0.26829999685287476},{"id":"https://openalex.org/keywords/training-set","display_name":"Training set","score":0.2337999939918518}],"concepts":[{"id":"https://openalex.org/C106301342","wikidata":"https://www.wikidata.org/wiki/Q4117933","display_name":"Entropy (arrow of time)","level":2,"score":0.5748999714851379},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.4794999957084656},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4537999927997589},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.42570000886917114},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.41589999198913574},{"id":"https://openalex.org/C2982736386","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Statistical learning","level":2,"score":0.26829999685287476},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.2680000066757202},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.24740000069141388},{"id":"https://openalex.org/C28826006","wikidata":"https://www.wikidata.org/wiki/Q33521","display_name":"Applied mathematics","level":1,"score":0.24160000681877136},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.2337999939918518}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.findings-acl.895","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.895","pdf_url":"https://aclanthology.org/2026.findings-acl.895.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.findings-acl.895","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.895","pdf_url":"https://aclanthology.org/2026.findings-acl.895.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166869162.pdf","grobid_xml":"https://content.openalex.org/works/W7166869162.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reasoning":[0],"ability":[1],"has":[2,82],"become":[3],"a":[4,21,50,111],"defining":[5],"capability":[6],"of":[7,91],"Large":[8],"Language":[9],"Models":[10],"(LLMs),":[11],"with":[12,15],"Reinforcement":[13],"Learning":[14],"Verifiable":[16],"Rewards":[17],"(RLVR)":[18],"emerging":[19],"as":[20],"key":[22],"paradigm":[23],"to":[24,58,107],"enhance":[25],"it.However,":[26],"RLVR":[27,76],"training":[28],"often":[29],"suffers":[30],"from":[31],"policy":[32,37,105],"entropy":[33,47,73,106],"collapse,":[34],"where":[35],"the":[36,59,104],"becomes":[38],"overly":[39],"deterministic,":[40],"hindering":[41],"exploration":[42,96,101,129,162],"and":[43,67,77,98,130,141,161],"limiting":[44],"reasoning":[45,149,159],"performance.While":[46],"regularization":[48,74],"is":[49,55],"common":[51],"remedy,":[52],"its":[53,80,115],"effectiveness":[54],"highly":[56],"sensitive":[57],"fixed":[60],"coefficient,":[61],"making":[62],"it":[63],"unstable":[64],"across":[65],"tasks":[66,90],"models.In":[68],"this":[69],"work,":[70],"we":[71,118],"revisit":[72],"in":[75],"argue":[78],"that":[79,88,126,152],"potential":[81],"been":[83],"largely":[84],"underestimated.Our":[85],"analysis":[86],"shows":[87],"(i)":[89],"varying":[92],"difficulty":[93],"demand":[94],"distinct":[95],"intensities,":[97],"(ii)":[99],"balanced":[100],"may":[102],"require":[103],"be":[108],"maintained":[109],"within":[110],"moderate":[112],"range":[113],"below":[114],"initial":[116],"level.Therefore,":[117],"propose":[119],"Adaptive":[120],"Entropy":[121],"Regularization":[122],"(AER)":[123],"-a":[124],"framework":[125],"dynamically":[127],"balances":[128],"exploitation":[131],"via":[132],"three":[133],"components:":[134],"difficulty-aware":[135],"coefficient":[136,144],"allocation,":[137],"initial-anchored":[138],"target":[139],"entropy,":[140],"dynamic":[142],"global":[143],"adjustment.Experiments":[145],"on":[146],"multiple":[147],"mathematical":[148],"benchmarks":[150],"show":[151],"AER":[153],"consistently":[154],"outperforms":[155],"baselines,":[156],"improving":[157],"both":[158],"accuracy":[160],"capability.":[163]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-07-02T00:00:00"}
