{"id":"https://openalex.org/W7166830543","doi":"https://doi.org/10.18653/v1/2026.findings-acl.206","title":"Entropy Scheduling in Reinforcement Learning for Large Language Models","display_name":"Entropy Scheduling in Reinforcement Learning for Large Language Models","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166830543","doi":"https://doi.org/10.18653/v1/2026.findings-acl.206"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.findings-acl.206","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.206","pdf_url":"https://aclanthology.org/2026.findings-acl.206.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.findings-acl.206.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5104214923","display_name":"Xingjin Wang","orcid":null},"institutions":[{"id":"https://openalex.org/I4210094879","display_name":"Shandong Institute of Automation","ror":"https://ror.org/00qdtba35","country_code":"CN","type":"facility","lineage":["https://openalex.org/I4210094879","https://openalex.org/I4210142748"]},{"id":"https://openalex.org/I4210100255","display_name":"Beijing Academy of Artificial Intelligence","ror":"https://ror.org/016a74861","country_code":"CN","type":"other","lineage":["https://openalex.org/I4210100255"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Xingjin Wang","raw_affiliation_strings":["School of Artificial Intelligence , University of Chinese Academy of Sciences , Beijing , China","State Key Laboratory of Multimodal Artificial Intelligence Systems , Institute of Automation , Chinese Academy of Sciences , Beijing , China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"School of Artificial Intelligence , University of Chinese Academy of Sciences , Beijing , China","institution_ids":["https://openalex.org/I4210100255"]},{"raw_affiliation_string":"State Key Laboratory of Multimodal Artificial Intelligence Systems , Institute of Automation , Chinese Academy of Sciences , Beijing , China","institution_ids":["https://openalex.org/I4210094879","https://openalex.org/I4210100255"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5120814457","display_name":"Howe Tissue","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Howe Tissue","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139784071","display_name":"Lu Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lu Wang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139725633","display_name":"Linjing Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Linjing Li","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139739865","display_name":"Daniel Dajun Zeng","orcid":null},"institutions":[{"id":"https://openalex.org/I4210094879","display_name":"Shandong Institute of Automation","ror":"https://ror.org/00qdtba35","country_code":"CN","type":"facility","lineage":["https://openalex.org/I4210094879","https://openalex.org/I4210142748"]},{"id":"https://openalex.org/I4210100255","display_name":"Beijing Academy of Artificial Intelligence","ror":"https://ror.org/016a74861","country_code":"CN","type":"other","lineage":["https://openalex.org/I4210100255"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Daniel Dajun Zeng","raw_affiliation_strings":["School of Artificial Intelligence , University of Chinese Academy of Sciences , Beijing , China","State Key Laboratory of Multimodal Artificial Intelligence Systems , Institute of Automation , Chinese Academy of Sciences , Beijing , China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"School of Artificial Intelligence , University of Chinese Academy of Sciences , Beijing , China","institution_ids":["https://openalex.org/I4210100255"]},{"raw_affiliation_string":"State Key Laboratory of Multimodal Artificial Intelligence Systems , Institute of Automation , Chinese Academy of Sciences , Beijing , China","institution_ids":["https://openalex.org/I4210094879","https://openalex.org/I4210100255"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.79297136,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"4239","last_page":"4251"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.2971999943256378,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.2971999943256378,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10181","display_name":"Natural Language Processing Techniques","score":0.11599999666213989,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12072","display_name":"Machine Learning and Algorithms","score":0.07810000330209732,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5565000176429749},{"id":"https://openalex.org/keywords/entropy","display_name":"Entropy (arrow of time)","score":0.46459999680519104},{"id":"https://openalex.org/keywords/scheduling","display_name":"Scheduling (production processes)","score":0.38530001044273376},{"id":"https://openalex.org/keywords/principle-of-maximum-entropy","display_name":"Principle of maximum entropy","score":0.30489999055862427},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.2957000136375427}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6556000113487244},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5565000176429749},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.534500002861023},{"id":"https://openalex.org/C106301342","wikidata":"https://www.wikidata.org/wiki/Q4117933","display_name":"Entropy (arrow of time)","level":2,"score":0.46459999680519104},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4117000102996826},{"id":"https://openalex.org/C206729178","wikidata":"https://www.wikidata.org/wiki/Q2271896","display_name":"Scheduling (production processes)","level":2,"score":0.38530001044273376},{"id":"https://openalex.org/C9679016","wikidata":"https://www.wikidata.org/wiki/Q1417473","display_name":"Principle of maximum entropy","level":2,"score":0.30489999055862427},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.2957000136375427},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.2809000015258789},{"id":"https://openalex.org/C55416958","wikidata":"https://www.wikidata.org/wiki/Q6206757","display_name":"Job shop scheduling","level":3,"score":0.259799987077713},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.2535000145435333}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.findings-acl.206","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.206","pdf_url":"https://aclanthology.org/2026.findings-acl.206.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.findings-acl.206","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.206","pdf_url":"https://aclanthology.org/2026.findings-acl.206.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[{"id":"https://openalex.org/G8128459683","display_name":null,"funder_award_id":"XDA0480301","funder_id":"https://openalex.org/F4320321133","funder_display_name":"Chinese Academy of Sciences"}],"funders":[{"id":"https://openalex.org/F4320321133","display_name":"Chinese Academy of Sciences","ror":"https://ror.org/034t30j35"}],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166830543.pdf","grobid_xml":"https://content.openalex.org/works/W7166830543.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"We":[0],"observe":[1],"that":[2,46,96,137,150],"entropy":[3,31,35,87,99,105,112,115,134,138],"in":[4,13,19,80,101,146],"reinforcement":[5],"learning":[6,11,67,119,122],"functions":[7],"analogously":[8],"to":[9,66,127,142],"the":[10,92],"rate":[12,68],"LLMs.Maintaining":[14],"stable":[15,98,155],"entropy,":[16],"as":[17],"demonstrated":[18],"DAPO":[20],"(Yu":[21],"et":[22],"al.,":[23],"2025),":[24],"helps":[25],"stabilize":[26],"RL":[27,93],"training,":[28],"while":[29],"rapid":[30],"annealing":[32,106],"(i.e.,":[33],"so-called":[34],"collapse)":[36],"accelerates":[37],"local":[38],"performance":[39,130,156],"improvement":[40],"and":[41,58,85,113,144,154,161],"enables":[42],"faster":[43],"convergence.We":[44],"argue":[45],"these":[47],"two":[48],"processes":[49],"are":[50],"not":[51],"antithetical,":[52],"but":[53],"can":[54,123],"be":[55,124],"effectively":[56],"controlled":[57],"scheduled":[59],"within":[60],"a":[61],"single":[62],"training":[63,102],"run,":[64],"similar":[65],"scheduling.We":[69],"propose":[70],"Entropy":[71],"Schduling":[72],"(ES),":[73],"which":[74],"optimizes":[75],"different":[76,118,133],"pre-set":[77],"goals":[78],"(e.g.k":[79],"optimizing":[81],"Pass@k)":[82],"by":[83,104],"controlling":[84],"scheduling":[86,139],"at":[88],"each":[89],"step":[90],"of":[91],"process.We":[94],"find":[95],"maintaining":[97],"early":[100],"followed":[103],"achieves":[107],"superior":[108],"performance.Moreover,":[109],"since":[110],"stable-state":[111],"annealed":[114],"exhibit":[116],"distinctly":[117],"dynamics,":[120],"curriculum":[121],"seamlessly":[125],"integrated":[126],"maximize":[128],"model":[129],"based":[131],"on":[132],"phases.We":[135],"show":[136],"is":[140],"straightforward":[141],"implement":[143],"intuitive":[145],"design.Extensive":[147],"experiments":[148],"suggest":[149],"it":[151],"delivers":[152],"consistent":[153],"improvements":[157],"across":[158],"diverse":[159],"models":[160],"algorithms.":[162]},"counts_by_year":[],"updated_date":"2026-08-26T07:47:46.906454","created_date":"2026-07-02T00:00:00"}
