{"id":"https://openalex.org/W7166868019","doi":"https://doi.org/10.18653/v1/2026.findings-acl.1871","title":"MTP-RL: Acceleration of Reinforcement Learning Rollouts with Policy-Aligned Multi-Token Prediction","display_name":"MTP-RL: Acceleration of Reinforcement Learning Rollouts with Policy-Aligned Multi-Token Prediction","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166868019","doi":"https://doi.org/10.18653/v1/2026.findings-acl.1871"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.findings-acl.1871","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.1871","pdf_url":"https://aclanthology.org/2026.findings-acl.1871.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.findings-acl.1871.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139846325","display_name":"Ke Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ke Wang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139773368","display_name":"Aohan Zeng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Aohan Zeng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5018336656","display_name":"Zhengxiao Du","orcid":"https://orcid.org/0000-0002-8223-4147"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhengxiao Du","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139839257","display_name":"Yuxuan Hu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yuxuan Hu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139804275","display_name":"Bohan Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bohan Zhang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139785371","display_name":"Xinyi Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xinyi Wang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139767959","display_name":"Jie Tang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jie Tang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139762084","display_name":"Zhang Jing","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jing Zhang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.85687307,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"37530","last_page":"37542"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8210999965667725,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8210999965667725,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.019200000911951065,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.01810000091791153,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/acceleration","display_name":"Acceleration","score":0.5597000122070312},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.49959999322891235},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.37380000948905945},{"id":"https://openalex.org/keywords/control-theory","display_name":"Control theory (sociology)","score":0.32269999384880066},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.2962999939918518},{"id":"https://openalex.org/keywords/noise","display_name":"Noise (video)","score":0.29190000891685486}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5698000192642212},{"id":"https://openalex.org/C117896860","wikidata":"https://www.wikidata.org/wiki/Q11376","display_name":"Acceleration","level":2,"score":0.5597000122070312},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.49959999322891235},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.37380000948905945},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3580000102519989},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.32269999384880066},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.2962999939918518},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.29190000891685486},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.2896000146865845},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.275299996137619},{"id":"https://openalex.org/C44154836","wikidata":"https://www.wikidata.org/wiki/Q45045","display_name":"Simulation","level":1,"score":0.25540000200271606},{"id":"https://openalex.org/C107551265","wikidata":"https://www.wikidata.org/wiki/Q1458245","display_name":"Displacement (psychology)","level":2,"score":0.2547999918460846}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.findings-acl.1871","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.1871","pdf_url":"https://aclanthology.org/2026.findings-acl.1871.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.findings-acl.1871","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.1871","pdf_url":"https://aclanthology.org/2026.findings-acl.1871.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[{"id":"https://openalex.org/G1910011397","display_name":null,"funder_award_id":"U23A20299","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"},{"id":"https://openalex.org/G2079473452","display_name":null,"funder_award_id":"U24B20144","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"},{"id":"https://openalex.org/G3972953005","display_name":null,"funder_award_id":"62322214","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"}],"funders":[{"id":"https://openalex.org/F4320321001","display_name":"National Natural Science Foundation of China","ror":"https://ror.org/01h0zpd94"}],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166868019.pdf","grobid_xml":"https://content.openalex.org/works/W7166868019.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1],"(RL)":[2],"is":[3,17,38],"widely":[4],"applied":[5],"to":[6,90,106,140],"boost":[7],"the":[8,41,50,54,81,92],"performance":[9],"of":[10,43,53,75,110,121],"pretrained":[11,47],"models,":[12],"yet":[13],"its":[14,35],"training":[15,74,109],"efficiency":[16],"severely":[18],"constrained":[19],"by":[20,40],"rollout":[21,82,137],"generation.While":[22],"speculative":[23],"decoding":[24],"based":[25],"on":[26],"multi-token":[27],"prediction":[28],"(MTP)":[29],"offers":[30],"a":[31,68,88],"potential":[32],"acceleration":[33],"pathway,":[34],"widespread":[36],"adoption":[37],"hindered":[39],"absence":[42],"MTP":[44,55,95,103],"in":[45,58,77,136],"vanilla":[46],"models":[48,98],"and":[49,79,99],"rapid":[51],"degradation":[52],"acceptance":[56,122],"length":[57,123],"RL":[59,78,125,130],"training.To":[60],"address":[61],"these":[62],"issues,":[63],"this":[64],"paper":[65],"proposes":[66],"MTP-RL,":[67],"two-stage":[69],"framework":[70],"that":[71,113],"pioneers":[72],"effective":[73],"MTPs":[76],"accelerates":[80,129],"phase":[83],"for":[84,96],"diverse":[85],"models.It":[86],"involves":[87],"pipeline":[89],"equip":[91],"multi-layer":[93],"parametersharing":[94],"all":[97],"an":[100,133],"innovative":[101],"advantage-aware":[102],"optimization":[104],"strategy":[105],"facilitate":[107],"policy-aligned":[108],"MTPs.Experiments":[111],"demonstrate":[112],"our":[114],"method":[115],"not":[116],"only":[117],"achieves":[118],"stable":[119],"growth":[120],"during":[124],"training,":[126],"but":[127],"also":[128],"rollouts,":[131],"achieving":[132],"average":[134],"23.1%-55.3%reduction":[135],"time":[138],"compared":[139],"baselines.":[141]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-07-02T00:00:00"}
