{"id":"https://openalex.org/W7165043912","doi":"https://doi.org/10.48550/arxiv.2606.17735","title":"Shattering the Autoregressive Curse: Dynamic Epistemic Entropy Orchestrated Erasable Reinforcement Learning for LLMs","display_name":"Shattering the Autoregressive Curse: Dynamic Epistemic Entropy Orchestrated Erasable Reinforcement Learning for LLMs","publication_year":2026,"publication_date":"2026-06-16","ids":{"openalex":"https://openalex.org/W7165043912","doi":"https://doi.org/10.48550/arxiv.2606.17735"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.17735","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.17735","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.17735","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5138807818","display_name":"Ziliang Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Ziliang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138825725","display_name":"Kang An","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"An, Kang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134166915","display_name":"Faqiang Qian","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Qian, Faqiang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137634310","display_name":"Jialu Cai","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cai, Jialu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5119753292","display_name":"Cijun Ouyang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ouyang, Cijun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138790126","display_name":"Yuhang Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Yuhang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138803988","display_name":"Qibing Ren","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ren, Qibing","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5138811613","display_name":"Yichao Wu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wu, Yichao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.3749000132083893,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.3749000132083893,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.1818999946117401,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10181","display_name":"Natural Language Processing Techniques","score":0.07460000365972519,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6172999739646912},{"id":"https://openalex.org/keywords/autoregressive-model","display_name":"Autoregressive model","score":0.5040000081062317},{"id":"https://openalex.org/keywords/entropy","display_name":"Entropy (arrow of time)","score":0.4519999921321869},{"id":"https://openalex.org/keywords/curse-of-dimensionality","display_name":"Curse of dimensionality","score":0.3662000000476837},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.33219999074935913},{"id":"https://openalex.org/keywords/debiasing","display_name":"Debiasing","score":0.30979999899864197},{"id":"https://openalex.org/keywords/leverage","display_name":"Leverage (statistics)","score":0.3057999908924103}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6172999739646912},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5559999942779541},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5108000040054321},{"id":"https://openalex.org/C159877910","wikidata":"https://www.wikidata.org/wiki/Q2202883","display_name":"Autoregressive model","level":2,"score":0.5040000081062317},{"id":"https://openalex.org/C106301342","wikidata":"https://www.wikidata.org/wiki/Q4117933","display_name":"Entropy (arrow of time)","level":2,"score":0.4519999921321869},{"id":"https://openalex.org/C111030470","wikidata":"https://www.wikidata.org/wiki/Q1430460","display_name":"Curse of dimensionality","level":2,"score":0.3662000000476837},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.33219999074935913},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3140000104904175},{"id":"https://openalex.org/C2779458634","wikidata":"https://www.wikidata.org/wiki/Q24963715","display_name":"Debiasing","level":2,"score":0.30979999899864197},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.3057999908924103},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.30239999294281006},{"id":"https://openalex.org/C2778023277","wikidata":"https://www.wikidata.org/wiki/Q321703","display_name":"Premise","level":2,"score":0.2985999882221222},{"id":"https://openalex.org/C43971567","wikidata":"https://www.wikidata.org/wiki/Q3142865","display_name":"Logical reasoning","level":2,"score":0.28119999170303345},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.2808000147342682},{"id":"https://openalex.org/C9679016","wikidata":"https://www.wikidata.org/wiki/Q1417473","display_name":"Principle of maximum entropy","level":2,"score":0.2759999930858612},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.266400009393692},{"id":"https://openalex.org/C194657046","wikidata":"https://www.wikidata.org/wiki/Q7394685","display_name":"STAR model","level":4,"score":0.2612000107765198},{"id":"https://openalex.org/C610760","wikidata":"https://www.wikidata.org/wiki/Q1340706","display_name":"Endogeneity","level":2,"score":0.2578999996185303}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.17735","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.17735","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.17735","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.17735","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.6163977980613708,"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Although":[0],"reinforcement":[1,76],"learning":[2,77],"(RL)":[3],"has":[4],"expanded":[5],"the":[6,19,37,47,87,111,128,139,148,176,198,212],"cognitive":[7],"boundaries":[8],"of":[9,97,151,215],"large":[10],"language":[11],"models":[12,181],"(LLMs),":[13],"it":[14],"often":[15],"remains":[16],"vulnerable":[17],"to":[18,113],"autoregressive":[20,55,91,199],"curse":[21,200],"in":[22,31,57,201],"long-horizon":[23],"logical":[24,117],"reasoning:":[25],"small":[26],"epistemic":[27,72,98],"perturbations":[28],"introduced":[29],"early":[30,61],"generation":[32,214],"can":[33,63],"propagate":[34],"irreversibly":[35],"along":[36],"Markov":[38],"decision":[39],"process":[40,130],"flow,":[41],"triggering":[42],"cascading":[43],"failures":[44],"that":[45,145,195],"drive":[46],"reasoning":[48,67,129,153,165,203],"trajectory":[49],"toward":[50],"collapse.":[51],"To":[52],"overcome":[53],"this":[54],"cascade,":[56],"which":[58],"a":[59,132,206],"single":[60],"mistake":[62],"compromise":[64],"all":[65],"subsequent":[66],"steps,":[68],"we":[69],"propose":[70],"dynamic":[71,104],"entropy":[73],"orchestrated":[74],"erasable":[75],"($\\text{E}^3\\text{RL}$).":[78],"$\\text{E}^3\\text{RL}$":[79,109,137,146,170,196],"eliminates":[80],"reliance":[81],"on":[82,138],"external":[83],"signals":[84],"by":[85,187],"grounding":[86],"model's":[88],"endogenous":[89],"local":[90],"cross-entropy":[92],"as":[93,168],"an":[94],"intrinsic":[95],"coordinate":[96],"uncertainty.":[99],"By":[100],"introducing":[101],"segment-level":[102],"adaptive":[103],"thresholds":[105],"and":[106,154,178,189,204,208],"advantage":[107],"allocation,":[108],"enables":[110],"model":[112],"precisely":[114],"excise":[115],"localized":[116],"defects":[118],"while":[119,158],"reusing":[120],"historical":[121],"key-value":[122],"(KV)":[123],"cache":[124],"streams,":[125],"thereby":[126],"endowing":[127],"with":[131,175],"self-healing":[133,216],"capability.":[134],"We":[135],"train":[136],"DeepMath-103k":[140],"dataset.":[141],"Experimental":[142],"results":[143,186],"show":[144],"reshapes":[147],"exploration":[149],"efficiency":[150,157],"long-sequence":[152,202],"improves":[155],"sample":[156],"maintaining":[159],"linear":[160],"memory":[161],"overhead.":[162],"On":[163],"mathematical":[164],"benchmarks":[166],"such":[167],"AIME,":[169],"achieves":[171],"substantial":[172],"performance":[173],"gains,":[174],"4B":[177],"8B":[179],"parameter":[180],"surpassing":[182],"previous":[183],"state-of-the-art":[184],"(SOTA)":[185],"5.349\\%":[188],"6.514\\%,":[190],"respectively.":[191],"These":[192],"findings":[193],"suggest":[194],"shatters":[197],"establishes":[205],"theoretical":[207],"systems-level":[209],"foundation":[210],"for":[211],"next":[213],"artificial":[217],"general":[218],"intelligence":[219],"(AGI).":[220]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-06-18T00:00:00"}
