{"id":"https://openalex.org/W7160862856","doi":"https://doi.org/10.48550/arxiv.2605.06819","title":"A Theory of Online Learning with Autoregressive Chain-of-Thought Reasoning","display_name":"A Theory of Online Learning with Autoregressive Chain-of-Thought Reasoning","publication_year":2026,"publication_date":"2026-05-07","ids":{"openalex":"https://openalex.org/W7160862856","doi":"https://doi.org/10.48550/arxiv.2605.06819"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.06819","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.06819","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.06819","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5135885464","display_name":"Ilan Doron-Arad","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Doron-Arad, Ilan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5018252888","display_name":"Idan Mehalel","orcid":"https://orcid.org/0000-0002-8751-7816"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Mehalel, Idan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5135844880","display_name":"Elchanan Mossel","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Mossel, Elchanan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12072","display_name":"Machine Learning and Algorithms","score":0.929099977016449,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T12072","display_name":"Machine Learning and Algorithms","score":0.929099977016449,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.012600000016391277,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.006500000134110451,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/autoregressive-model","display_name":"Autoregressive model","score":0.6769000291824341},{"id":"https://openalex.org/keywords/logarithm","display_name":"Logarithm","score":0.5778999924659729},{"id":"https://openalex.org/keywords/learnability","display_name":"Learnability","score":0.5163000226020813},{"id":"https://openalex.org/keywords/mistake","display_name":"Mistake","score":0.46889999508857727},{"id":"https://openalex.org/keywords/security-token","display_name":"Security token","score":0.42160001397132874},{"id":"https://openalex.org/keywords/generator","display_name":"Generator (circuit theory)","score":0.4043999910354614},{"id":"https://openalex.org/keywords/upper-and-lower-bounds","display_name":"Upper and lower bounds","score":0.39500001072883606},{"id":"https://openalex.org/keywords/classifier","display_name":"Classifier (UML)","score":0.3763999938964844}],"concepts":[{"id":"https://openalex.org/C159877910","wikidata":"https://www.wikidata.org/wiki/Q2202883","display_name":"Autoregressive model","level":2,"score":0.6769000291824341},{"id":"https://openalex.org/C39927690","wikidata":"https://www.wikidata.org/wiki/Q11197","display_name":"Logarithm","level":2,"score":0.5778999924659729},{"id":"https://openalex.org/C2777723229","wikidata":"https://www.wikidata.org/wiki/Q4367921","display_name":"Learnability","level":2,"score":0.5163000226020813},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.48069998621940613},{"id":"https://openalex.org/C2777179996","wikidata":"https://www.wikidata.org/wiki/Q911222","display_name":"Mistake","level":2,"score":0.46889999508857727},{"id":"https://openalex.org/C48145219","wikidata":"https://www.wikidata.org/wiki/Q1335365","display_name":"Security token","level":2,"score":0.42160001397132874},{"id":"https://openalex.org/C2780992000","wikidata":"https://www.wikidata.org/wiki/Q17016113","display_name":"Generator (circuit theory)","level":3,"score":0.4043999910354614},{"id":"https://openalex.org/C77553402","wikidata":"https://www.wikidata.org/wiki/Q13222579","display_name":"Upper and lower bounds","level":2,"score":0.39500001072883606},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.39419999718666077},{"id":"https://openalex.org/C95623464","wikidata":"https://www.wikidata.org/wiki/Q1096149","display_name":"Classifier (UML)","level":2,"score":0.3763999938964844},{"id":"https://openalex.org/C157486923","wikidata":"https://www.wikidata.org/wiki/Q1376436","display_name":"String (physics)","level":2,"score":0.3610000014305115},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.3425000011920929},{"id":"https://openalex.org/C194657046","wikidata":"https://www.wikidata.org/wiki/Q7394685","display_name":"STAR model","level":4,"score":0.32739999890327454},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.3052000105381012},{"id":"https://openalex.org/C55439883","wikidata":"https://www.wikidata.org/wiki/Q360812","display_name":"Correctness","level":2,"score":0.2930000126361847},{"id":"https://openalex.org/C139907963","wikidata":"https://www.wikidata.org/wiki/Q198740","display_name":"Law of the iterated logarithm","level":3,"score":0.2897999882698059},{"id":"https://openalex.org/C5297727","wikidata":"https://www.wikidata.org/wiki/Q786970","display_name":"Autocorrelation","level":2,"score":0.2809999883174896},{"id":"https://openalex.org/C2777027219","wikidata":"https://www.wikidata.org/wiki/Q1284190","display_name":"Constant (computer programming)","level":2,"score":0.2694999873638153},{"id":"https://openalex.org/C87007009","wikidata":"https://www.wikidata.org/wiki/Q210832","display_name":"Statistical hypothesis testing","level":2,"score":0.2685999870300293},{"id":"https://openalex.org/C2779915298","wikidata":"https://www.wikidata.org/wiki/Q7604400","display_name":"Statistical learning theory","level":3,"score":0.2676999866962433},{"id":"https://openalex.org/C95611797","wikidata":"https://www.wikidata.org/wiki/Q17502105","display_name":"Infimum and supremum","level":2,"score":0.2646999955177307},{"id":"https://openalex.org/C114289077","wikidata":"https://www.wikidata.org/wiki/Q3284399","display_name":"Statistical model","level":2,"score":0.2574000060558319},{"id":"https://openalex.org/C163175372","wikidata":"https://www.wikidata.org/wiki/Q3339222","display_name":"Linear model","level":2,"score":0.25130000710487366}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.06819","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.06819","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.06819","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.06819","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Autoregressive":[0],"generation":[1,145,194,211],"lies":[2],"at":[3],"the":[4,7,18,31,39,46,59,62,79,84,101,107,111,120,123,128,138,144,164,176,193,197,210,233,241,246,271,275],"heart":[5],"of":[6,9,21,61,74,82,98,167,190,204],"mechanism":[8],"large":[10],"language":[11],"models.":[12],"It":[13],"can":[14,155,221],"be":[15],"viewed":[16],"as":[17,45,263,265],"repeated":[19],"application":[20],"a":[22,54,171,187,202,266],"next-token":[23,91],"generator:":[24],"starting":[25],"from":[26,66],"an":[27,71,89],"input":[28],"string":[29],"(prompt),":[30],"generator":[32],"is":[33,43,125,134,230],"applied":[34],"for":[35,57,270],"$M$":[36,116,249],"steps,":[37],"and":[38,148,219,258],"last":[40],"generated":[41,243],"token":[42,113],"taken":[44],"final":[47,85,112],"output.":[48],"[Joshi":[49,285],"et":[50,182,286],"al.,":[51,183,287],"2025]":[52],"proposed":[53],"PAC":[55],"model":[56],"studying":[58],"learnability":[60],"input-output":[63],"maps":[64],"arising":[65],"this":[67,75,157,227],"process.":[68],"We":[69,93,223,251],"develop":[70],"online":[72,165],"analogue":[73],"framework,":[76],"focusing":[77],"on":[78,143,192,248],"mistake":[80,140,261],"bound":[81,141,269],"learning":[83,169],"output":[86],"induced":[87],"by":[88,180,284],"unknown":[90],"generator.":[92],"distinguish":[94],"between":[95,217],"two":[96],"forms":[97],"feedback.":[99],"In":[100,119,196,232],"End-to-End":[102,198],"model,":[103,122,199,235],"after":[104,115],"each":[105],"round":[106],"learner":[108,124],"observes":[109],"only":[110],"produced":[114],"autoregressive":[117,168,254],"steps.":[118],"Chain-of-Thought":[121,234],"additionally":[126],"shown":[127],"entire":[129],"$M$-step":[130],"trajectory.":[131],"Our":[132,159],"goal":[133],"to":[135,149,175,240],"understand":[136],"how":[137],"optimal":[139,260],"depends":[142],"horizon":[146,212],"$M$,":[147],"what":[150],"extent":[151],"observing":[152],"intermediate":[153],"tokens":[154],"reduce":[156],"dependence.":[158],"main":[160],"results":[161,278],"show":[162,225,237],"that":[163,226,238],"theory":[166],"exhibits":[170],"qualitative":[172],"picture":[173],"analogous":[174],"statistical":[177,272],"one":[178],"found":[179],"[Hanneke":[181],"2026],":[184],"but":[185],"with":[186],"different":[188],"scale":[189],"dependence":[191,247],"horizon.":[195],"we":[200,236],"prove":[201,259],"taxonomy":[203],"possible":[205],"mistake-bound":[206],"growth":[207],"rates":[208],"in":[209],"$M$:":[213],"essentially":[214],"any":[215],"rate":[216],"constant":[218],"logarithmic":[220,228],"arise.":[222],"further":[224],"ceiling":[229],"unavoidable.":[231],"access":[239],"full":[242],"trajectory":[244],"eliminates":[245],"altogether.":[250],"also":[252],"analyze":[253],"linear":[255],"threshold":[256],"classes,":[257],"bounds,":[262],"well":[264],"new":[267],"lower":[268],"setting.":[273],"Along":[274],"way,":[276],"our":[277],"resolve":[279],"several":[280],"questions":[281],"left":[282],"open":[283],"2025].":[288]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-05-12T00:00:00"}
