{"id":"https://openalex.org/W7157594370","doi":"https://doi.org/10.48550/arxiv.2604.25907","title":"How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum","display_name":"How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum","publication_year":2026,"publication_date":"2026-04-28","ids":{"openalex":"https://openalex.org/W7157594370","doi":"https://doi.org/10.48550/arxiv.2604.25907"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.25907","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.25907","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.25907","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5134836341","display_name":"Chu-Cheng Lin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lin, Chu-Cheng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5013936779","display_name":"Eugene Ie","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ie, Eugene","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10982","display_name":"Motor Control and Adaptation","score":0.20170000195503235,"subfield":{"id":"https://openalex.org/subfields/2805","display_name":"Cognitive Neuroscience"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},"topics":[{"id":"https://openalex.org/T10982","display_name":"Motor Control and Adaptation","score":0.20170000195503235,"subfield":{"id":"https://openalex.org/subfields/2805","display_name":"Cognitive Neuroscience"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},{"id":"https://openalex.org/T12261","display_name":"Statistical Mechanics and Entropy","score":0.11159999668598175,"subfield":{"id":"https://openalex.org/subfields/3109","display_name":"Statistical and Nonlinear Physics"},"field":{"id":"https://openalex.org/fields/31","display_name":"Physics and Astronomy"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.07500000298023224,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/commit","display_name":"Commit","score":0.5889000296592712},{"id":"https://openalex.org/keywords/estimator","display_name":"Estimator","score":0.5546000003814697},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.4462999999523163},{"id":"https://openalex.org/keywords/noise","display_name":"Noise (video)","score":0.4311999976634979},{"id":"https://openalex.org/keywords/training","display_name":"Training (meteorology)","score":0.39410001039505005},{"id":"https://openalex.org/keywords/bayesian-probability","display_name":"Bayesian probability","score":0.36890000104904175},{"id":"https://openalex.org/keywords/monte-carlo-method","display_name":"Monte Carlo method","score":0.3555000126361847},{"id":"https://openalex.org/keywords/gradient-descent","display_name":"Gradient descent","score":0.3327000141143799}],"concepts":[{"id":"https://openalex.org/C153180980","wikidata":"https://www.wikidata.org/wiki/Q19776675","display_name":"Commit","level":2,"score":0.5889000296592712},{"id":"https://openalex.org/C185429906","wikidata":"https://www.wikidata.org/wiki/Q1130160","display_name":"Estimator","level":2,"score":0.5546000003814697},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5534999966621399},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.4462999999523163},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.4311999976634979},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.41019999980926514},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4099999964237213},{"id":"https://openalex.org/C2777211547","wikidata":"https://www.wikidata.org/wiki/Q17141490","display_name":"Training (meteorology)","level":2,"score":0.39410001039505005},{"id":"https://openalex.org/C107673813","wikidata":"https://www.wikidata.org/wiki/Q812534","display_name":"Bayesian probability","level":2,"score":0.36890000104904175},{"id":"https://openalex.org/C121864883","wikidata":"https://www.wikidata.org/wiki/Q677916","display_name":"Statistical physics","level":1,"score":0.3555999994277954},{"id":"https://openalex.org/C19499675","wikidata":"https://www.wikidata.org/wiki/Q232207","display_name":"Monte Carlo method","level":2,"score":0.3555000126361847},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.35019999742507935},{"id":"https://openalex.org/C153258448","wikidata":"https://www.wikidata.org/wiki/Q1199743","display_name":"Gradient descent","level":3,"score":0.3327000141143799},{"id":"https://openalex.org/C85847156","wikidata":"https://www.wikidata.org/wiki/Q59015987","display_name":"Verifiable secret sharing","level":3,"score":0.31859999895095825},{"id":"https://openalex.org/C28826006","wikidata":"https://www.wikidata.org/wiki/Q33521","display_name":"Applied mathematics","level":1,"score":0.3156999945640564},{"id":"https://openalex.org/C52740198","wikidata":"https://www.wikidata.org/wiki/Q1539564","display_name":"Importance sampling","level":3,"score":0.3109999895095825},{"id":"https://openalex.org/C49937458","wikidata":"https://www.wikidata.org/wiki/Q2599292","display_name":"Probabilistic logic","level":2,"score":0.299699991941452},{"id":"https://openalex.org/C77265313","wikidata":"https://www.wikidata.org/wiki/Q879844","display_name":"Rest (music)","level":2,"score":0.2946000099182129},{"id":"https://openalex.org/C177769412","wikidata":"https://www.wikidata.org/wiki/Q278090","display_name":"Prior probability","level":3,"score":0.2939999997615814},{"id":"https://openalex.org/C117765406","wikidata":"https://www.wikidata.org/wiki/Q5362437","display_name":"Generalization error","level":3,"score":0.28600001335144043},{"id":"https://openalex.org/C2986577269","wikidata":"https://www.wikidata.org/wiki/Q11306265","display_name":"Random noise","level":2,"score":0.28049999475479126},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.2782999873161316},{"id":"https://openalex.org/C57691317","wikidata":"https://www.wikidata.org/wiki/Q1289248","display_name":"Scalar (mathematics)","level":2,"score":0.27379998564720154},{"id":"https://openalex.org/C2780695315","wikidata":"https://www.wikidata.org/wiki/Q3799040","display_name":"Unobservable","level":2,"score":0.27000001072883606},{"id":"https://openalex.org/C2781020372","wikidata":"https://www.wikidata.org/wiki/Q533093","display_name":"On the fly","level":2,"score":0.2655999958515167},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.2533000111579895}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.25907","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.25907","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.25907","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.25907","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Decent work and economic growth","id":"https://metadata.un.org/sdg/8","score":0.43889352679252625}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"SFT-then-RLVR":[0,160],"is":[1,41,120,230],"widely":[2],"used":[3],"for":[4],"post-training":[5],"reasoning":[6],"models,":[7],"but":[8,119,132,192],"why":[9,14],"this":[10],"specific":[11],"ordering,":[12],"and":[13,54,183,195,201,234,238],"RLVR-only":[15],"stalls":[16],"at":[17,204,223,240],"cold":[18,117,213],"start,":[19,221],"have":[20],"lacked":[21],"a":[22,31,42,72,89],"unifying":[23],"theoretical":[24],"account.":[25],"We":[26,162],"provide":[27],"that":[28,45,93,108,169],"account":[29],"under":[30,65,158],"unified":[32],"loss":[33],"family":[34,44],"$J_Q$":[35,40,175],"using":[36],"the":[37,51,55,62,67,81,99,109,126,144,148,153,159,174],"Tsallis":[38],"$q$-logarithm.":[39],"single-parameter":[43],"interpolates":[46],"between":[47],"RLVR":[48,156],"(at":[49,60],"$q{=}0$,":[50],"\\textit{exploitation":[52],"pole})":[53],"log-marginal-likelihood":[56],"over":[57,250],"latent":[58],"trajectories":[59],"$q{=}1$,":[61],"\\textit{density-estimation":[63],"pole}),":[64],"which":[66],"standard":[68],"pipeline":[69],"corresponds":[70],"to":[71,115,122],"stepwise":[73],"$q{=}1":[74],"\\to":[75],"0$":[76],"schedule.":[77],"All":[78],"members":[79],"share":[80],"same":[82],"per-example":[83],"gradient":[84,103],"direction,":[85],"differing":[86],"only":[87],"by":[88,152],"per-instance":[90],"amplification":[91],"$P_\u03b8^{-q}$":[92],"reweights":[94],"each":[95],"instance":[96],"independently":[97],"of":[98,147],"learning":[100],"rate.":[101],"Under":[102],"flow":[104],"analysis,":[105],"we":[106],"show":[107],"exploitation":[110],"pole":[111,128],"requires":[112],"$\u03a9(\\frac{1}{p_0})$":[113],"time":[114],"escape":[116],"start":[118,214],"robust":[121,155],"label":[123,134],"noise,":[124],"while":[125],"density-estimation":[127],"escapes":[129],"in":[130],"$\u0398\\big(\\log(\\frac{1}{p_0})\\big)$":[131],"memorizes":[133],"noise.":[135],"This":[136],"separation":[137],"explains":[138],"how":[139],"SFT":[140],"($q{=}1$)":[141],"first":[142],"moves":[143],"model":[145],"out":[146],"cold-start":[149,210],"regime,":[150],"followed":[151],"more":[154],"($q{=}0$),":[157],"paradigm.":[161],"further":[163],"derive":[164],"two":[165],"Monte":[166],"Carlo":[167],"estimators":[168],"directly":[170],"optimize":[171],"fixed-$q$":[172],"on":[173,232,247],"continuum,":[176],"without":[177],"annotated":[178],"rationales:":[179],"Gradient-Amplified":[180],"RL":[181],"(GARL)":[182],"Posterior-Attenuated":[184],"Fine-Tuning":[185],"(PAFT),":[186],"with":[187],"shared":[188],"bias":[189],"$O\\big(\\frac{q}{M":[190],"P_\u03b8^q}\\big)$":[191],"different":[193],"variance":[194],"stability":[196],"properties.":[197],"On":[198],"FinQA,":[199],"HotPotQA,":[200],"MuSiQue,":[202,235],"GARL":[203,222,236],"sufficiently":[205],"high":[206],"$q$":[207,225],"substantially":[208],"mitigates":[209],"stalling,":[211],"escaping":[212],"where":[215,228],"GRPO":[216],"fails":[217],"entirely.":[218],"In":[219],"warm":[220],"low":[224],"dominates":[226],"FinQA":[227],"training":[229],"stable;":[231],"HotPotQA":[233,248],"destabilizes":[237],"PAFT":[239],"$q{=}0.75$":[241],"remains":[242],"stable,":[243],"reaching":[244],"$47.9$":[245],"\\texttt{m@16}":[246],"($+13.9$":[249],"GRPO).":[251]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-04-30T00:00:00"}
