{"id":"https://openalex.org/W7162672381","doi":"https://doi.org/10.48550/arxiv.2605.27991","title":"Gradient-Flow Optimization as Dynamic Random-Effects Inference: Testing and Early Stopping with Applications to Deep Learning","display_name":"Gradient-Flow Optimization as Dynamic Random-Effects Inference: Testing and Early Stopping with Applications to Deep Learning","publication_year":2026,"publication_date":"2026-05-27","ids":{"openalex":"https://openalex.org/W7162672381","doi":"https://doi.org/10.48550/arxiv.2605.27991"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.27991","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.27991","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.27991","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5081104417","display_name":"Minhao Yao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yao, Minhao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137199973","display_name":"Ruoyu Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Ruoyu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137308903","display_name":"Xihong Lin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lin, Xihong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137203544","display_name":"Lin Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Lin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5137231639","display_name":"Zhonghua Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Zhonghua","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.313400000333786,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.313400000333786,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10775","display_name":"Generative Adversarial Networks and Image Synthesis","score":0.28459998965263367,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12814","display_name":"Gaussian Processes and Bayesian Inference","score":0.13130000233650208,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/early-stopping","display_name":"Early stopping","score":0.5989000201225281},{"id":"https://openalex.org/keywords/bayes-theorem","display_name":"Bayes' theorem","score":0.5371999740600586},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.5210000276565552},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.505299985408783},{"id":"https://openalex.org/keywords/statistical-inference","display_name":"Statistical inference","score":0.3882000148296356},{"id":"https://openalex.org/keywords/covariance","display_name":"Covariance","score":0.38589999079704285},{"id":"https://openalex.org/keywords/stochastic-gradient-descent","display_name":"Stochastic gradient descent","score":0.35199999809265137},{"id":"https://openalex.org/keywords/approximate-inference","display_name":"Approximate inference","score":0.3481999933719635},{"id":"https://openalex.org/keywords/bayesian-inference","display_name":"Bayesian inference","score":0.34040001034736633},{"id":"https://openalex.org/keywords/kernel","display_name":"Kernel (algebra)","score":0.3361000120639801}],"concepts":[{"id":"https://openalex.org/C5465570","wikidata":"https://www.wikidata.org/wiki/Q5326898","display_name":"Early stopping","level":3,"score":0.5989000201225281},{"id":"https://openalex.org/C207201462","wikidata":"https://www.wikidata.org/wiki/Q182505","display_name":"Bayes' theorem","level":3,"score":0.5371999740600586},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.5210000276565552},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.505299985408783},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4810999929904938},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.4675000011920929},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.42590001225471497},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.41110000014305115},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.39809998869895935},{"id":"https://openalex.org/C134261354","wikidata":"https://www.wikidata.org/wiki/Q938438","display_name":"Statistical inference","level":2,"score":0.3882000148296356},{"id":"https://openalex.org/C178650346","wikidata":"https://www.wikidata.org/wiki/Q201984","display_name":"Covariance","level":2,"score":0.38589999079704285},{"id":"https://openalex.org/C206688291","wikidata":"https://www.wikidata.org/wiki/Q7617819","display_name":"Stochastic gradient descent","level":3,"score":0.35199999809265137},{"id":"https://openalex.org/C2777472644","wikidata":"https://www.wikidata.org/wiki/Q16968992","display_name":"Approximate inference","level":3,"score":0.3481999933719635},{"id":"https://openalex.org/C160234255","wikidata":"https://www.wikidata.org/wiki/Q812535","display_name":"Bayesian inference","level":3,"score":0.34040001034736633},{"id":"https://openalex.org/C74193536","wikidata":"https://www.wikidata.org/wiki/Q574844","display_name":"Kernel (algebra)","level":2,"score":0.3361000120639801},{"id":"https://openalex.org/C2777211547","wikidata":"https://www.wikidata.org/wiki/Q17141490","display_name":"Training (meteorology)","level":2,"score":0.33399999141693115},{"id":"https://openalex.org/C153258448","wikidata":"https://www.wikidata.org/wiki/Q1199743","display_name":"Gradient descent","level":3,"score":0.32739999890327454},{"id":"https://openalex.org/C162376815","wikidata":"https://www.wikidata.org/wiki/Q2158281","display_name":"Frequentist inference","level":4,"score":0.3237999975681305},{"id":"https://openalex.org/C107673813","wikidata":"https://www.wikidata.org/wiki/Q812534","display_name":"Bayesian probability","level":2,"score":0.31610000133514404},{"id":"https://openalex.org/C95167961","wikidata":"https://www.wikidata.org/wiki/Q4483495","display_name":"Fiducial inference","level":5,"score":0.30169999599456787},{"id":"https://openalex.org/C158600405","wikidata":"https://www.wikidata.org/wiki/Q5054566","display_name":"Causal inference","level":2,"score":0.28630000352859497},{"id":"https://openalex.org/C99888217","wikidata":"https://www.wikidata.org/wiki/Q1288707","display_name":"Stopping time","level":2,"score":0.28450000286102295},{"id":"https://openalex.org/C2780069185","wikidata":"https://www.wikidata.org/wiki/Q7977945","display_name":"Equivalence (formal languages)","level":2,"score":0.2809000015258789},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.2806999981403351},{"id":"https://openalex.org/C86426650","wikidata":"https://www.wikidata.org/wiki/Q7452504","display_name":"Sequential estimation","level":2,"score":0.2703000009059906},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.2685999870300293},{"id":"https://openalex.org/C117251300","wikidata":"https://www.wikidata.org/wiki/Q1849855","display_name":"Parametric statistics","level":2,"score":0.26829999685287476},{"id":"https://openalex.org/C99414536","wikidata":"https://www.wikidata.org/wiki/Q7098950","display_name":"Optimal stopping","level":2,"score":0.26750001311302185},{"id":"https://openalex.org/C23224414","wikidata":"https://www.wikidata.org/wiki/Q176769","display_name":"Hidden Markov model","level":2,"score":0.26420000195503235},{"id":"https://openalex.org/C2777735758","wikidata":"https://www.wikidata.org/wiki/Q817765","display_name":"Path (computing)","level":2,"score":0.263700008392334},{"id":"https://openalex.org/C186215838","wikidata":"https://www.wikidata.org/wiki/Q772232","display_name":"Conditional expectation","level":2,"score":0.2632000148296356},{"id":"https://openalex.org/C22367795","wikidata":"https://www.wikidata.org/wiki/Q7625208","display_name":"Structured prediction","level":2,"score":0.26109999418258667},{"id":"https://openalex.org/C111350023","wikidata":"https://www.wikidata.org/wiki/Q1191869","display_name":"Markov chain Monte Carlo","level":3,"score":0.25850000977516174},{"id":"https://openalex.org/C8642999","wikidata":"https://www.wikidata.org/wiki/Q4171168","display_name":"Hyperparameter","level":2,"score":0.2581000030040741},{"id":"https://openalex.org/C57830394","wikidata":"https://www.wikidata.org/wiki/Q278079","display_name":"Posterior probability","level":3,"score":0.25699999928474426},{"id":"https://openalex.org/C87007009","wikidata":"https://www.wikidata.org/wiki/Q210832","display_name":"Statistical hypothesis testing","level":2,"score":0.25619998574256897},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.2556999921798706},{"id":"https://openalex.org/C114289077","wikidata":"https://www.wikidata.org/wiki/Q3284399","display_name":"Statistical model","level":2,"score":0.25049999356269836},{"id":"https://openalex.org/C95923904","wikidata":"https://www.wikidata.org/wiki/Q6760420","display_name":"Marginal likelihood","level":3,"score":0.25029999017715454}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.27991","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.27991","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.27991","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.27991","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Gradient-flow":[0],"optimization":[1],"is":[2,52,91,149],"usually":[3],"viewed":[4],"as":[5],"an":[6],"algorithmic":[7],"procedure":[8],"for":[9,30,97,151,169],"minimizing":[10],"empirical":[11],"loss,":[12],"with":[13,189],"training":[14,45,84,90],"duration":[15],"selected":[16],"by":[17],"validation":[18,193],"or":[19],"heuristic":[20],"early":[21,122,146,186],"stopping":[22,123,147,187],"rules.":[23],"We":[24,33,117],"develop":[25],"a":[26,41,61,69,94,175],"statistical":[27],"inference":[28],"framework":[29],"gradient-flow":[31],"training.":[32],"show":[34,118,180],"that":[35,119],"whenever":[36],"fitted":[37],"values":[38],"evolve":[39],"through":[40],"time-invariant":[42],"positive":[43],"semidefinite":[44],"operator,":[46],"the":[47,55,113,120,126,136,144,184],"output":[48],"at":[49,128],"each":[50],"time":[51,66,127,148,188],"equivalent":[53],"to":[54,78,104],"best":[56],"linear":[57],"unbiased":[58],"predictor":[59],"under":[60],"corresponding":[62],"random-effects":[63],"model.":[64],"Training":[65],"then":[67],"becomes":[68,93,106],"variance-component":[70,95],"parameter":[71],"governing":[72],"variance":[73,115],"reallocation":[74],"from":[75,135],"residual":[76],"noise":[77],"structured":[79],"signal.":[80],"This":[81],"turns":[82],"two":[83],"decisions":[85],"into":[86],"inferential":[87],"problems:":[88],"whether":[89],"needed":[92],"test":[96],"signal":[98],"beyond":[99],"initialization,":[100],"and":[101,155,174,195],"how":[102],"long":[103],"train":[105],"restricted":[107],"maximum":[108],"likelihood":[109],"(REML)":[110],"estimation":[111],"of":[112,143,183],"training-time":[114],"component.":[116],"REML-guided":[121,145,185],"rule":[124],"selects":[125],"which":[129],"optimized":[130],"spectral":[131],"losses":[132],"become":[133],"decorrelated":[134],"training-operator":[137],"eigenvalues.":[138],"The":[139],"asymptotic":[140],"prediction":[141],"optimality":[142],"established":[150],"fixed-design":[152],"in-sample":[153],"risk":[154],"random-design":[156],"out-of-sample":[157],"risk.":[158],"Deep":[159],"learning":[160],"models":[161],"in":[162],"fixed-kernel":[163],"gradient":[164],"regimes":[165],"provide":[166],"canonical":[167],"instantiations":[168],"our":[170],"results.":[171],"Numerical":[172],"experiments":[173],"UK":[176],"Biobank":[177],"proteomics":[178],"application":[179],"competitive":[181],"accuracy":[182],"reduced":[190],"reliance":[191],"on":[192],"splits":[194],"repeated":[196],"checkpoint":[197],"evaluation.":[198]},"counts_by_year":[],"updated_date":"2026-07-04T06:09:54.619538","created_date":"2026-05-29T00:00:00"}
