{"id":"https://openalex.org/W7137203608","doi":"https://doi.org/10.48550/arxiv.2603.12304","title":"A Geometrically-Grounded Drive for MDL-Based Optimization in Deep Learning","display_name":"A Geometrically-Grounded Drive for MDL-Based Optimization in Deep Learning","publication_year":2026,"publication_date":"2026-03-12","ids":{"openalex":"https://openalex.org/W7137203608","doi":"https://doi.org/10.48550/arxiv.2603.12304"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.12304","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.12304","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.12304","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5129451506","display_name":"Ming Lei","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lei, Ming","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5129599268","display_name":"Shufan Wu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wu, Shufan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5079644955","display_name":"Christophe Baehr","orcid":"https://orcid.org/0000-0002-1230-893X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Baehr, Christophe","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12536","display_name":"Topological and Geometric Data Analysis","score":0.3555000126361847,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T12536","display_name":"Topological and Geometric Data Analysis","score":0.3555000126361847,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11273","display_name":"Advanced Graph Neural Networks","score":0.14640000462532043,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.0608999989926815,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/convexity","display_name":"Convexity","score":0.5333999991416931},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.4632999897003174},{"id":"https://openalex.org/keywords/fidelity","display_name":"Fidelity","score":0.4499000012874603},{"id":"https://openalex.org/keywords/representation","display_name":"Representation (politics)","score":0.4429999887943268},{"id":"https://openalex.org/keywords/deep-learning","display_name":"Deep learning","score":0.4260999858379364},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.40779998898506165},{"id":"https://openalex.org/keywords/convergence","display_name":"Convergence (economics)","score":0.35519999265670776},{"id":"https://openalex.org/keywords/robustness","display_name":"Robustness (evolution)","score":0.3490999937057495},{"id":"https://openalex.org/keywords/generalization","display_name":"Generalization","score":0.34689998626708984}],"concepts":[{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5586000084877014},{"id":"https://openalex.org/C72134830","wikidata":"https://www.wikidata.org/wiki/Q5166524","display_name":"Convexity","level":2,"score":0.5333999991416931},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5037000179290771},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.4632999897003174},{"id":"https://openalex.org/C2776459999","wikidata":"https://www.wikidata.org/wiki/Q2119376","display_name":"Fidelity","level":2,"score":0.4499000012874603},{"id":"https://openalex.org/C2776359362","wikidata":"https://www.wikidata.org/wiki/Q2145286","display_name":"Representation (politics)","level":3,"score":0.4429999887943268},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.4260999858379364},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.40779998898506165},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.35659998655319214},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.35519999265670776},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.35280001163482666},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.3490999937057495},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.34689998626708984},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.34610000252723694},{"id":"https://openalex.org/C2780440489","wikidata":"https://www.wikidata.org/wiki/Q5227278","display_name":"Data-driven","level":2,"score":0.33180001378059387},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.3292999863624573},{"id":"https://openalex.org/C529865628","wikidata":"https://www.wikidata.org/wiki/Q1790740","display_name":"Manifold (fluid mechanics)","level":2,"score":0.3292999863624573},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.32679998874664307},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.326200008392334},{"id":"https://openalex.org/C59404180","wikidata":"https://www.wikidata.org/wiki/Q17013334","display_name":"Feature learning","level":2,"score":0.3068999946117401},{"id":"https://openalex.org/C131675550","wikidata":"https://www.wikidata.org/wiki/Q7646884","display_name":"Surrogate model","level":2,"score":0.30079999566078186},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.30070000886917114},{"id":"https://openalex.org/C72169020","wikidata":"https://www.wikidata.org/wiki/Q194404","display_name":"Monotonic function","level":2,"score":0.2946000099182129},{"id":"https://openalex.org/C93959086","wikidata":"https://www.wikidata.org/wiki/Q6888345","display_name":"Model selection","level":2,"score":0.28870001435279846},{"id":"https://openalex.org/C186633575","wikidata":"https://www.wikidata.org/wiki/Q845060","display_name":"Maxima and minima","level":2,"score":0.27619999647140503},{"id":"https://openalex.org/C151376022","wikidata":"https://www.wikidata.org/wiki/Q168698","display_name":"Exponential function","level":2,"score":0.2703000009059906},{"id":"https://openalex.org/C87465248","wikidata":"https://www.wikidata.org/wiki/Q1417790","display_name":"Minimum description length","level":2,"score":0.2671999931335449},{"id":"https://openalex.org/C80444323","wikidata":"https://www.wikidata.org/wiki/Q2878974","display_name":"Theoretical computer science","level":1,"score":0.25519999861717224},{"id":"https://openalex.org/C2780598303","wikidata":"https://www.wikidata.org/wiki/Q65921492","display_name":"Flexibility (engineering)","level":2,"score":0.2549000084400177}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.12304","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.12304","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.12304","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.12304","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"This":[0,78,193],"paper":[1],"introduces":[2],"a":[3,30,54,63,69,86,104,119,127,144,196],"novel":[4,70],"optimization":[5,45],"framework":[6],"that":[7],"fundamentally":[8],"integrates":[9],"the":[10,17,44,82,97,112,134,178,182],"Minimum":[11],"Description":[12],"Length":[13],"(MDL)":[14],"principle":[15],"into":[16],"training":[18],"dynamics":[19],"of":[20,50,115,122,136],"deep":[21,210],"neural":[22],"networks.":[23],"Moving":[24],"beyond":[25],"its":[26],"conventional":[27],"role":[28],"as":[29,37],"model":[31,93,191],"selection":[32],"criterion,":[33],"we":[34,142],"reformulate":[35],"MDL":[36],"an":[38],"active,":[39],"adaptive":[40],"driving":[41],"force":[42],"within":[43],"process":[46],"itself.":[47],"The":[48],"core":[49],"our":[51],"method":[52],"is":[53,60],"geometrically-grounded":[55],"cognitive":[56],"manifold":[57],"whose":[58],"evolution":[59],"governed":[61],"by":[62,81,207],"\\textit{coupled":[64],"Ricci":[65],"flow},":[66],"enriched":[67],"with":[68,149,212],"\\textit{MDL":[71],"Drive}":[72],"term":[73],"derived":[74],"from":[75],"first":[76],"principles.":[77,214],"drive,":[79],"modulated":[80],"task-loss":[83],"gradient,":[84],"creates":[85],"seamless":[87],"harmony":[88],"between":[89],"data":[90],"fidelity":[91],"and":[92,133,162,174,189,203],"simplification,":[94],"actively":[95],"compressing":[96],"internal":[98],"representation":[99],"during":[100],"training.":[101],"We":[102],"establish":[103],"comprehensive":[105],"theoretical":[106,179],"foundation,":[107],"proving":[108],"key":[109],"properties":[110],"including":[111],"monotonic":[113],"decrease":[114],"description":[116],"length":[117],"(Theorem~\\ref{thm:convergence}),":[118],"finite":[120],"number":[121],"topological":[123],"phase":[124],"transitions":[125],"via":[126],"geometric":[128,209],"surgery":[129],"protocol":[130],"(Theorems~\\ref{thm:surgery},":[131],"\\ref{thm:ultimate_fate}),":[132],"emergence":[135],"universal":[137],"critical":[138],"behavior":[139],"(Theorem~\\ref{thm:universality}).":[140],"Furthermore,":[141],"provide":[143],"practical,":[145],"computationally":[146],"efficient":[147],"algorithm":[148],"$O(N":[150],"\\log":[151],"N)$":[152],"per-iteration":[153],"complexity":[154],"(Theorem~\\ref{thm:complexity}),":[155],"alongside":[156],"guarantees":[157],"for":[158],"numerical":[159],"stability":[160],"(Theorem~\\ref{thm:stability})":[161],"exponential":[163],"convergence":[164],"under":[165],"convexity":[166],"assumptions":[167],"(Theorem~\\ref{thm:convergence_rate}).":[168],"Empirical":[169],"validation":[170],"on":[171],"synthetic":[172],"regression":[173],"classification":[175],"tasks":[176],"confirms":[177],"predictions,":[180],"demonstrating":[181],"algorithm's":[183],"efficacy":[184],"in":[185],"achieving":[186],"robust":[187],"generalization":[188],"autonomous":[190],"simplification.":[192],"work":[194],"provides":[195],"principled":[197],"path":[198],"toward":[199],"more":[200],"autonomous,":[201],"generalizable,":[202],"interpretable":[204],"AI":[205],"systems":[206],"unifying":[208],"learning":[211],"information-theoretic":[213]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-03-17T00:00:00"}
