{"id":"https://openalex.org/W7134808642","doi":"https://doi.org/10.48550/arxiv.2603.08651","title":"Group Entropies and Mirror Duality: A Class of Flexible Mirror Descent Updates for Machine Learning","display_name":"Group Entropies and Mirror Duality: A Class of Flexible Mirror Descent Updates for Machine Learning","publication_year":2026,"publication_date":"2026-03-09","ids":{"openalex":"https://openalex.org/W7134808642","doi":"https://doi.org/10.48550/arxiv.2603.08651"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.08651","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.08651","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.08651","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5018676117","display_name":"Andrzej Cichocki","orcid":"https://orcid.org/0000-0002-8364-7226"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cichocki, Andrzej","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5080845237","display_name":"Piergiulio Tempesta","orcid":"https://orcid.org/0000-0002-5186-2378"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tempesta, Piergiulio","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12261","display_name":"Statistical Mechanics and Entropy","score":0.4332999885082245,"subfield":{"id":"https://openalex.org/subfields/3109","display_name":"Statistical and Nonlinear Physics"},"field":{"id":"https://openalex.org/fields/31","display_name":"Physics and Astronomy"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T12261","display_name":"Statistical Mechanics and Entropy","score":0.4332999885082245,"subfield":{"id":"https://openalex.org/subfields/3109","display_name":"Statistical and Nonlinear Physics"},"field":{"id":"https://openalex.org/fields/31","display_name":"Physics and Astronomy"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.21160000562667847,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12814","display_name":"Gaussian Processes and Bayesian Inference","score":0.05400000140070915,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/group","display_name":"Group (periodic table)","score":0.5759999752044678},{"id":"https://openalex.org/keywords/hyperparameter","display_name":"Hyperparameter","score":0.5195000171661377},{"id":"https://openalex.org/keywords/flexibility","display_name":"Flexibility (engineering)","score":0.5189999938011169},{"id":"https://openalex.org/keywords/convergence","display_name":"Convergence (economics)","score":0.5008999705314636},{"id":"https://openalex.org/keywords/logarithm","display_name":"Logarithm","score":0.47040000557899475},{"id":"https://openalex.org/keywords/gradient-descent","display_name":"Gradient descent","score":0.46369999647140503},{"id":"https://openalex.org/keywords/generality","display_name":"Generality","score":0.45339998602867126},{"id":"https://openalex.org/keywords/class","display_name":"Class (philosophy)","score":0.4099999964237213},{"id":"https://openalex.org/keywords/statistical-learning-theory","display_name":"Statistical learning theory","score":0.3937999904155731}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6144999861717224},{"id":"https://openalex.org/C2781311116","wikidata":"https://www.wikidata.org/wiki/Q83306","display_name":"Group (periodic table)","level":2,"score":0.5759999752044678},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5627999901771545},{"id":"https://openalex.org/C8642999","wikidata":"https://www.wikidata.org/wiki/Q4171168","display_name":"Hyperparameter","level":2,"score":0.5195000171661377},{"id":"https://openalex.org/C2780598303","wikidata":"https://www.wikidata.org/wiki/Q65921492","display_name":"Flexibility (engineering)","level":2,"score":0.5189999938011169},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.5008999705314636},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5005000233650208},{"id":"https://openalex.org/C39927690","wikidata":"https://www.wikidata.org/wiki/Q11197","display_name":"Logarithm","level":2,"score":0.47040000557899475},{"id":"https://openalex.org/C153258448","wikidata":"https://www.wikidata.org/wiki/Q1199743","display_name":"Gradient descent","level":3,"score":0.46369999647140503},{"id":"https://openalex.org/C2780767217","wikidata":"https://www.wikidata.org/wiki/Q5532421","display_name":"Generality","level":2,"score":0.45339998602867126},{"id":"https://openalex.org/C2777212361","wikidata":"https://www.wikidata.org/wiki/Q5127848","display_name":"Class (philosophy)","level":2,"score":0.4099999964237213},{"id":"https://openalex.org/C2779915298","wikidata":"https://www.wikidata.org/wiki/Q7604400","display_name":"Statistical learning theory","level":3,"score":0.3937999904155731},{"id":"https://openalex.org/C57869625","wikidata":"https://www.wikidata.org/wiki/Q1783502","display_name":"Rate of convergence","level":3,"score":0.37869998812675476},{"id":"https://openalex.org/C129844170","wikidata":"https://www.wikidata.org/wiki/Q41299","display_name":"Quadratic equation","level":2,"score":0.3772999942302704},{"id":"https://openalex.org/C80444323","wikidata":"https://www.wikidata.org/wiki/Q2878974","display_name":"Theoretical computer science","level":1,"score":0.37299999594688416},{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.3626999855041504},{"id":"https://openalex.org/C106301342","wikidata":"https://www.wikidata.org/wiki/Q4117933","display_name":"Entropy (arrow of time)","level":2,"score":0.3361000120639801},{"id":"https://openalex.org/C108710211","wikidata":"https://www.wikidata.org/wiki/Q11538","display_name":"Mathematical proof","level":2,"score":0.3255000114440918},{"id":"https://openalex.org/C157553263","wikidata":"https://www.wikidata.org/wiki/Q5168004","display_name":"Coordinate descent","level":2,"score":0.3237999975681305},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.31529998779296875},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.30329999327659607},{"id":"https://openalex.org/C50292564","wikidata":"https://www.wikidata.org/wiki/Q2462783","display_name":"Computational learning theory","level":3,"score":0.2831000089645386},{"id":"https://openalex.org/C206688291","wikidata":"https://www.wikidata.org/wiki/Q7617819","display_name":"Stochastic gradient descent","level":3,"score":0.272599995136261},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.2635999917984009},{"id":"https://openalex.org/C81845259","wikidata":"https://www.wikidata.org/wiki/Q290117","display_name":"Quadratic programming","level":2,"score":0.2628999948501587},{"id":"https://openalex.org/C177606310","wikidata":"https://www.wikidata.org/wiki/Q5674297","display_name":"Adaptability","level":2,"score":0.2547000050544739},{"id":"https://openalex.org/C2982736386","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Statistical learning","level":2,"score":0.2524999976158142},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.25189998745918274},{"id":"https://openalex.org/C114289077","wikidata":"https://www.wikidata.org/wiki/Q3284399","display_name":"Statistical model","level":2,"score":0.2515999972820282},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.250900000333786}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.08651","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.08651","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.08651","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.08651","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"We":[0,203],"introduce":[1,111],"a":[2],"comprehensive":[3],"theoretical":[4],"and":[5,13,54,65,83,92,104,176,190,199,209],"algorithmic":[6],"framework":[7],"that":[8,96],"bridges":[9],"formal":[10],"group":[11,14,41,50,145],"theory":[12],"entropies":[15,59],"with":[16,128],"modern":[17],"machine":[18,188],"learning,":[19],"paving":[20],"the":[21,37,62,112,141,144,151,154,158,195,206,212],"way":[22],"for":[23,185],"an":[24],"infinite,":[25],"flexible":[26,91],"family":[27],"of":[28,40,114,143,157,197,211],"Mirror":[29],"Descent":[30],"(MD)":[31],"optimization":[32],"algorithms.":[33,202],"Our":[34],"approach":[35],"exploits":[36],"rich":[38],"structure":[39],"entropies,":[42],"which":[43,117],"are":[44],"generalized":[45,81],"entropic":[46],"functionals":[47],"governed":[48],"by":[49,193],"composition":[51],"laws,":[52],"encompassing":[53],"significantly":[55],"extending":[56],"all":[57],"trace-form":[58],"such":[60],"as":[61],"Shannon,":[63],"Tsallis,":[64],"Kaniadakis":[66],"families.":[67],"By":[68,137],"leveraging":[69],"group-theoretical":[70,125],"mirror":[71],"maps":[72],"(or":[73],"link":[74,126],"functions)":[75],"in":[76,187],"MD,":[77],"expressed":[78],"via":[79,167],"multi-parametric":[80],"logarithms":[82,146],"their":[84,129],"inverses":[85],"(group":[86],"exponentials),":[87],"we":[88,110],"achieve":[89],"highly":[90],"adaptable":[93],"MD":[94],"updates":[95,214],"can":[97],"be":[98],"tailored":[99],"to":[100,120,132,149,153],"diverse":[101],"data":[102],"geometries":[103],"statistical":[105,155],"distributions.":[106],"To":[107],"this":[108],"end,":[109],"notion":[113],"\\textit{mirror":[115],"duality},":[116],"allows":[118],"us":[119,148],"seamlessly":[121],"switch":[122],"or":[123,139],"interchange":[124],"functions":[127],"inverses,":[130],"subject":[131],"specific":[133],"learning":[134,140,189,192],"rate":[135],"constraints.":[136],"tuning":[138],"hyperparameters":[142],"enables":[147],"adapt":[150],"model":[152],"properties":[156],"training":[159],"distribution,":[160],"while":[161],"simultaneously":[162],"ensuring":[163],"desirable":[164],"convergence":[165,178],"characteristics":[166],"fine-tuning.":[168],"This":[169],"generality":[170],"not":[171],"only":[172],"provides":[173],"greater":[174],"flexibility":[175],"improved":[177],"properties,":[179],"but":[180],"also":[181],"opens":[182],"new":[183],"perspectives":[184],"applications":[186],"deep":[191],"expanding":[194],"design":[196],"regularizers":[198],"natural":[200],"gradient":[201],"extensively":[204],"evaluate":[205],"validity,":[207],"robustness,":[208],"performance":[210],"proposed":[213],"on":[215],"large-scale,":[216],"simplex-constrained":[217],"quadratic":[218],"programming":[219],"problems.":[220]},"counts_by_year":[],"updated_date":"2026-08-16T07:02:28.622633","created_date":"2026-03-11T00:00:00"}
