{"id":"https://openalex.org/W7165876798","doi":"https://doi.org/10.48550/arxiv.2606.25770","title":"Re-mixing Embeddings for Patient Augmentation in Data Scarce Multiple Instance Learning","display_name":"Re-mixing Embeddings for Patient Augmentation in Data Scarce Multiple Instance Learning","publication_year":2026,"publication_date":"2026-06-24","ids":{"openalex":"https://openalex.org/W7165876798","doi":"https://doi.org/10.48550/arxiv.2606.25770"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.25770","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.25770","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.25770","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5037575071","display_name":"Muhammed Furkan Dasdelen","orcid":"https://orcid.org/0000-0003-2251-2093"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Dasdelen, Muhammed Furkan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5119745271","display_name":"Fatih Ozlugedik","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ozlugedik, Fatih","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5045299642","display_name":"Anastasia Litinetskaya","orcid":"https://orcid.org/0000-0003-2977-6374"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Litinetskaya, Anastasia","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139312952","display_name":"Nassir Navab","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Navab, Nassir","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139362922","display_name":"Carsten Marr","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Marr, Carsten","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5020682844","display_name":"Ario Sadafi","orcid":"https://orcid.org/0000-0003-4073-1396"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sadafi, Ario","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11289","display_name":"Single-cell and spatial transcriptomics","score":0.8011000156402588,"subfield":{"id":"https://openalex.org/subfields/1312","display_name":"Molecular Biology"},"field":{"id":"https://openalex.org/fields/13","display_name":"Biochemistry, Genetics and Molecular Biology"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},"topics":[{"id":"https://openalex.org/T11289","display_name":"Single-cell and spatial transcriptomics","score":0.8011000156402588,"subfield":{"id":"https://openalex.org/subfields/1312","display_name":"Molecular Biology"},"field":{"id":"https://openalex.org/fields/13","display_name":"Biochemistry, Genetics and Molecular Biology"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},{"id":"https://openalex.org/T10775","display_name":"Generative Adversarial Networks and Image Synthesis","score":0.039000000804662704,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.033399999141693115,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/cluster-analysis","display_name":"Cluster analysis","score":0.6233999729156494},{"id":"https://openalex.org/keywords/probabilistic-logic","display_name":"Probabilistic logic","score":0.5995000004768372},{"id":"https://openalex.org/keywords/bottleneck","display_name":"Bottleneck","score":0.5799000263214111},{"id":"https://openalex.org/keywords/embedding","display_name":"Embedding","score":0.5756999850273132},{"id":"https://openalex.org/keywords/class","display_name":"Class (philosophy)","score":0.5629000067710876},{"id":"https://openalex.org/keywords/missing-data","display_name":"Missing data","score":0.4957999885082245},{"id":"https://openalex.org/keywords/a-priori-and-a-posteriori","display_name":"A priori and a posteriori","score":0.4699999988079071},{"id":"https://openalex.org/keywords/mixture-model","display_name":"Mixture model","score":0.42800000309944153},{"id":"https://openalex.org/keywords/scarcity","display_name":"Scarcity","score":0.36910000443458557}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.67330002784729},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6729999780654907},{"id":"https://openalex.org/C73555534","wikidata":"https://www.wikidata.org/wiki/Q622825","display_name":"Cluster analysis","level":2,"score":0.6233999729156494},{"id":"https://openalex.org/C49937458","wikidata":"https://www.wikidata.org/wiki/Q2599292","display_name":"Probabilistic logic","level":2,"score":0.5995000004768372},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5874000191688538},{"id":"https://openalex.org/C2780513914","wikidata":"https://www.wikidata.org/wiki/Q18210350","display_name":"Bottleneck","level":2,"score":0.5799000263214111},{"id":"https://openalex.org/C41608201","wikidata":"https://www.wikidata.org/wiki/Q980509","display_name":"Embedding","level":2,"score":0.5756999850273132},{"id":"https://openalex.org/C2777212361","wikidata":"https://www.wikidata.org/wiki/Q5127848","display_name":"Class (philosophy)","level":2,"score":0.5629000067710876},{"id":"https://openalex.org/C9357733","wikidata":"https://www.wikidata.org/wiki/Q6878417","display_name":"Missing data","level":2,"score":0.4957999885082245},{"id":"https://openalex.org/C75553542","wikidata":"https://www.wikidata.org/wiki/Q178161","display_name":"A priori and a posteriori","level":2,"score":0.4699999988079071},{"id":"https://openalex.org/C61224824","wikidata":"https://www.wikidata.org/wiki/Q2260434","display_name":"Mixture model","level":2,"score":0.42800000309944153},{"id":"https://openalex.org/C109747225","wikidata":"https://www.wikidata.org/wiki/Q815758","display_name":"Scarcity","level":2,"score":0.36910000443458557},{"id":"https://openalex.org/C140779682","wikidata":"https://www.wikidata.org/wiki/Q210868","display_name":"Sampling (signal processing)","level":3,"score":0.36730000376701355},{"id":"https://openalex.org/C124101348","wikidata":"https://www.wikidata.org/wiki/Q172491","display_name":"Data mining","level":1,"score":0.3393000066280365},{"id":"https://openalex.org/C163716315","wikidata":"https://www.wikidata.org/wiki/Q901177","display_name":"Gaussian","level":2,"score":0.31949999928474426},{"id":"https://openalex.org/C2777317252","wikidata":"https://www.wikidata.org/wiki/Q18393516","display_name":"Rare events","level":2,"score":0.3131999969482422},{"id":"https://openalex.org/C2776760102","wikidata":"https://www.wikidata.org/wiki/Q5139990","display_name":"Code (set theory)","level":3,"score":0.3109000027179718},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.30559998750686646},{"id":"https://openalex.org/C198531522","wikidata":"https://www.wikidata.org/wiki/Q485146","display_name":"Sample (material)","level":2,"score":0.30469998717308044},{"id":"https://openalex.org/C189119545","wikidata":"https://www.wikidata.org/wiki/Q5128022","display_name":"Probabilistic classification","level":4,"score":0.3043999969959259},{"id":"https://openalex.org/C114289077","wikidata":"https://www.wikidata.org/wiki/Q3284399","display_name":"Statistical model","level":2,"score":0.2994999885559082},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.29820001125335693},{"id":"https://openalex.org/C2776145971","wikidata":"https://www.wikidata.org/wiki/Q30673951","display_name":"Labeled data","level":2,"score":0.29179999232292175},{"id":"https://openalex.org/C3018822202","wikidata":"https://www.wikidata.org/wiki/Q1324077","display_name":"Patient data","level":2,"score":0.27900001406669617},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.2759000062942505},{"id":"https://openalex.org/C207609745","wikidata":"https://www.wikidata.org/wiki/Q4944086","display_name":"Bootstrapping (finance)","level":2,"score":0.2637999951839447},{"id":"https://openalex.org/C8038995","wikidata":"https://www.wikidata.org/wiki/Q1152135","display_name":"Unsupervised learning","level":2,"score":0.26179999113082886},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.2549999952316284},{"id":"https://openalex.org/C9652623","wikidata":"https://www.wikidata.org/wiki/Q190109","display_name":"Field (mathematics)","level":2,"score":0.25440001487731934},{"id":"https://openalex.org/C52740198","wikidata":"https://www.wikidata.org/wiki/Q1539564","display_name":"Importance sampling","level":3,"score":0.2538999915122986}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.25770","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.25770","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.25770","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.25770","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Data":[0],"scarcity":[1,116],"is":[2,127,180,195],"a":[3,21,40,174],"major":[4],"bottleneck":[5],"in":[6,32,170],"medical":[7],"Multiple":[8],"Instance":[9],"Learning":[10],"(MIL),":[11],"especially":[12],"for":[13,185],"rare":[14,186],"diseases":[15],"or":[16],"expensive":[17],"modalities.":[18],"We":[19,108],"introduce":[20],"statistically":[22],"grounded":[23],"patient":[24,191],"augmentation":[25],"approach":[26,43],"that":[27,79],"generates":[28],"realistic":[29],"patients":[30,63,89,96],"directly":[31],"embedding":[33],"space.":[34],"Using":[35],"Gaussian":[36],"Mixture":[37],"Models":[38],"as":[39],"probabilistic":[41],"clustering":[42],"on":[44,73,101],"pooled":[45,93],"instance":[46],"embeddings":[47,69],"from":[48,70,82,131],"all":[49,83,156],"patients,":[50],"our":[51,85,110,158],"method":[52,86,111,159],"learns":[53],"disease-specific":[54],"\"recipes\"-statistical":[55],"distributions":[56],"of":[57],"instances":[58],"across":[59,112],"unsupervised":[60],"clusters.":[61],"New":[62],"are":[64,97,141],"then":[65],"generated":[66,128],"by":[67,91],"sampling":[68],"clusters":[71],"based":[72,100],"learned":[74],"recipes.":[75],"Unlike":[76],"existing":[77],"methods":[78],"require":[80],"examples":[81],"categories,":[84],"can":[87],"generate":[88],"offline":[90],"re-mixing":[92],"embeddings.":[94],"Generated":[95],"further":[98],"selected":[99],"uncertainty":[102],"quantification":[103],"to":[104,177],"improve":[105],"MIL":[106],"performance.":[107],"evaluate":[109],"three":[113],"clinically":[114],"relevant":[115],"scenarios:":[117],"(i)":[118],"cross-dataset":[119],"transfer,":[120],"where":[121,138],"an":[122,132],"entirely":[123],"missing":[124],"\"healthy\"":[125],"class":[126,139],"using":[129],"statistics":[130],"external":[133],"cohort;":[134],"(ii)":[135],"low-data":[136],"regimes,":[137],"sizes":[140],"extremely":[142],"limited;":[143],"and":[144,152,189],"(iii)":[145],"small-cohort":[146],"non-image":[147],"tasks,":[148],"including":[149],"single-cell":[150],"RNA-seq":[151],"flow":[153],"cytometry.":[154],"Across":[155],"experiments,":[157],"improves":[160],"performance":[161,175],"over":[162],"baseline,":[163],"often":[164],"outperforming":[165],"other":[166],"bag-mixing":[167],"strategies.":[168],"Notably,":[169],"the":[171],"missing-class":[172],"scenario,":[173],"comparable":[176],"full-dataset":[178],"training":[179],"achieved,":[181],"demonstrating":[182],"its":[183],"potential":[184],"disease":[187],"diagnostic":[188],"privacy-preserving":[190],"augmentation.":[192],"The":[193],"code":[194],"available":[196],"at":[197],"https://github.com/marrlab/RECIPE":[198]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-26T00:00:00"}
