{"id":"https://openalex.org/W4416248326","doi":"https://doi.org/10.1109/waspaa66052.2025.11230923","title":"Miipher-2: A Universal Speech Restoration Model for Million-Hour Scale Data Restoration","display_name":"Miipher-2: A Universal Speech Restoration Model for Million-Hour Scale Data Restoration","publication_year":2025,"publication_date":"2025-10-12","ids":{"openalex":"https://openalex.org/W4416248326","doi":"https://doi.org/10.1109/waspaa66052.2025.11230923"},"language":null,"primary_location":{"id":"doi:10.1109/waspaa66052.2025.11230923","is_oa":false,"landing_page_url":"https://doi.org/10.1109/waspaa66052.2025.11230923","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5036532214","display_name":"Shigeki Karita","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shigeki Karita","raw_affiliation_strings":["Google DeepMind,Tokyo,Japan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Google DeepMind,Tokyo,Japan","institution_ids":[]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5101503856","display_name":"Yuma Koizumi","orcid":"https://orcid.org/0000-0003-3645-6213"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yuma Koizumi","raw_affiliation_strings":["Google DeepMind,Tokyo,Japan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Google DeepMind,Tokyo,Japan","institution_ids":[]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5003420204","display_name":"Heiga Zen","orcid":"https://orcid.org/0000-0002-8959-5471"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Heiga Zen","raw_affiliation_strings":["Google DeepMind,Tokyo,Japan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Google DeepMind,Tokyo,Japan","institution_ids":[]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5114246027","display_name":"Haruko Ishikawa","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Haruko Ishikawa","raw_affiliation_strings":["Google DeepMind,Tokyo,Japan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Google DeepMind,Tokyo,Japan","institution_ids":[]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5020401831","display_name":"Robin Scheibler","orcid":"https://orcid.org/0000-0002-5205-8365"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Robin Scheibler","raw_affiliation_strings":["Google DeepMind,Tokyo,Japan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Google DeepMind,Tokyo,Japan","institution_ids":[]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5049614700","display_name":"Michiel Bacchiani","orcid":"https://orcid.org/0000-0003-4527-0197"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Michiel Bacchiani","raw_affiliation_strings":["Google DeepMind,Tokyo,Japan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Google DeepMind,Tokyo,Japan","institution_ids":[]}]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":5,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"5"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.48500001430511475,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.48500001430511475,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.3402999937534332,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10283","display_name":"Hearing Loss and Rehabilitation","score":0.0348999984562397,"subfield":{"id":"https://openalex.org/subfields/2805","display_name":"Cognitive Neuroscience"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/generalization","display_name":"Generalization","score":0.5647000074386597},{"id":"https://openalex.org/keywords/generative-model","display_name":"Generative model","score":0.5088000297546387},{"id":"https://openalex.org/keywords/feature","display_name":"Feature (linguistics)","score":0.4742000102996826},{"id":"https://openalex.org/keywords/generative-grammar","display_name":"Generative grammar","score":0.4602000117301941},{"id":"https://openalex.org/keywords/scale","display_name":"Scale (ratio)","score":0.42340001463890076},{"id":"https://openalex.org/keywords/waveform","display_name":"Waveform","score":0.41029998660087585},{"id":"https://openalex.org/keywords/training-set","display_name":"Training set","score":0.38839998841285706},{"id":"https://openalex.org/keywords/speech-processing","display_name":"Speech processing","score":0.38530001044273376}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7293000221252441},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.6565999984741211},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.5647000074386597},{"id":"https://openalex.org/C167966045","wikidata":"https://www.wikidata.org/wiki/Q5532625","display_name":"Generative model","level":3,"score":0.5088000297546387},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.4742000102996826},{"id":"https://openalex.org/C39890363","wikidata":"https://www.wikidata.org/wiki/Q36108","display_name":"Generative grammar","level":2,"score":0.4602000117301941},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4359000027179718},{"id":"https://openalex.org/C2778755073","wikidata":"https://www.wikidata.org/wiki/Q10858537","display_name":"Scale (ratio)","level":2,"score":0.42340001463890076},{"id":"https://openalex.org/C197424946","wikidata":"https://www.wikidata.org/wiki/Q1165717","display_name":"Waveform","level":3,"score":0.41029998660087585},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.38839998841285706},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.38530001044273376},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.36719998717308044},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.36660000681877136},{"id":"https://openalex.org/C2779530757","wikidata":"https://www.wikidata.org/wiki/Q1207505","display_name":"Quality (philosophy)","level":2,"score":0.32670000195503235},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.3264000117778778},{"id":"https://openalex.org/C204201278","wikidata":"https://www.wikidata.org/wiki/Q1332614","display_name":"Voice activity detection","level":3,"score":0.290800005197525},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.28940001130104065},{"id":"https://openalex.org/C67186912","wikidata":"https://www.wikidata.org/wiki/Q367664","display_name":"Data modeling","level":2,"score":0.2892000079154968},{"id":"https://openalex.org/C23224414","wikidata":"https://www.wikidata.org/wiki/Q176769","display_name":"Hidden Markov model","level":2,"score":0.27230000495910645},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.2563999891281128},{"id":"https://openalex.org/C14999030","wikidata":"https://www.wikidata.org/wiki/Q16346","display_name":"Speech synthesis","level":2,"score":0.25130000710487366},{"id":"https://openalex.org/C155635449","wikidata":"https://www.wikidata.org/wiki/Q4674699","display_name":"Acoustic model","level":3,"score":0.25060001015663147},{"id":"https://openalex.org/C2776182073","wikidata":"https://www.wikidata.org/wiki/Q7575395","display_name":"Speech enhancement","level":3,"score":0.25040000677108765}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/waspaa66052.2025.11230923","is_oa":false,"landing_page_url":"https://doi.org/10.1109/waspaa66052.2025.11230923","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":32,"referenced_works":["https://openalex.org/W2117678320","https://openalex.org/W2127141656","https://openalex.org/W2760103357","https://openalex.org/W2888169323","https://openalex.org/W2998498479","https://openalex.org/W3095410713","https://openalex.org/W3096159803","https://openalex.org/W3161480375","https://openalex.org/W3177067699","https://openalex.org/W3190062760","https://openalex.org/W3209059054","https://openalex.org/W4200483526","https://openalex.org/W4221161734","https://openalex.org/W4224133928","https://openalex.org/W4226033575","https://openalex.org/W4319862245","https://openalex.org/W4319862635","https://openalex.org/W4372259881","https://openalex.org/W4372271367","https://openalex.org/W4380434618","https://openalex.org/W4385823191","https://openalex.org/W4385823432","https://openalex.org/W4386764866","https://openalex.org/W4392908903","https://openalex.org/W4402111490","https://openalex.org/W4402112143","https://openalex.org/W4402112296","https://openalex.org/W4402112533","https://openalex.org/W4402115964","https://openalex.org/W4405974256","https://openalex.org/W4408354662","https://openalex.org/W4412945293"],"related_works":[],"abstract_inverted_index":{"Training":[0],"data":[1,27],"cleaning":[2,28],"is":[3],"a":[4,58,70,156,165],"new":[5],"application":[6],"for":[7,21,25,29,85,99],"generative":[8,31],"model-based":[9],"speech":[10,167],"restoration":[11],"(SR).":[12],"This":[13],"paper":[14],"introduces":[15],"Miipher-2,":[16],"an":[17],"SR":[18,131],"model":[19],"designed":[20],"million-hour":[22,166],"scale":[23],"data,":[24],"training":[26],"large-scale":[30],"models":[32,132],"like":[33],"large":[34],"language":[35],"models.":[36],"Key":[37],"challenges":[38],"addressed":[39],"include":[40],"generalization":[41],"to":[42,129],"unknown":[43],"languages,":[44,68],"operation":[45],"without":[46],"explicit":[47],"conditioning":[48],"(e.g.,":[49],"text,":[50],"speaker":[51,135],"ID),":[52],"and":[53,78,93,137,140],"computational":[54],"efficiency.":[55],"Miipher-2":[56,81,149],"utilizes":[57],"frozen,":[59],"pre-trained":[60],"Universal":[61],"Speech":[62],"Model":[63],"(USM),":[64],"supporting":[65],"over":[66],"300":[67],"as":[69],"robust,":[71],"conditioning-free":[72],"feature":[73],"extractor.":[74],"To":[75],"optimize":[76],"efficiency":[77],"minimize":[79],"memory,":[80],"incorporates":[82],"parallel":[83],"adapters":[84],"predicting":[86],"clean":[87],"USM":[88,117],"features":[89],"from":[90],"noisy":[91],"inputs":[92],"employs":[94],"the":[95,162],"WaveFit":[96],"neural":[97],"vocoder":[98],"waveform":[100],"synthesis.":[101],"These":[102],"components":[103],"were":[104],"trained":[105],"on":[106,152],"3,000":[107],"hours":[108],"of":[109,159,164],"multi-lingual,":[110],"studio-quality":[111],"recordings":[112],"with":[113],"augmented":[114],"degradations,":[115],"while":[116],"parameters":[118],"remained":[119],"fixed.":[120],"Experimental":[121],"results":[122],"demonstrate":[123],"Miipher-2\u2019s":[124],"superior":[125],"or":[126],"comparable":[127],"performance":[128],"conventional":[130],"in":[133,169],"word-error-rate,":[134],"similarity,":[136],"both":[138],"objective":[139],"subjective":[141],"sound":[142],"quality":[143],"scores":[144],"across":[145],"all":[146],"tested":[147],"languages.":[148],"operates":[150],"efficiently":[151],"consumer-grade":[153],"accelerators,":[154],"achieving":[155],"real-time":[157],"factor":[158],"0.0078,":[160],"enabling":[161],"processing":[163],"dataset":[168],"approximately":[170],"three":[171],"days":[172],"using":[173],"only":[174],"100":[175],"such":[176],"accelerators.":[177]},"counts_by_year":[{"year":2026,"cited_by_count":3},{"year":2025,"cited_by_count":2}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-11-14T00:00:00"}
