{"id":"https://openalex.org/W7163636412","doi":"https://doi.org/10.48550/arxiv.2606.05852","title":"UniVoice: A Unified Model for Speech and Singing Voice Generation","display_name":"UniVoice: A Unified Model for Speech and Singing Voice Generation","publication_year":2026,"publication_date":"2026-06-04","ids":{"openalex":"https://openalex.org/W7163636412","doi":"https://doi.org/10.48550/arxiv.2606.05852"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.05852","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.05852","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.05852","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5137933265","display_name":"Junjie Zheng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zheng, Junjie","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137919453","display_name":"Huixin Xue","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xue, Huixin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137966492","display_name":"Shihong Ren","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ren, Shihong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5111268242","display_name":"Chaofan Ding","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ding, Chaofan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137969075","display_name":"Hao Liu (12832)","orcid":"https://orcid.org/0000-0001-8860-0657"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Hao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5137968927","display_name":"Zihao Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Zihao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.3598000109195709,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.3598000109195709,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11349","display_name":"Music Technology and Sound Studies","score":0.19480000436306,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10863","display_name":"Voice and Speech Disorders","score":0.07289999723434448,"subfield":{"id":"https://openalex.org/subfields/2737","display_name":"Physiology"},"field":{"id":"https://openalex.org/fields/27","display_name":"Medicine"},"domain":{"id":"https://openalex.org/domains/4","display_name":"Health Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/singing","display_name":"Singing","score":0.8220999836921692},{"id":"https://openalex.org/keywords/speech-synthesis","display_name":"Speech synthesis","score":0.5157999992370605},{"id":"https://openalex.org/keywords/prosody","display_name":"Prosody","score":0.4153999984264374},{"id":"https://openalex.org/keywords/melody","display_name":"Melody","score":0.374099999666214},{"id":"https://openalex.org/keywords/speech-processing","display_name":"Speech processing","score":0.36959999799728394},{"id":"https://openalex.org/keywords/transformer","display_name":"Transformer","score":0.34450000524520874},{"id":"https://openalex.org/keywords/rhythm","display_name":"Rhythm","score":0.3393000066280365},{"id":"https://openalex.org/keywords/acoustic-model","display_name":"Acoustic model","score":0.3370000123977661}],"concepts":[{"id":"https://openalex.org/C44819458","wikidata":"https://www.wikidata.org/wiki/Q27939","display_name":"Singing","level":2,"score":0.8220999836921692},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.767799973487854},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.680400013923645},{"id":"https://openalex.org/C14999030","wikidata":"https://www.wikidata.org/wiki/Q16346","display_name":"Speech synthesis","level":2,"score":0.5157999992370605},{"id":"https://openalex.org/C542774811","wikidata":"https://www.wikidata.org/wiki/Q10880526","display_name":"Prosody","level":2,"score":0.4153999984264374},{"id":"https://openalex.org/C43803900","wikidata":"https://www.wikidata.org/wiki/Q170412","display_name":"Melody","level":3,"score":0.374099999666214},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.36959999799728394},{"id":"https://openalex.org/C66322947","wikidata":"https://www.wikidata.org/wiki/Q11658","display_name":"Transformer","level":3,"score":0.34450000524520874},{"id":"https://openalex.org/C135343436","wikidata":"https://www.wikidata.org/wiki/Q170406","display_name":"Rhythm","level":2,"score":0.3393000066280365},{"id":"https://openalex.org/C155635449","wikidata":"https://www.wikidata.org/wiki/Q4674699","display_name":"Acoustic model","level":3,"score":0.3370000123977661},{"id":"https://openalex.org/C130727458","wikidata":"https://www.wikidata.org/wiki/Q1639109","display_name":"Coarticulation","level":3,"score":0.3140999972820282},{"id":"https://openalex.org/C23224414","wikidata":"https://www.wikidata.org/wiki/Q176769","display_name":"Hidden Markov model","level":2,"score":0.311599999666214},{"id":"https://openalex.org/C48145219","wikidata":"https://www.wikidata.org/wiki/Q1335365","display_name":"Security token","level":2,"score":0.3010999858379364},{"id":"https://openalex.org/C2776224158","wikidata":"https://www.wikidata.org/wiki/Q187931","display_name":"Phrase","level":2,"score":0.2985000014305115},{"id":"https://openalex.org/C45273575","wikidata":"https://www.wikidata.org/wiki/Q578970","display_name":"Spectrogram","level":2,"score":0.28780001401901245},{"id":"https://openalex.org/C8112396","wikidata":"https://www.wikidata.org/wiki/Q80535","display_name":"MIDI","level":2,"score":0.2775000035762787},{"id":"https://openalex.org/C177291462","wikidata":"https://www.wikidata.org/wiki/Q423038","display_name":"Active listening","level":2,"score":0.27160000801086426},{"id":"https://openalex.org/C2779803651","wikidata":"https://www.wikidata.org/wiki/Q5282088","display_name":"Discriminator","level":3,"score":0.26489999890327454},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.25220000743865967}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.05852","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.05852","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.05852","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.05852","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/10","display_name":"Reduced inequalities","score":0.4587249755859375}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Text-to-speech":[0],"(TTS)":[1],"and":[2,40,60,82,107,115,154,198,220],"singing":[3,34,69,83,164,202,224],"voice":[4,84],"synthesis":[5],"(SVS)":[6],"both":[7,57],"aim":[8],"to":[9,49,149,169,185,212],"generate":[10,56],"human":[11],"vocal":[12],"audio":[13],"from":[14,152],"symbolic":[15],"inputs,":[16],"but":[17,70],"they":[18],"impose":[19,170],"different":[20],"requirements":[21],"on":[22,29,88,173,193],"the":[23,102,126,147,167,178,189,233],"generation":[24,27,35,85],"process.":[25],"Speech":[26],"relies":[28],"flexible,":[30],"language-driven":[31],"prosody,":[32],"whereas":[33],"requires":[36],"explicit":[37,160],"melody":[38,127,144,161,171,180,186],"control":[39,162],"accurate":[41],"rhythmic":[42],"alignment.":[43],"This":[44,157],"mismatch":[45],"makes":[46],"it":[47,137],"challenging":[48],"train":[50],"a":[51,79,95,118,141,206,228],"single":[52,96],"model":[53,148],"that":[54],"can":[55],"natural":[58],"speech":[59,74,81,197,207],"controllable":[61],"singing,":[62,125],"since":[63],"melody-related":[64],"conditions":[65],"should":[66,71],"strongly":[67],"constrain":[68],"not":[72],"restrict":[73],"prosody.":[75],"We":[76,175],"present":[77],"UniVoice,":[78],"unified":[80,234],"framework":[86],"based":[87],"conditional":[89,190],"flow":[90],"matching.":[91],"Instead":[92],"of":[93,196,201,209,230],"using":[94],"undifferentiated":[97],"conditioning":[98],"representation,":[99],"UniVoice":[100,204,226],"factorizes":[101],"condition":[103,128],"into":[104],"content,":[105],"melody,":[106],"timbre,":[108],"which":[109],"are":[110],"encoded":[111],"by":[112,117,131],"modality-appropriate":[113],"encoders":[114],"consumed":[116],"shared":[119],"Diffusion":[120],"Transformer":[121],"(DiT)":[122],"backbone.":[123],"For":[124],"is":[129,138],"represented":[130],"MIDI":[132],"note":[133],"sequences;":[134],"for":[135,163],"speech,":[136],"replaced":[139],"with":[140],"learned":[142],"null":[143,179],"token,":[145],"allowing":[146],"infer":[150],"prosody":[151],"linguistic":[153],"acoustic":[155],"context.":[156],"design":[158],"preserves":[159],"while":[165],"avoiding":[166],"need":[168],"constraints":[172],"speech.":[174],"further":[176],"analyze":[177],"token":[181],"as":[182,217],"an":[183],"approximation":[184],"marginalization":[187],"in":[188],"flow.":[191],"Trained":[192],"30k":[194],"hours":[195,200],"35k":[199],"data,":[203],"achieves":[205,227],"PER":[208,229],"5.26\\%,":[210],"comparable":[211],"dedicated":[213],"TTS":[214],"systems":[215],"such":[216],"F5-TTS":[218],"(5.21\\%)":[219],"CosyVoice3":[221],"(5.30\\%).":[222],"On":[223],"generation,":[225],"16.22\\%,":[231],"outperforming":[232],"baseline":[235],"Vevo1.5":[236],"(24.72\\%).":[237]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-06-06T00:00:00"}
