{"id":"https://openalex.org/W7163193865","doi":"https://doi.org/10.48550/arxiv.2606.01677","title":"UniVocal: Unified Speech-Singing Code-Switching Synthesis","display_name":"UniVocal: Unified Speech-Singing Code-Switching Synthesis","publication_year":2026,"publication_date":"2026-06-01","ids":{"openalex":"https://openalex.org/W7163193865","doi":"https://doi.org/10.48550/arxiv.2606.01677"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.01677","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.01677","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.01677","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5137614634","display_name":"Yufei Shi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shi, Yufei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137697836","display_name":"Qian Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Qian","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137697530","display_name":"Wen Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Wen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137712315","display_name":"Xiangang Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Xiangang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137627832","display_name":"Zhen-Hua Ling","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ling, Zhen-Hua","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5137709990","display_name":"Yang Ai","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ai, Yang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.597100019454956,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.597100019454956,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10863","display_name":"Voice and Speech Disorders","score":0.05889999866485596,"subfield":{"id":"https://openalex.org/subfields/2737","display_name":"Physiology"},"field":{"id":"https://openalex.org/fields/27","display_name":"Medicine"},"domain":{"id":"https://openalex.org/domains/4","display_name":"Health Sciences"}},{"id":"https://openalex.org/T10403","display_name":"Phonetics and Phonology Research","score":0.0502999983727932,"subfield":{"id":"https://openalex.org/subfields/3205","display_name":"Experimental and Cognitive Psychology"},"field":{"id":"https://openalex.org/fields/32","display_name":"Psychology"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/pipeline","display_name":"Pipeline (software)","score":0.6021000146865845},{"id":"https://openalex.org/keywords/scalability","display_name":"Scalability","score":0.517300009727478},{"id":"https://openalex.org/keywords/context","display_name":"Context (archaeology)","score":0.5138999819755554},{"id":"https://openalex.org/keywords/speech-synthesis","display_name":"Speech synthesis","score":0.49380001425743103},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.47519999742507935},{"id":"https://openalex.org/keywords/prosody","display_name":"Prosody","score":0.4212000072002411},{"id":"https://openalex.org/keywords/security-token","display_name":"Security token","score":0.4203999936580658},{"id":"https://openalex.org/keywords/singing","display_name":"Singing","score":0.30410000681877136}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7822999954223633},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.6021000146865845},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.517300009727478},{"id":"https://openalex.org/C2779343474","wikidata":"https://www.wikidata.org/wiki/Q3109175","display_name":"Context (archaeology)","level":2,"score":0.5138999819755554},{"id":"https://openalex.org/C14999030","wikidata":"https://www.wikidata.org/wiki/Q16346","display_name":"Speech synthesis","level":2,"score":0.49380001425743103},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.47519999742507935},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.4514000117778778},{"id":"https://openalex.org/C542774811","wikidata":"https://www.wikidata.org/wiki/Q10880526","display_name":"Prosody","level":2,"score":0.4212000072002411},{"id":"https://openalex.org/C48145219","wikidata":"https://www.wikidata.org/wiki/Q1335365","display_name":"Security token","level":2,"score":0.4203999936580658},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.4041999876499176},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3840000033378601},{"id":"https://openalex.org/C44819458","wikidata":"https://www.wikidata.org/wiki/Q27939","display_name":"Singing","level":2,"score":0.30410000681877136},{"id":"https://openalex.org/C2776760102","wikidata":"https://www.wikidata.org/wiki/Q5139990","display_name":"Code (set theory)","level":3,"score":0.29760000109672546},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.2948000133037567},{"id":"https://openalex.org/C504749915","wikidata":"https://www.wikidata.org/wiki/Q9010971","display_name":"Speech technology","level":3,"score":0.28839999437332153},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.27730000019073486},{"id":"https://openalex.org/C20766975","wikidata":"https://www.wikidata.org/wiki/Q7390","display_name":"Human voice","level":2,"score":0.27129998803138733},{"id":"https://openalex.org/C184337299","wikidata":"https://www.wikidata.org/wiki/Q1437428","display_name":"Semantics (computer science)","level":2,"score":0.2667999863624573},{"id":"https://openalex.org/C155635449","wikidata":"https://www.wikidata.org/wiki/Q4674699","display_name":"Acoustic model","level":3,"score":0.2574000060558319},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.2531999945640564}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.01677","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.01677","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.01677","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.01677","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/4","display_name":"Quality Education","score":0.6163673400878906}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"We":[0],"propose":[1],"UniVocal,":[2],"a":[3,21,62,71,86,102],"unified":[4],"framework":[5],"that":[6,68,94,144],"implicitly":[7,49],"infers":[8,50],"vocal":[9,51],"modes":[10,52],"from":[11,54],"text":[12,55],"context":[13],"to":[14,32,75,89],"pioneer":[15],"Speech-Singing":[16],"Code-Switching":[17],"(SCS)":[18],"Synthesis":[19],"-":[20],"task":[22],"where":[23],"transitions":[24],"are":[25,163,171],"autonomously":[26],"driven":[27],"by":[28],"textual":[29],"semantics,":[30],"akin":[31],"seamless":[33],"human":[34],"language":[35],"blending.":[36],"Unlike":[37],"single-mode":[38],"generation":[39,126,137],"or":[40],"systems":[41],"relying":[42],"on":[43,149,155],"switching-control":[44],"tags,":[45],"our":[46],"proposed":[47],"UniVocal":[48,145],"solely":[53],"context.":[56],"To":[57,107],"achieve":[58],"this,":[59],"we":[60,84,117],"employ":[61],"data-efficient":[63],"two-stage":[64],"curriculum":[65],"learning":[66],"strategy":[67],"progressively":[69],"trains":[70],"competitive":[72,153],"TTS":[73],"system":[74],"acquire":[76],"the":[77],"desired":[78],"SCS":[79],"capability.":[80],"Addressing":[81],"data":[82,93],"scarcity,":[83],"introduce":[85,119],"scalable":[87],"pipeline":[88],"synthesize":[90],"diverse":[91],"code-switching":[92],"is":[95],"both":[96],"semantically":[97],"and":[98,123,138,158,169],"acoustically":[99],"natural,":[100],"alongside":[101],"new":[103],"multi-scenario":[104],"benchmark,":[105],"SCSBench.":[106],"address":[108],"limitations":[109],"of":[110],"semantic":[111],"tokenizers":[112],"in":[113],"capturing":[114],"acoustic":[115],"details,":[116],"also":[118],"refined":[120],"cent":[121],"token":[122],"Chain-of-Thought":[124],"(CoT)":[125],"for":[127],"planning":[128],"prosody":[129],"before":[130],"content":[131],"generation,":[132],"effectively":[133],"enhancing":[134],"empathetic":[135],"speech":[136,157],"singing":[139,159],"melody.":[140],"Experimental":[141],"results":[142],"demonstrate":[143],"achieves":[146],"state-of-the-art":[147],"performance":[148,154],"SCSBench":[150],"while":[151],"maintaining":[152],"regular":[156],"tasks.":[160],"Audio":[161],"samples":[162],"available":[164],"at":[165,173],"https://project-univocal-demo.github.io/demo/.":[166],"The":[167],"code":[168],"dataset":[170],"released":[172],"https://github.com/FunAudioLLM/FunResearch/tree/main/UniVocal.":[174]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-06-03T00:00:00"}
