{"id":"https://openalex.org/W4392902635","doi":"https://doi.org/10.1109/icassp48485.2024.10447871","title":"Speaker Anonymization Using Neural Audio Codec Language Models","display_name":"Speaker Anonymization Using Neural Audio Codec Language Models","publication_year":2024,"publication_date":"2024-03-18","ids":{"openalex":"https://openalex.org/W4392902635","doi":"https://doi.org/10.1109/icassp48485.2024.10447871"},"language":"en","primary_location":{"id":"doi:10.1109/icassp48485.2024.10447871","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp48485.2024.10447871","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5011500823","display_name":"Michele Panariello","orcid":"https://orcid.org/0009-0007-4154-5460"},"institutions":[{"id":"https://openalex.org/I1902872","display_name":"EURECOM","ror":"https://ror.org/00sse7z02","country_code":"FR","type":"education","lineage":["https://openalex.org/I1902872","https://openalex.org/I205703379"]}],"countries":["FR"],"is_corresponding":false,"raw_author_name":"Michele Panariello","raw_affiliation_strings":["Eurecom,France","Eurecom, France"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Eurecom,France","institution_ids":["https://openalex.org/I1902872"]},{"raw_affiliation_string":"Eurecom, France","institution_ids":["https://openalex.org/I1902872"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5015387266","display_name":"Francesco Nespoli","orcid":null},"institutions":[{"id":"https://openalex.org/I4210108625","display_name":"Microsoft (United Kingdom)","ror":"https://ror.org/01rw27z95","country_code":"GB","type":"company","lineage":["https://openalex.org/I1290206253","https://openalex.org/I4210108625"]},{"id":"https://openalex.org/I4210164937","display_name":"Microsoft Research (United Kingdom)","ror":"https://ror.org/05k87vq12","country_code":"GB","type":"company","lineage":["https://openalex.org/I1290206253","https://openalex.org/I4210164937"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Francesco Nespoli","raw_affiliation_strings":["Microsoft,UK","Microsoft, UK"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Microsoft,UK","institution_ids":["https://openalex.org/I4210108625","https://openalex.org/I4210164937"]},{"raw_affiliation_string":"Microsoft, UK","institution_ids":["https://openalex.org/I4210108625"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5049594655","display_name":"Massimiliano Todisco","orcid":"https://orcid.org/0000-0003-2883-0324"},"institutions":[{"id":"https://openalex.org/I1902872","display_name":"EURECOM","ror":"https://ror.org/00sse7z02","country_code":"FR","type":"education","lineage":["https://openalex.org/I1902872","https://openalex.org/I205703379"]}],"countries":["FR"],"is_corresponding":false,"raw_author_name":"Massimiliano Todisco","raw_affiliation_strings":["Eurecom,France","Eurecom, France"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Eurecom,France","institution_ids":["https://openalex.org/I1902872"]},{"raw_affiliation_string":"Eurecom, France","institution_ids":["https://openalex.org/I1902872"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5066811192","display_name":"Nicholas Evans","orcid":"https://orcid.org/0000-0002-8459-1041"},"institutions":[{"id":"https://openalex.org/I1902872","display_name":"EURECOM","ror":"https://ror.org/00sse7z02","country_code":"FR","type":"education","lineage":["https://openalex.org/I1902872","https://openalex.org/I205703379"]}],"countries":["FR"],"is_corresponding":false,"raw_author_name":"Nicholas Evans","raw_affiliation_strings":["Eurecom,France","Eurecom, France"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Eurecom,France","institution_ids":["https://openalex.org/I1902872"]},{"raw_affiliation_string":"Eurecom, France","institution_ids":["https://openalex.org/I1902872"]}]}],"institutions":[],"countries_distinct_count":2,"institutions_distinct_count":3,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":28,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"4725","last_page":"4729"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9976999759674072,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.996999979019165,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.839401125907898},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.665429413318634},{"id":"https://openalex.org/keywords/speaker-diarisation","display_name":"Speaker diarisation","score":0.5577634572982788},{"id":"https://openalex.org/keywords/codec","display_name":"Codec","score":0.5231313109397888},{"id":"https://openalex.org/keywords/identity","display_name":"Identity (music)","score":0.5162129998207092},{"id":"https://openalex.org/keywords/speaker-recognition","display_name":"Speaker recognition","score":0.49566590785980225},{"id":"https://openalex.org/keywords/embedding","display_name":"Embedding","score":0.46428385376930237},{"id":"https://openalex.org/keywords/concatenation","display_name":"Concatenation (mathematics)","score":0.4507208466529846},{"id":"https://openalex.org/keywords/natural-language-processing","display_name":"Natural language processing","score":0.4244842231273651},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.41571447253227234},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.396058589220047}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.839401125907898},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.665429413318634},{"id":"https://openalex.org/C149838564","wikidata":"https://www.wikidata.org/wiki/Q7574248","display_name":"Speaker diarisation","level":3,"score":0.5577634572982788},{"id":"https://openalex.org/C161765866","wikidata":"https://www.wikidata.org/wiki/Q184748","display_name":"Codec","level":2,"score":0.5231313109397888},{"id":"https://openalex.org/C2778355321","wikidata":"https://www.wikidata.org/wiki/Q17079427","display_name":"Identity (music)","level":2,"score":0.5162129998207092},{"id":"https://openalex.org/C133892786","wikidata":"https://www.wikidata.org/wiki/Q1145189","display_name":"Speaker recognition","level":2,"score":0.49566590785980225},{"id":"https://openalex.org/C41608201","wikidata":"https://www.wikidata.org/wiki/Q980509","display_name":"Embedding","level":2,"score":0.46428385376930237},{"id":"https://openalex.org/C87619178","wikidata":"https://www.wikidata.org/wiki/Q126002","display_name":"Concatenation (mathematics)","level":2,"score":0.4507208466529846},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.4244842231273651},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.41571447253227234},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.396058589220047},{"id":"https://openalex.org/C9390403","wikidata":"https://www.wikidata.org/wiki/Q3966","display_name":"Computer hardware","level":1,"score":0.0},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.0},{"id":"https://openalex.org/C24890656","wikidata":"https://www.wikidata.org/wiki/Q82811","display_name":"Acoustics","level":1,"score":0.0},{"id":"https://openalex.org/C114614502","wikidata":"https://www.wikidata.org/wiki/Q76592","display_name":"Combinatorics","level":1,"score":0.0},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icassp48485.2024.10447871","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp48485.2024.10447871","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":23,"referenced_works":["https://openalex.org/W1494198834","https://openalex.org/W2064675550","https://openalex.org/W2402146185","https://openalex.org/W2972848589","https://openalex.org/W3024869864","https://openalex.org/W3043999252","https://openalex.org/W3122079819","https://openalex.org/W3209059054","https://openalex.org/W3215615641","https://openalex.org/W4210970267","https://openalex.org/W4281250109","https://openalex.org/W4292597003","https://openalex.org/W4307323391","https://openalex.org/W4313679638","https://openalex.org/W4381786045","https://openalex.org/W4385822306","https://openalex.org/W4385822420","https://openalex.org/W4386132131","https://openalex.org/W4386557792","https://openalex.org/W4386712580","https://openalex.org/W6788095198","https://openalex.org/W6843253040","https://openalex.org/W6848735303"],"related_works":["https://openalex.org/W2206035908","https://openalex.org/W2149220986","https://openalex.org/W1493012537","https://openalex.org/W4247736853","https://openalex.org/W2162158162","https://openalex.org/W1999004162","https://openalex.org/W2125642021","https://openalex.org/W1521049138","https://openalex.org/W2023466863","https://openalex.org/W2696990509"],"abstract_inverted_index":{"The":[0],"vast":[1],"majority":[2],"of":[3,11,53,115,129],"approaches":[4],"to":[5,24,48,89,106],"speaker":[6,19,27,54,74,116],"anonymization":[7,117],"involve":[8],"the":[9,26,113,126,130],"extraction":[10],"fundamental":[12,58],"frequency":[13,59],"estimates,":[14],"linguistic":[15,61],"features":[16,62],"and":[17,60],"a":[18,37],"embedding":[20],"which":[21,86,103],"is":[22,34],"perturbed":[23],"obfuscate":[25],"identity":[28],"before":[29],"an":[30,78],"anonymized":[31,69],"speech":[32,70,93],"waveform":[33],"resynthesized":[35],"using":[36],"vocoder.":[38],"Recent":[39],"work":[40],"has":[41],"shown":[42],"that":[43,68],"x-vector":[44],"transformations":[45],"are":[46,63,87,104],"difficult":[47],"control":[49],"consistently:":[50],"other":[51],"sources":[52],"information":[55],"contained":[56],"within":[57],"re-entangled":[64],"upon":[65,81],"vocoding,":[66],"meaning":[67],"signals":[71],"still":[72],"contain":[73],"information.":[75],"We":[76],"propose":[77],"approach":[79],"based":[80,119],"neural":[82],"audio":[83],"codecs":[84],"(NACs),":[85],"known":[88,105],"generate":[90],"high-quality":[91],"synthetic":[92],"when":[94],"combined":[95],"with":[96],"language":[97,122],"models.":[98],"NACs":[99],"use":[100],"quantized":[101],"codes,":[102],"effectively":[107],"bottleneck":[108],"speaker-related":[109],"information:":[110],"we":[111],"demonstrate":[112],"potential":[114],"systems":[118],"on":[120],"NAC":[121],"modeling":[123],"by":[124],"applying":[125],"evaluation":[127],"framework":[128],"Voice":[131],"Privacy":[132],"Challenge":[133],"2022.":[134]},"counts_by_year":[{"year":2026,"cited_by_count":7},{"year":2025,"cited_by_count":17},{"year":2024,"cited_by_count":4}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
