{"id":"https://openalex.org/W2563906718","doi":"https://doi.org/10.1109/eusipco.2016.7760320","title":"3WRBM-based speech factor modeling for arbitrary-source and non-parallel voice conversion","display_name":"3WRBM-based speech factor modeling for arbitrary-source and non-parallel voice conversion","publication_year":2016,"publication_date":"2016-08-01","ids":{"openalex":"https://openalex.org/W2563906718","doi":"https://doi.org/10.1109/eusipco.2016.7760320","mag":"2563906718"},"language":"en","primary_location":{"id":"doi:10.1109/eusipco.2016.7760320","is_oa":false,"landing_page_url":"https://doi.org/10.1109/eusipco.2016.7760320","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2016 24th European Signal Processing Conference (EUSIPCO)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5041887072","display_name":"Toru Nakashika","orcid":"https://orcid.org/0000-0003-1863-6771"},"institutions":[{"id":"https://openalex.org/I20529979","display_name":"University of Electro-Communications","ror":"https://ror.org/02x73b849","country_code":"JP","type":"education","lineage":["https://openalex.org/I20529979"]}],"countries":["JP"],"is_corresponding":false,"raw_author_name":"Toru Nakashika","raw_affiliation_strings":["Graduate School of Informatics and Engineering, The University of Electro-Communications, Chofu, Japan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Graduate School of Informatics and Engineering, The University of Electro-Communications, Chofu, Japan","institution_ids":["https://openalex.org/I20529979"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5008413640","display_name":"Yasuhiro Minami","orcid":"https://orcid.org/0000-0003-3514-4285"},"institutions":[{"id":"https://openalex.org/I20529979","display_name":"University of Electro-Communications","ror":"https://ror.org/02x73b849","country_code":"JP","type":"education","lineage":["https://openalex.org/I20529979"]}],"countries":["JP"],"is_corresponding":false,"raw_author_name":"Yasuhiro Minami","raw_affiliation_strings":["Graduate School of Informatics and Engineering, The University of Electro-Communications, Chofu, Japan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Graduate School of Informatics and Engineering, The University of Electro-Communications, Chofu, Japan","institution_ids":["https://openalex.org/I20529979"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I20529979"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.13731634,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"607","last_page":"611"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9973000288009644,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10181","display_name":"Natural Language Processing Techniques","score":0.9919000267982483,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.8027887344360352},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.7270045876502991},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.5224243998527527},{"id":"https://openalex.org/keywords/speaker-recognition","display_name":"Speaker recognition","score":0.4546743333339691},{"id":"https://openalex.org/keywords/speech-synthesis","display_name":"Speech synthesis","score":0.43738436698913574},{"id":"https://openalex.org/keywords/probabilistic-logic","display_name":"Probabilistic logic","score":0.43694251775741577},{"id":"https://openalex.org/keywords/speech-processing","display_name":"Speech processing","score":0.43589121103286743},{"id":"https://openalex.org/keywords/speaker-diarisation","display_name":"Speaker diarisation","score":0.4343382716178894},{"id":"https://openalex.org/keywords/factor","display_name":"Factor (programming language)","score":0.4314882755279541},{"id":"https://openalex.org/keywords/training-set","display_name":"Training set","score":0.42372581362724304},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.2964380383491516}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8027887344360352},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.7270045876502991},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.5224243998527527},{"id":"https://openalex.org/C133892786","wikidata":"https://www.wikidata.org/wiki/Q1145189","display_name":"Speaker recognition","level":2,"score":0.4546743333339691},{"id":"https://openalex.org/C14999030","wikidata":"https://www.wikidata.org/wiki/Q16346","display_name":"Speech synthesis","level":2,"score":0.43738436698913574},{"id":"https://openalex.org/C49937458","wikidata":"https://www.wikidata.org/wiki/Q2599292","display_name":"Probabilistic logic","level":2,"score":0.43694251775741577},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.43589121103286743},{"id":"https://openalex.org/C149838564","wikidata":"https://www.wikidata.org/wiki/Q7574248","display_name":"Speaker diarisation","level":3,"score":0.4343382716178894},{"id":"https://openalex.org/C2781039887","wikidata":"https://www.wikidata.org/wiki/Q1391724","display_name":"Factor (programming language)","level":2,"score":0.4314882755279541},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.42372581362724304},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.2964380383491516},{"id":"https://openalex.org/C199360897","wikidata":"https://www.wikidata.org/wiki/Q9143","display_name":"Programming language","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/eusipco.2016.7760320","is_oa":false,"landing_page_url":"https://doi.org/10.1109/eusipco.2016.7760320","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2016 24th European Signal Processing Conference (EUSIPCO)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/16","display_name":"Peace, Justice and strong institutions","score":0.6299999952316284}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":31,"referenced_works":["https://openalex.org/W17772838","https://openalex.org/W49412823","https://openalex.org/W1588266896","https://openalex.org/W1641020902","https://openalex.org/W1950777589","https://openalex.org/W1972420736","https://openalex.org/W2009272428","https://openalex.org/W2017425464","https://openalex.org/W2022125261","https://openalex.org/W2105160541","https://openalex.org/W2120605154","https://openalex.org/W2123003832","https://openalex.org/W2126143605","https://openalex.org/W2136922672","https://openalex.org/W2136936677","https://openalex.org/W2153057929","https://openalex.org/W2156142001","https://openalex.org/W2161000554","https://openalex.org/W2161476805","https://openalex.org/W2169878657","https://openalex.org/W2294351487","https://openalex.org/W2400505377","https://openalex.org/W2401293599","https://openalex.org/W2401544731","https://openalex.org/W2404719220","https://openalex.org/W2407110532","https://openalex.org/W2577350056","https://openalex.org/W6602007935","https://openalex.org/W6635216677","https://openalex.org/W6680066585","https://openalex.org/W6732045268"],"related_works":["https://openalex.org/W2206035908","https://openalex.org/W2149220986","https://openalex.org/W4247736853","https://openalex.org/W2162158162","https://openalex.org/W1493012537","https://openalex.org/W1999004162","https://openalex.org/W2175373321","https://openalex.org/W2125642021","https://openalex.org/W1521049138","https://openalex.org/W2023466863"],"abstract_inverted_index":{"In":[0,84,158],"recent":[1],"years,":[2],"voice":[3],"conversion":[4,60,159],"(VC)":[5],"becomes":[6],"a":[7,89,117,127,152,168,172,179],"popular":[8],"technique":[9],"since":[10],"it":[11,93],"can":[12],"be":[13],"applied":[14],"to":[15,44,54,67,97,106,216],"various":[16],"speech":[17,27,70,153,173,181],"tasks.":[18],"Most":[19],"existing":[20],"approaches":[21],"on":[22],"VC":[23,48,90,204,213,222],"must":[24],"use":[25,98],"aligned":[26],"pairs":[28],"(parallel":[29],"data)":[30],"of":[31,71,82,120,155,174,188,210,218],"the":[32,36,56,69,72,76,103,108,112,146,185,189,208,211,219],"source":[33,57,109],"speaker":[34,38,58,74,110,124],"and":[35,123,135],"target":[37,73,190],"in":[39,59,79,102,111,139,167,223],"training,":[40,104],"which":[41],"makes":[42],"hard":[43],"handle":[45],"it.":[46],"Furthermore,":[47],"methods":[49],"proposed":[50],"so":[51],"far":[52],"require":[53],"specify":[55,107],"stage,":[61,160],"even":[62],"though":[63],"we":[64,87],"just":[65],"want":[66],"obtain":[68],"from":[75],"other":[77,202],"speakers":[78],"many":[80],"cases":[81],"VC.":[83],"this":[85],"paper,":[86],"propose":[88],"method":[91],"where":[92],"is":[94,182],"not":[95,196],"necessary":[96],"any":[99],"parallel":[100],"data":[101],"nor":[105],"conversion.":[113],"Our":[114,192],"approach":[115,200],"models":[116],"joint":[118],"probability":[119],"acoustic,":[121],"phonetic,":[122],"features":[125,162],"using":[126,151,184],"three-way":[128],"restricted":[129],"Boltzmann":[130],"machine":[131],"(3WRBM).":[132],"Speaker-independent":[133],"(SI)":[134],"speaker-dependent":[136],"(SD)":[137],"parameters":[138,187],"our":[140,199,224],"model":[141],"are":[142,163],"simultaneously":[143],"estimated":[144,166],"under":[145],"maximum":[147],"likelihood":[148],"(ML)":[149],"criteria":[150],"set":[154],"multiple":[156],"speakers.":[157],"phonetic":[161],"at":[164],"first":[165],"probabilistic":[169],"manner":[170],"given":[171],"an":[175],"arbitrary":[176],"speaker,":[177],"then":[178],"voice-converted":[180],"produced":[183],"SD":[186],"speaker.":[191],"experimental":[193],"results":[194],"showed":[195],"only":[197],"that":[198,207],"outperformed":[201],"non-parallel":[203],"methods,":[205],"but":[206],"performance":[209],"arbitrary-source":[212],"was":[214],"close":[215],"those":[217],"traditional":[220],"source-specified":[221],"approach.":[225]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
