{"id":"https://openalex.org/W2400654494","doi":"https://doi.org/10.21437/interspeech.2015-133","title":"Multiple feed-forward deep neural networks for statistical parametric speech synthesis","display_name":"Multiple feed-forward deep neural networks for statistical parametric speech synthesis","publication_year":2015,"publication_date":"2015-09-06","ids":{"openalex":"https://openalex.org/W2400654494","doi":"https://doi.org/10.21437/interspeech.2015-133","mag":"2400654494"},"language":"en","primary_location":{"id":"doi:10.21437/interspeech.2015-133","is_oa":false,"landing_page_url":"https://doi.org/10.21437/interspeech.2015-133","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Interspeech 2015","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://www.research.ed.ac.uk/portal/en/publications/multiple-feedforward-deep-neural-networks-for-statistical-parametric-speech-synthesis(70147c1d-c27e-403d-83eb-34877bb84f31).html","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5062895056","display_name":"Shinji Takaki","orcid":"https://orcid.org/0000-0001-7294-7699"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shinji Takaki","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5105988176","display_name":"Sang-Jin Kim","orcid":"https://orcid.org/0009-0008-5882-3778"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"SangJin Kim","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5007639385","display_name":"Junichi Yamagishi","orcid":"https://orcid.org/0000-0003-2752-3955"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Junichi Yamagishi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5101524504","display_name":"Jong-Jin Kim","orcid":"https://orcid.org/0009-0006-9478-5196"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"JongJin Kim","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":8,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":"115","issue":"146","first_page":"2242","last_page":"2246"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9966999888420105,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9966999888420105,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9837999939918518,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7213904857635498},{"id":"https://openalex.org/keywords/parametric-statistics","display_name":"Parametric statistics","score":0.6548119187355042},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.6290231943130493},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.6000238060951233},{"id":"https://openalex.org/keywords/speech-synthesis","display_name":"Speech synthesis","score":0.5422114133834839},{"id":"https://openalex.org/keywords/feedforward-neural-network","display_name":"Feedforward neural network","score":0.517333447933197},{"id":"https://openalex.org/keywords/deep-neural-networks","display_name":"Deep neural networks","score":0.469218373298645},{"id":"https://openalex.org/keywords/time-delay-neural-network","display_name":"Time delay neural network","score":0.4435025155544281},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.4430765211582184},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.09853813052177429}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7213904857635498},{"id":"https://openalex.org/C117251300","wikidata":"https://www.wikidata.org/wiki/Q1849855","display_name":"Parametric statistics","level":2,"score":0.6548119187355042},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.6290231943130493},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.6000238060951233},{"id":"https://openalex.org/C14999030","wikidata":"https://www.wikidata.org/wiki/Q16346","display_name":"Speech synthesis","level":2,"score":0.5422114133834839},{"id":"https://openalex.org/C47702885","wikidata":"https://www.wikidata.org/wiki/Q5441227","display_name":"Feedforward neural network","level":3,"score":0.517333447933197},{"id":"https://openalex.org/C2984842247","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep neural networks","level":3,"score":0.469218373298645},{"id":"https://openalex.org/C175202392","wikidata":"https://www.wikidata.org/wiki/Q2434543","display_name":"Time delay neural network","level":3,"score":0.4435025155544281},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4430765211582184},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.09853813052177429},{"id":"https://openalex.org/C105795698","wikidata":"https://www.wikidata.org/wiki/Q12483","display_name":"Statistics","level":1,"score":0.0}],"mesh":[],"locations_count":4,"locations":[{"id":"doi:10.21437/interspeech.2015-133","is_oa":false,"landing_page_url":"https://doi.org/10.21437/interspeech.2015-133","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Interspeech 2015","raw_type":"proceedings-article"},{"id":"pmh:oai:pure.ed.ac.uk:publications/70147c1d-c27e-403d-83eb-34877bb84f31","is_oa":true,"landing_page_url":null,"pdf_url":"https://www.research.ed.ac.uk/portal/en/publications/multiple-feedforward-deep-neural-networks-for-statistical-parametric-speech-synthesis(70147c1d-c27e-403d-83eb-34877bb84f31).html","source":{"id":"https://openalex.org/S4406922455","display_name":"Edinburgh Research Explorer","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"","raw_type":""},{"id":"pmh:oai:pure.ed.ac.uk:publications/70147c1d-c27e-403d-83eb-34877bb84f31","is_oa":true,"landing_page_url":"https://www.research.ed.ac.uk/en/publications/70147c1d-c27e-403d-83eb-34877bb84f31","pdf_url":"https://www.research.ed.ac.uk/portal/en/publications/multiple-feedforward-deep-neural-networks-for-statistical-parametric-speech-synthesis(70147c1d-c27e-403d-83eb-34877bb84f31).html","source":{"id":"https://openalex.org/S4406922455","display_name":"Edinburgh Research Explorer","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"other-oa","license_id":"https://openalex.org/licenses/other-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"Takaki, S, Kim, S, Yamagishi, J & Kim, J 2015, Multiple Feed-forward Deep Neural Networks for Statistical Parametric Speech Synthesis. in INTERSPEECH 2015 16th Annual Conference of the International Speech Communication Association. International Speech Communication Association, pp. 2242-2246. < http://www.isca-speech.org/archive/interspeech_2015/i15_2242.html >","raw_type":"contributionToPeriodical"},{"id":"mag:2613816331","is_oa":false,"landing_page_url":"https://www.ieice.org/ken/paper/20150717ibBQ/eng/","pdf_url":null,"source":{"id":"https://openalex.org/S4306512848","display_name":"IEICE Technical Report; IEICE Tech. Rep.","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"journal"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":"IEICE Technical Report; IEICE Tech. Rep.","raw_type":null}],"best_oa_location":{"id":"pmh:oai:pure.ed.ac.uk:publications/70147c1d-c27e-403d-83eb-34877bb84f31","is_oa":true,"landing_page_url":null,"pdf_url":"https://www.research.ed.ac.uk/portal/en/publications/multiple-feedforward-deep-neural-networks-for-statistical-parametric-speech-synthesis(70147c1d-c27e-403d-83eb-34877bb84f31).html","source":{"id":"https://openalex.org/S4406922455","display_name":"Edinburgh Research Explorer","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"","raw_type":""},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":true,"grobid_xml":false},"content_urls":{"pdf":"https://content.openalex.org/works/W2400654494.pdf"},"referenced_works_count":0,"referenced_works":[],"related_works":["https://openalex.org/W1595652908","https://openalex.org/W2089093251","https://openalex.org/W2083677758","https://openalex.org/W2408618716","https://openalex.org/W2785001934","https://openalex.org/W2186233897","https://openalex.org/W2114473615","https://openalex.org/W2014323024","https://openalex.org/W2109916967","https://openalex.org/W2166713742"],"abstract_inverted_index":{"In":[0,47],"this":[1,48],"paper,":[2],"we":[3],"investigate":[4],"a":[5,15],"combination":[6],"of":[7,29,66],"several":[8],"feedforward":[9],"deep":[10],"neural":[11],"networks":[12],"(DNNs)":[13],"for":[14],"high-quality":[16],"statistical":[17,34,68],"parametric":[18,35],"speech":[19,36,69,93,102],"synthesis":[20,70,94,103],"system.":[21],"Recently,":[22],"DNNs":[23,56,60],"have":[24],"significantly":[25],"improved":[26],"the":[27,33,59,67,76,100],"performance":[28],"essential":[30],"components":[31],"in":[32],"synthesis,":[37],"e.g.":[38],"spectral":[39,45,81,89],"feature":[40,77],"extraction,":[41],"acoustic":[42,83],"modeling":[43],"and":[44,88,109],"post-filter.":[46],"paper":[49],"our":[50],"proposed":[51,91],"technique":[52],"combines":[53],"these":[54],"feed-forward":[55],"so":[57],"that":[58],"can":[61],"perform":[62],"all":[63],"standard":[64],"steps":[65],"from":[71,79],"end":[72],"to":[73,99],"end,":[74],"including":[75],"extraction":[78],"STRAIGHT":[80],"amplitudes,":[82],"modeling,":[84],"smooth":[85],"trajectory":[86],"generation":[87],"post-filter.The":[90],"DNN-based":[92,108],"system":[95],"is":[96],"then":[97],"compared":[98],"state-of-the-art":[101],"systems,":[104],"i.e.":[105],"conventional":[106],"HMM-based,":[107],"unit":[110],"selection":[111],"ones.":[112]},"counts_by_year":[{"year":2019,"cited_by_count":2},{"year":2018,"cited_by_count":1},{"year":2017,"cited_by_count":2},{"year":2016,"cited_by_count":3}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
