{"id":"https://openalex.org/W1990939721","doi":"https://doi.org/10.1109/icassp.2002.5745004","title":"Auditory VOCODER: Speech resynthesis from an auditory Mellin representation","display_name":"Auditory VOCODER: Speech resynthesis from an auditory Mellin representation","publication_year":2002,"publication_date":"2002-05-01","ids":{"openalex":"https://openalex.org/W1990939721","doi":"https://doi.org/10.1109/icassp.2002.5745004","mag":"1990939721"},"language":"en","primary_location":{"id":"doi:10.1109/icassp.2002.5745004","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2002.5745004","pdf_url":null,"source":{"id":"https://openalex.org/S4363607879","display_name":"IEEE International Conference on Acoustics Speech and Signal Processing","issn_l":"1520-6149","issn":["1520-6149","2379-190X"],"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"conference"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE International Conference on Acoustics Speech and Signal Processing","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5078342732","display_name":"Toshio Irino","orcid":"https://orcid.org/0000-0002-7691-4189"},"institutions":[{"id":"https://openalex.org/I2251713219","display_name":"NTT (Japan)","ror":"https://ror.org/00berct97","country_code":"JP","type":"company","lineage":["https://openalex.org/I2251713219"]}],"countries":["JP"],"is_corresponding":false,"raw_author_name":"T. Irino","raw_affiliation_strings":["NTT Communication Science Laboratories, Japan Science and Technology Corporation-CREST, Japan","NTT Communication Science Laboratories, Japan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"NTT Communication Science Laboratories, Japan Science and Technology Corporation-CREST, Japan","institution_ids":["https://openalex.org/I2251713219"]},{"raw_affiliation_string":"NTT Communication Science Laboratories, Japan","institution_ids":["https://openalex.org/I2251713219"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5083943802","display_name":"Roy D. Patterson","orcid":"https://orcid.org/0000-0002-0919-6076"},"institutions":[{"id":"https://openalex.org/I241749","display_name":"University of Cambridge","ror":"https://ror.org/013meh722","country_code":"GB","type":"education","lineage":["https://openalex.org/I241749"]},{"id":"https://openalex.org/I4210086114","display_name":"Center for the Neural Basis of Cognition","ror":"https://ror.org/00jfeg660","country_code":"US","type":"facility","lineage":["https://openalex.org/I170201317","https://openalex.org/I4210086114","https://openalex.org/I74973139"]}],"countries":["GB","US"],"is_corresponding":false,"raw_author_name":"R. D. Patterson","raw_affiliation_strings":["Centre for the Neural Basis of Hearing, University of Cambridge, UK","Centre for the Neural Basis of Hearing, Cambridge Univ., U.K"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Centre for the Neural Basis of Hearing, University of Cambridge, UK","institution_ids":["https://openalex.org/I241749"]},{"raw_affiliation_string":"Centre for the Neural Basis of Hearing, Cambridge Univ., U.K","institution_ids":["https://openalex.org/I4210086114"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5072749858","display_name":"Hideki Kawahara","orcid":"https://orcid.org/0000-0001-9360-5700"},"institutions":[{"id":"https://openalex.org/I75198481","display_name":"Wakayama University","ror":"https://ror.org/05wr49d48","country_code":"JP","type":"education","lineage":["https://openalex.org/I75198481"]}],"countries":["JP"],"is_corresponding":false,"raw_author_name":"H. Kawahara","raw_affiliation_strings":["ATRI /CREST-JST, Wakayama University, Japan","Wakayama University / ATR / CREST-JST, Japan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"ATRI /CREST-JST, Wakayama University, Japan","institution_ids":["https://openalex.org/I75198481"]},{"raw_affiliation_string":"Wakayama University / ATR / CREST-JST, Japan","institution_ids":["https://openalex.org/I75198481"]}]}],"institutions":[],"countries_distinct_count":3,"institutions_distinct_count":4,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.5506,"has_fulltext":false,"cited_by_count":3,"citation_normalized_percentile":{"value":0.585353,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":"109","issue":null,"first_page":"II","last_page":"1921"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":1.0,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":1.0,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9993000030517578,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10283","display_name":"Hearing Loss and Rehabilitation","score":0.9988999962806702,"subfield":{"id":"https://openalex.org/subfields/2805","display_name":"Cognitive Neuroscience"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7491060495376587},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.7343882322311401},{"id":"https://openalex.org/keywords/active-listening","display_name":"Active listening","score":0.5840752124786377},{"id":"https://openalex.org/keywords/perception","display_name":"Perception","score":0.5447999835014343},{"id":"https://openalex.org/keywords/representation","display_name":"Representation (politics)","score":0.4639285206794739},{"id":"https://openalex.org/keywords/noise","display_name":"Noise (video)","score":0.4401087462902069},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.28701043128967285},{"id":"https://openalex.org/keywords/image","display_name":"Image (mathematics)","score":0.18537494540214539},{"id":"https://openalex.org/keywords/psychology","display_name":"Psychology","score":0.10995009541511536},{"id":"https://openalex.org/keywords/communication","display_name":"Communication","score":0.06457483768463135}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7491060495376587},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.7343882322311401},{"id":"https://openalex.org/C177291462","wikidata":"https://www.wikidata.org/wiki/Q423038","display_name":"Active listening","level":2,"score":0.5840752124786377},{"id":"https://openalex.org/C26760741","wikidata":"https://www.wikidata.org/wiki/Q160402","display_name":"Perception","level":2,"score":0.5447999835014343},{"id":"https://openalex.org/C2776359362","wikidata":"https://www.wikidata.org/wiki/Q2145286","display_name":"Representation (politics)","level":3,"score":0.4639285206794739},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.4401087462902069},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.28701043128967285},{"id":"https://openalex.org/C115961682","wikidata":"https://www.wikidata.org/wiki/Q860623","display_name":"Image (mathematics)","level":2,"score":0.18537494540214539},{"id":"https://openalex.org/C15744967","wikidata":"https://www.wikidata.org/wiki/Q9418","display_name":"Psychology","level":0,"score":0.10995009541511536},{"id":"https://openalex.org/C46312422","wikidata":"https://www.wikidata.org/wiki/Q11024","display_name":"Communication","level":1,"score":0.06457483768463135},{"id":"https://openalex.org/C94625758","wikidata":"https://www.wikidata.org/wiki/Q7163","display_name":"Politics","level":2,"score":0.0},{"id":"https://openalex.org/C169760540","wikidata":"https://www.wikidata.org/wiki/Q207011","display_name":"Neuroscience","level":1,"score":0.0},{"id":"https://openalex.org/C199539241","wikidata":"https://www.wikidata.org/wiki/Q7748","display_name":"Law","level":1,"score":0.0},{"id":"https://openalex.org/C17744445","wikidata":"https://www.wikidata.org/wiki/Q36442","display_name":"Political science","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icassp.2002.5745004","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2002.5745004","pdf_url":null,"source":{"id":"https://openalex.org/S4363607879","display_name":"IEEE International Conference on Acoustics Speech and Signal Processing","issn_l":"1520-6149","issn":["1520-6149","2379-190X"],"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"conference"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE International Conference on Acoustics Speech and Signal Processing","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Reduced inequalities","id":"https://metadata.un.org/sdg/10","score":0.5899999737739563},{"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16","score":0.41999998688697815}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":17,"referenced_works":["https://openalex.org/W59345536","https://openalex.org/W101206527","https://openalex.org/W2029203798","https://openalex.org/W2031768652","https://openalex.org/W2032420816","https://openalex.org/W2033708670","https://openalex.org/W2035826164","https://openalex.org/W2049686551","https://openalex.org/W2057239882","https://openalex.org/W2060539877","https://openalex.org/W2086087018","https://openalex.org/W2096980176","https://openalex.org/W2136419565","https://openalex.org/W2148154194","https://openalex.org/W4248122244","https://openalex.org/W6602399840","https://openalex.org/W6604114856"],"related_works":["https://openalex.org/W2317723112","https://openalex.org/W2475724061","https://openalex.org/W2773393136","https://openalex.org/W2174706483","https://openalex.org/W2997121352","https://openalex.org/W419536403","https://openalex.org/W2506280730","https://openalex.org/W4237969969","https://openalex.org/W1594297642","https://openalex.org/W2366328218"],"abstract_inverted_index":{"We":[0,71],"assume":[1],"that":[2,84],"speech":[3,8,29],"rnorphing,":[4],"noise":[5],"suppression,":[6],"and":[7,56,65,75],"segregation":[9],"would":[10],"improve":[11],"if":[12],"they":[13],"were":[14],"more":[15],"accurately":[16],"based":[17],"on":[18],"human":[19,38],"perception.":[20,39],"Accordingly,":[21],"an":[22,31,46,76],"Auditory":[23,41,47],"VOCODER":[24,42,54],"was":[25],"developed":[26],"to":[27,36],"resynthesize":[28],"from":[30],"auditory":[32],"Mellin":[33,48],"representation":[34],"used":[35],"explain":[37],"The":[40],"has":[43],"three":[44],"modules:":[45],"Image":[49],"model":[50],"[9,10],":[51],"a":[52,57],"STRAIGHT":[53],"[2],":[55],"mapping":[58],"module":[59],"consisting":[60],"of":[61,78],"warped-frequency":[62],"cepstral":[63],"analysis":[64,69],"nonlinear,":[66],"multivariate":[67],"regression":[68],"(MRA).":[70],"describe":[72],"the":[73,79,85],"modules":[74],"evaluation":[77],"system.":[80],"Informal":[81],"listening":[82],"indicates":[83],"sound":[86],"quality":[87],"is":[88],"reasonable.":[89]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
