{"id":"https://openalex.org/W2940417587","doi":"https://doi.org/10.1109/icassp.2019.8683016","title":"Dnn-based Spectral Enhancement for Neural Waveform Generators with Low-bit Quantization","display_name":"Dnn-based Spectral Enhancement for Neural Waveform Generators with Low-bit Quantization","publication_year":2019,"publication_date":"2019-04-17","ids":{"openalex":"https://openalex.org/W2940417587","doi":"https://doi.org/10.1109/icassp.2019.8683016","mag":"2940417587"},"language":"en","primary_location":{"id":"doi:10.1109/icassp.2019.8683016","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2019.8683016","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5045907056","display_name":"Yang Ai","orcid":"https://orcid.org/0000-0001-6668-022X"},"institutions":[{"id":"https://openalex.org/I126520041","display_name":"University of Science and Technology of China","ror":"https://ror.org/04c4dkn09","country_code":"CN","type":"education","lineage":["https://openalex.org/I126520041","https://openalex.org/I19820366"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Yang Ai","raw_affiliation_strings":["National Engineering Laboratory for Speech and Language Information Processing, University of Science and Technology of China, Hefei, P.R. China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"National Engineering Laboratory for Speech and Language Information Processing, University of Science and Technology of China, Hefei, P.R. China","institution_ids":["https://openalex.org/I126520041"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5073662121","display_name":"Jing-Xuan Zhang","orcid":"https://orcid.org/0000-0003-4341-3174"},"institutions":[{"id":"https://openalex.org/I126520041","display_name":"University of Science and Technology of China","ror":"https://ror.org/04c4dkn09","country_code":"CN","type":"education","lineage":["https://openalex.org/I126520041","https://openalex.org/I19820366"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Jing-Xuan Zhang","raw_affiliation_strings":["National Engineering Laboratory for Speech and Language Information Processing, University of Science and Technology of China, Hefei, P.R. China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"National Engineering Laboratory for Speech and Language Information Processing, University of Science and Technology of China, Hefei, P.R. China","institution_ids":["https://openalex.org/I126520041"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5008547319","display_name":"Liang Chen","orcid":"https://orcid.org/0000-0001-8585-0255"},"institutions":[{"id":"https://openalex.org/I4210109416","display_name":"Anhui Science and Technology University","ror":"https://ror.org/01pn91c28","country_code":"CN","type":"education","lineage":["https://openalex.org/I4210109416"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Liang Chen","raw_affiliation_strings":["Anhui Science and Technology Research Institute, Hefei, P.R. China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Anhui Science and Technology Research Institute, Hefei, P.R. China","institution_ids":["https://openalex.org/I4210109416"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5059767940","display_name":"Zhen-Hua Ling","orcid":"https://orcid.org/0000-0001-7853-5273"},"institutions":[{"id":"https://openalex.org/I126520041","display_name":"University of Science and Technology of China","ror":"https://ror.org/04c4dkn09","country_code":"CN","type":"education","lineage":["https://openalex.org/I126520041","https://openalex.org/I19820366"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Zhen-Hua Ling","raw_affiliation_strings":["National Engineering Laboratory for Speech and Language Information Processing, University of Science and Technology of China, Hefei, P.R. China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"National Engineering Laboratory for Speech and Language Information Processing, University of Science and Technology of China, Hefei, P.R. China","institution_ids":["https://openalex.org/I126520041"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.9558,"has_fulltext":false,"cited_by_count":14,"citation_normalized_percentile":{"value":0.72353166,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":89,"max":97},"biblio":{"volume":null,"issue":null,"first_page":"7025","last_page":"7029"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9994000196456909,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11447","display_name":"Blind Source Separation Techniques","score":0.9991999864578247,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/waveform","display_name":"Waveform","score":0.8922773003578186},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.6300567388534546},{"id":"https://openalex.org/keywords/amplitude","display_name":"Amplitude","score":0.5818749070167542},{"id":"https://openalex.org/keywords/decoding-methods","display_name":"Decoding methods","score":0.5035304427146912},{"id":"https://openalex.org/keywords/quantization","display_name":"Quantization (signal processing)","score":0.4979431629180908},{"id":"https://openalex.org/keywords/algorithm","display_name":"Algorithm","score":0.4516741633415222},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.38023561239242554},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.3211590647697449},{"id":"https://openalex.org/keywords/physics","display_name":"Physics","score":0.19408616423606873},{"id":"https://openalex.org/keywords/optics","display_name":"Optics","score":0.12060266733169556},{"id":"https://openalex.org/keywords/telecommunications","display_name":"Telecommunications","score":0.11044180393218994}],"concepts":[{"id":"https://openalex.org/C197424946","wikidata":"https://www.wikidata.org/wiki/Q1165717","display_name":"Waveform","level":3,"score":0.8922773003578186},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6300567388534546},{"id":"https://openalex.org/C180205008","wikidata":"https://www.wikidata.org/wiki/Q159190","display_name":"Amplitude","level":2,"score":0.5818749070167542},{"id":"https://openalex.org/C57273362","wikidata":"https://www.wikidata.org/wiki/Q576722","display_name":"Decoding methods","level":2,"score":0.5035304427146912},{"id":"https://openalex.org/C28855332","wikidata":"https://www.wikidata.org/wiki/Q198099","display_name":"Quantization (signal processing)","level":2,"score":0.4979431629180908},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.4516741633415222},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.38023561239242554},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3211590647697449},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.19408616423606873},{"id":"https://openalex.org/C120665830","wikidata":"https://www.wikidata.org/wiki/Q14620","display_name":"Optics","level":1,"score":0.12060266733169556},{"id":"https://openalex.org/C76155785","wikidata":"https://www.wikidata.org/wiki/Q418","display_name":"Telecommunications","level":1,"score":0.11044180393218994},{"id":"https://openalex.org/C554190296","wikidata":"https://www.wikidata.org/wiki/Q47528","display_name":"Radar","level":2,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icassp.2019.8683016","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2019.8683016","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Quality Education","id":"https://metadata.un.org/sdg/4","score":0.5699999928474426}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":33,"referenced_works":["https://openalex.org/W1522301498","https://openalex.org/W1992202475","https://openalex.org/W2044893557","https://openalex.org/W2078528584","https://openalex.org/W2146632320","https://openalex.org/W2271840356","https://openalex.org/W2291301352","https://openalex.org/W2519091744","https://openalex.org/W2584032004","https://openalex.org/W2591927543","https://openalex.org/W2605589342","https://openalex.org/W2746474733","https://openalex.org/W2749651610","https://openalex.org/W2769810959","https://openalex.org/W2784918340","https://openalex.org/W2786868129","https://openalex.org/W2803595463","https://openalex.org/W2889329491","https://openalex.org/W2889669262","https://openalex.org/W2949382160","https://openalex.org/W2963782041","https://openalex.org/W2964121744","https://openalex.org/W2964307104","https://openalex.org/W3122318757","https://openalex.org/W4294619240","https://openalex.org/W4298580827","https://openalex.org/W6631190155","https://openalex.org/W6681711119","https://openalex.org/W6694517276","https://openalex.org/W6732429163","https://openalex.org/W6734815144","https://openalex.org/W6748140763","https://openalex.org/W6748409065"],"related_works":["https://openalex.org/W1974895211","https://openalex.org/W2129841057","https://openalex.org/W3040712279","https://openalex.org/W2364769705","https://openalex.org/W2056136368","https://openalex.org/W2374664672","https://openalex.org/W4367555392","https://openalex.org/W2538520412","https://openalex.org/W2883092465","https://openalex.org/W2176409448"],"abstract_inverted_index":{"This":[0],"paper":[1],"presents":[2],"a":[3,27,112,150],"spectral":[4,109,131],"enhancement":[5,110,132],"method":[6,25,133],"to":[7,91,144],"improve":[8],"the":[9,41,53,69,85,93,116,123,129],"quality":[10,124],"of":[11,35,52,88,122,125],"speech":[12],"reconstructed":[13,55,126],"by":[14,56,75,96],"neural":[15,58],"waveform":[16,59],"generators":[17,60],"with":[18,40,84,108,115,140,149],"low-bit":[19,57,89],"quantization.":[20],"At":[21,66],"training":[22],"stage,":[23,68],"this":[24],"builds":[26],"multiple-target":[28],"DNN,":[29],"which":[30],"predicts":[31],"log":[32],"amplitude":[33,42,50,71],"spectra":[34,51,72,87],"natural":[36,45],"high-bit":[37],"waveforms":[38,54,90,95],"together":[39],"ratios":[43],"between":[44],"and":[46,80],"distorted":[47],"spectra.":[48],"Log":[49],"are":[61,73,81],"adopted":[62],"as":[63],"model":[64,118,142],"input.":[65],"generation":[67],"enhanced":[70],"obtained":[74],"an":[76,105,137],"ensemble":[77],"decoding":[78],"strategy,":[79],"further":[82],"combined":[83],"phase":[86],"produce":[92],"final":[94],"inverse":[97],"STFT.":[98],"In":[99],"our":[100],"experiments":[101],"on":[102],"WaveRNN":[103,107,139],"vocoders,":[104],"8-bit":[106,138],"outperforms":[111],"16-bit":[113,152],"counterpart":[114],"same":[117],"complexity":[119,143],"in":[120],"terms":[121],"waveforms.":[127],"Besides,":[128],"proposed":[130],"can":[134],"also":[135],"help":[136],"reduced":[141],"achieve":[145],"similar":[146],"subjective":[147],"performance":[148],"conventional":[151],"WaveRNN.":[153]},"counts_by_year":[{"year":2026,"cited_by_count":1},{"year":2025,"cited_by_count":3},{"year":2024,"cited_by_count":2},{"year":2023,"cited_by_count":3},{"year":2022,"cited_by_count":1},{"year":2021,"cited_by_count":1},{"year":2020,"cited_by_count":2},{"year":2019,"cited_by_count":1}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
