{"id":"https://openalex.org/W6959980262","doi":"https://doi.org/10.1184/r1/25796812.v1","title":"Speech Enhancement Using Deep Neural Networks","display_name":"Speech Enhancement Using Deep Neural Networks","publication_year":2024,"publication_date":"2024-01-01","ids":{"openalex":"https://openalex.org/W6959980262","doi":"https://doi.org/10.1184/r1/25796812.v1"},"language":"en","primary_location":{"id":"pmh:oai:figshare.com:article/25796812","is_oa":true,"landing_page_url":"https://figshare.com/articles/thesis/Speech_Enhancement_Using_Deep_Neural_Networks/25796812","pdf_url":null,"source":{"id":"https://openalex.org/S4377196282","display_name":"Figshare","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I4210132348","host_organization_name":"Figshare (United Kingdom)","host_organization_lineage":["https://openalex.org/I4210132348"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Thesis"},"type":"dissertation","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://figshare.com/articles/thesis/Speech_Enhancement_Using_Deep_Neural_Networks/25796812","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":null,"display_name":"Xia, Yangyang","orcid":null},"institutions":[{"id":"https://openalex.org/I74973139","display_name":"Carnegie Mellon University","ror":"https://ror.org/05x2bcf33","country_code":"US","type":"education","lineage":["https://openalex.org/I74973139"]}],"countries":["US"],"is_corresponding":true,"raw_author_name":"Xia, Yangyang","raw_affiliation_strings":["Carnegie Mellon University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Carnegie Mellon University","institution_ids":["https://openalex.org/I74973139"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I74973139"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":true,"primary_topic":{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.965499997138977,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.965499997138977,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.007000000216066837,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10283","display_name":"Hearing Loss and Rehabilitation","score":0.0052999998442828655,"subfield":{"id":"https://openalex.org/subfields/2805","display_name":"Cognitive Neuroscience"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/speech-enhancement","display_name":"Speech enhancement","score":0.8271999955177307},{"id":"https://openalex.org/keywords/intelligibility","display_name":"Intelligibility (philosophy)","score":0.6169999837875366},{"id":"https://openalex.org/keywords/noise-reduction","display_name":"Noise reduction","score":0.4424000084400177},{"id":"https://openalex.org/keywords/speech-processing","display_name":"Speech processing","score":0.43860000371932983},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.4205000102519989},{"id":"https://openalex.org/keywords/deep-neural-networks","display_name":"Deep neural networks","score":0.41040000319480896},{"id":"https://openalex.org/keywords/voice-activity-detection","display_name":"Voice activity detection","score":0.3950999975204468},{"id":"https://openalex.org/keywords/deep-learning","display_name":"Deep learning","score":0.38420000672340393},{"id":"https://openalex.org/keywords/background-noise","display_name":"Background noise","score":0.3806000053882599}],"concepts":[{"id":"https://openalex.org/C2776182073","wikidata":"https://www.wikidata.org/wiki/Q7575395","display_name":"Speech enhancement","level":3,"score":0.8271999955177307},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.753000020980835},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.6456000208854675},{"id":"https://openalex.org/C60048801","wikidata":"https://www.wikidata.org/wiki/Q1433889","display_name":"Intelligibility (philosophy)","level":2,"score":0.6169999837875366},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5051000118255615},{"id":"https://openalex.org/C163294075","wikidata":"https://www.wikidata.org/wiki/Q581861","display_name":"Noise reduction","level":2,"score":0.4424000084400177},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.43860000371932983},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.4205000102519989},{"id":"https://openalex.org/C2984842247","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep neural networks","level":3,"score":0.41040000319480896},{"id":"https://openalex.org/C204201278","wikidata":"https://www.wikidata.org/wiki/Q1332614","display_name":"Voice activity detection","level":3,"score":0.3950999975204468},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.38420000672340393},{"id":"https://openalex.org/C100675267","wikidata":"https://www.wikidata.org/wiki/Q1371624","display_name":"Background noise","level":2,"score":0.3806000053882599},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.37560001015663147},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.35089999437332153},{"id":"https://openalex.org/C29265498","wikidata":"https://www.wikidata.org/wiki/Q7047719","display_name":"Noise measurement","level":3,"score":0.33629998564720154},{"id":"https://openalex.org/C136389625","wikidata":"https://www.wikidata.org/wiki/Q334384","display_name":"Supervised learning","level":3,"score":0.32350000739097595},{"id":"https://openalex.org/C36503486","wikidata":"https://www.wikidata.org/wiki/Q11235244","display_name":"Domain (mathematical analysis)","level":2,"score":0.3215000033378601},{"id":"https://openalex.org/C99209842","wikidata":"https://www.wikidata.org/wiki/Q643696","display_name":"Speech perception","level":3,"score":0.30630001425743103},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.29899999499320984},{"id":"https://openalex.org/C95623464","wikidata":"https://www.wikidata.org/wiki/Q1096149","display_name":"Classifier (UML)","level":2,"score":0.28619998693466187},{"id":"https://openalex.org/C111335779","wikidata":"https://www.wikidata.org/wiki/Q3454686","display_name":"Reduction (mathematics)","level":2,"score":0.2856000065803528},{"id":"https://openalex.org/C2777212361","wikidata":"https://www.wikidata.org/wiki/Q5127848","display_name":"Class (philosophy)","level":2,"score":0.28529998660087585},{"id":"https://openalex.org/C3156200","wikidata":"https://www.wikidata.org/wiki/Q1148563","display_name":"Obstruent","level":3,"score":0.2851000130176544},{"id":"https://openalex.org/C90652560","wikidata":"https://www.wikidata.org/wiki/Q11091747","display_name":"Minimum mean square error","level":3,"score":0.2827000021934509},{"id":"https://openalex.org/C88485024","wikidata":"https://www.wikidata.org/wiki/Q1054571","display_name":"Cepstrum","level":2,"score":0.27720001339912415},{"id":"https://openalex.org/C26760741","wikidata":"https://www.wikidata.org/wiki/Q160402","display_name":"Perception","level":2,"score":0.26969999074935913},{"id":"https://openalex.org/C2779530757","wikidata":"https://www.wikidata.org/wiki/Q1207505","display_name":"Quality (philosophy)","level":2,"score":0.26600000262260437},{"id":"https://openalex.org/C103824480","wikidata":"https://www.wikidata.org/wiki/Q185889","display_name":"Time domain","level":2,"score":0.26420000195503235}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:oai:figshare.com:article/25796812","is_oa":true,"landing_page_url":"https://figshare.com/articles/thesis/Speech_Enhancement_Using_Deep_Neural_Networks/25796812","pdf_url":null,"source":{"id":"https://openalex.org/S4377196282","display_name":"Figshare","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I4210132348","host_organization_name":"Figshare (United Kingdom)","host_organization_lineage":["https://openalex.org/I4210132348"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Thesis"},{"id":"doi:10.1184/r1/25796812.v1","is_oa":true,"landing_page_url":"https://doi.org/10.1184/r1/25796812.v1","pdf_url":null,"source":{"id":"https://openalex.org/S7407050927","display_name":"KiltHub Repository","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"article-journal"}],"best_oa_location":{"id":"pmh:oai:figshare.com:article/25796812","is_oa":true,"landing_page_url":"https://figshare.com/articles/thesis/Speech_Enhancement_Using_Deep_Neural_Networks/25796812","pdf_url":null,"source":{"id":"https://openalex.org/S4377196282","display_name":"Figshare","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I4210132348","host_organization_name":"Figshare (United Kingdom)","host_organization_lineage":["https://openalex.org/I4210132348"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Thesis"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/16","score":0.4972212612628937,"display_name":"Peace, Justice and strong institutions"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Speech":[0],"enhancement":[1,93,111,163],"algorithms":[2,32,71,137,175,251],"aim":[3],"to":[4,16,25,68,74,114,259,272],"improve":[5,17,273],"the":[6,54,64,66,100,121,151,156,160,166,190,210,218,229,238],"quality":[7],"and":[8,28,52,78,130,145,202,256],"intelligibility":[9],"of":[10,22,57,81,118,168,223,241,249],"speech":[11,59,82,92,110,119,162,275],"signals":[12],"degraded":[13],"by":[14,213],"noise":[15,204],"human":[18],"or":[19],"machine":[20],"interpretation":[21],"speech.":[23],"Thanks":[24],"large-scale":[26],"datasets":[27],"online":[29],"simulation,":[30],"supervised":[31,91,219],"based":[33],"on":[34,177],"deep":[35],"neural":[36],"networks":[37],"can":[38],"accurately":[39],"suppress":[40],"non-stationary":[41],"noise,":[42],"making":[43],"them":[44,258],"useful":[45],"in":[46,94,232,234],"practice":[47],"for":[48,109],"real-time":[49],"communication":[50],"systems":[51],"as":[53,105,189,237],"front":[55],"end":[56],"automatic":[58,274],"recognition":[60,276],"systems.":[61],"Despite":[62],"all":[63,136,184],"advances,":[65],"extent":[67],"which":[69],"these":[70,142,200],"are":[72],"robust":[73],"adverse":[75],"acoustic":[76],"conditions":[77],"phonetic":[79,215,262],"categories":[80],"stimuli":[83],"is":[84],"still":[85],"being":[86],"investigated.":[87],"This":[88],"thesis":[89],"addresses":[90],"three":[95],"parts.":[96],"First,":[97],"we":[98,154,173,208,227,266],"describe":[99,146],"four-region":[101,122,225],"error":[102,123,143],"that":[103,135,149,183,198,252],"serves":[104],"a":[106,139,247,261],"diagnostic":[107],"tool":[108],"algorithms.":[112,243],"Compared":[113],"popular":[115],"perceptual":[116],"measures":[117],"quality,":[120],"distinguishes":[124],"between":[125,141],"two":[126],"universal":[127],"problems:":[128],"under-suppression":[129,157],"over-suppression.":[131],"We":[132,180,193,244],"will":[133,181],"show":[134,182],"exhibit":[138,253],"trade-off":[140],"types":[144],"loss":[147],"functions":[148],"balance":[150],"two.":[152],"Second,":[153],"address":[155,209],"problem":[158,212,231],"within":[159],"frequency-domain":[161,242],"framework.":[164,220],"In":[165],"domain":[167],"instantaneous":[169],"signal-to-noise":[170],"ratio":[171],"(ISNR),":[172],"unify":[174],"trained":[176],"different":[178,254],"targets.":[179],"methods":[185],"face":[186],"inevitable":[187],"uncertainties":[188,201],"ISNR":[191],"decreases.":[192],"then":[194],"introduce":[195],"uncertainty":[196],"learning":[197],"quantifies":[199],"improves":[203],"reduction":[205],"capability.":[206],"Third,":[207],"over-suppression":[211,230],"incorporating":[214],"information":[216],"into":[217],"Through":[221],"measurements":[222],"phonetically-dependent":[224,268],"error,":[226],"identify":[228,246],"obstruents":[233],"American":[235],"English":[236],"critical":[239],"challenge":[240],"further":[245],"class":[248],"time-domain":[250],"trade-offs":[255],"use":[257],"train":[260],"segregation":[263],"network.":[264],"Finally,":[265],"explore":[267],"channel":[269],"selection":[270],"rules":[271],"accuracy.":[277]},"counts_by_year":[],"updated_date":"2026-07-15T18:14:33.161393","created_date":"2025-10-10T00:00:00"}
