{"id":"https://openalex.org/W4417072973","doi":"https://doi.org/10.1016/j.csl.2025.101923","title":"Enhanced audio-visual speech enhancement with posterior sampling methods in recurrent variational autoencoders","display_name":"Enhanced audio-visual speech enhancement with posterior sampling methods in recurrent variational autoencoders","publication_year":2025,"publication_date":"2025-12-06","ids":{"openalex":"https://openalex.org/W4417072973","doi":"https://doi.org/10.1016/j.csl.2025.101923"},"language":"en","primary_location":{"id":"doi:10.1016/j.csl.2025.101923","is_oa":true,"landing_page_url":"https://doi.org/10.1016/j.csl.2025.101923","pdf_url":null,"source":{"id":"https://openalex.org/S91252481","display_name":"Computer Speech & Language","issn_l":"0885-2308","issn":["0885-2308","1095-8363"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310320990","host_organization_name":"Elsevier BV","host_organization_lineage":["https://openalex.org/P4310320990"],"host_organization_lineage_names":["Elsevier BV"],"type":"journal"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Computer Speech &amp; Language","raw_type":"journal-article"},"type":"article","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"hybrid","oa_url":"https://doi.org/10.1016/j.csl.2025.101923","any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5004014043","display_name":"Zohre Foroushi","orcid":"https://orcid.org/0000-0002-2801-7723"},"institutions":[{"id":"https://openalex.org/I67031392","display_name":"Carleton University","ror":"https://ror.org/02qtvee93","country_code":"CA","type":"education","lineage":["https://openalex.org/I67031392"]}],"countries":["CA"],"is_corresponding":true,"raw_author_name":"Z. Foroushi","raw_affiliation_strings":["Department of Systems and Computer Engineering, Carleton University, Ottawa, Ontario, Canada"],"raw_orcid":"https://orcid.org/0000-0002-2801-7723","affiliations":[{"raw_affiliation_string":"Department of Systems and Computer Engineering, Carleton University, Ottawa, Ontario, Canada","institution_ids":["https://openalex.org/I67031392"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5001546768","display_name":"Richard M. Dansereau","orcid":"https://orcid.org/0000-0002-3512-3647"},"institutions":[{"id":"https://openalex.org/I67031392","display_name":"Carleton University","ror":"https://ror.org/02qtvee93","country_code":"CA","type":"education","lineage":["https://openalex.org/I67031392"]}],"countries":["CA"],"is_corresponding":false,"raw_author_name":"R.M. Dansereau","raw_affiliation_strings":["Department of Systems and Computer Engineering, Carleton University, Ottawa, Ontario, Canada"],"raw_orcid":"https://orcid.org/0000-0002-3512-3647","affiliations":[{"raw_affiliation_string":"Department of Systems and Computer Engineering, Carleton University, Ottawa, Ontario, Canada","institution_ids":["https://openalex.org/I67031392"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":["https://openalex.org/A5004014043"],"corresponding_institution_ids":["https://openalex.org/I67031392"],"apc_list":{"value":3530,"currency":"USD","value_usd":3530},"apc_paid":{"value":3530,"currency":"USD","value_usd":3530},"fwci":1.6606,"has_fulltext":false,"cited_by_count":3,"citation_normalized_percentile":{"value":0.85319996,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":98,"max":99},"biblio":{"volume":"99","issue":null,"first_page":"101923","last_page":"101923"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9926000237464905,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9926000237464905,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10283","display_name":"Hearing Loss and Rehabilitation","score":0.003000000026077032,"subfield":{"id":"https://openalex.org/subfields/2805","display_name":"Cognitive Neuroscience"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},{"id":"https://openalex.org/T11165","display_name":"Image and Video Quality Assessment","score":0.0012000000569969416,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/speech-enhancement","display_name":"Speech enhancement","score":0.7677000164985657},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.5846999883651733},{"id":"https://openalex.org/keywords/intelligibility","display_name":"Intelligibility (philosophy)","score":0.5785999894142151},{"id":"https://openalex.org/keywords/sampling","display_name":"Sampling (signal processing)","score":0.40220001339912415},{"id":"https://openalex.org/keywords/autoencoder","display_name":"Autoencoder","score":0.36390000581741333},{"id":"https://openalex.org/keywords/pattern-recognition","display_name":"Pattern recognition (psychology)","score":0.3562999963760376},{"id":"https://openalex.org/keywords/noise-reduction","display_name":"Noise reduction","score":0.33660000562667847},{"id":"https://openalex.org/keywords/posterior-probability","display_name":"Posterior probability","score":0.33640000224113464}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8162000179290771},{"id":"https://openalex.org/C2776182073","wikidata":"https://www.wikidata.org/wiki/Q7575395","display_name":"Speech enhancement","level":3,"score":0.7677000164985657},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.5846999883651733},{"id":"https://openalex.org/C60048801","wikidata":"https://www.wikidata.org/wiki/Q1433889","display_name":"Intelligibility (philosophy)","level":2,"score":0.5785999894142151},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.46939998865127563},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4339999854564667},{"id":"https://openalex.org/C140779682","wikidata":"https://www.wikidata.org/wiki/Q210868","display_name":"Sampling (signal processing)","level":3,"score":0.40220001339912415},{"id":"https://openalex.org/C101738243","wikidata":"https://www.wikidata.org/wiki/Q786435","display_name":"Autoencoder","level":3,"score":0.36390000581741333},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.35740000009536743},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.3562999963760376},{"id":"https://openalex.org/C163294075","wikidata":"https://www.wikidata.org/wiki/Q581861","display_name":"Noise reduction","level":2,"score":0.33660000562667847},{"id":"https://openalex.org/C57830394","wikidata":"https://www.wikidata.org/wiki/Q278079","display_name":"Posterior probability","level":3,"score":0.33640000224113464},{"id":"https://openalex.org/C52740198","wikidata":"https://www.wikidata.org/wiki/Q1539564","display_name":"Importance sampling","level":3,"score":0.32030001282691956},{"id":"https://openalex.org/C2984842247","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep neural networks","level":3,"score":0.3125999867916107},{"id":"https://openalex.org/C19499675","wikidata":"https://www.wikidata.org/wiki/Q232207","display_name":"Monte Carlo method","level":2,"score":0.3091000020503998},{"id":"https://openalex.org/C29265498","wikidata":"https://www.wikidata.org/wiki/Q7047719","display_name":"Noise measurement","level":3,"score":0.30730000138282776},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.2867000102996826},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.2847000062465668},{"id":"https://openalex.org/C111350023","wikidata":"https://www.wikidata.org/wiki/Q1191869","display_name":"Markov chain Monte Carlo","level":3,"score":0.27570000290870667},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.27140000462532043},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.27079999446868896},{"id":"https://openalex.org/C115051666","wikidata":"https://www.wikidata.org/wiki/Q6522493","display_name":"Ranging","level":2,"score":0.2630999982357025},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.2630999982357025},{"id":"https://openalex.org/C165646398","wikidata":"https://www.wikidata.org/wiki/Q3755281","display_name":"Minimum-variance unbiased estimator","level":3,"score":0.25099998712539673}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1016/j.csl.2025.101923","is_oa":true,"landing_page_url":"https://doi.org/10.1016/j.csl.2025.101923","pdf_url":null,"source":{"id":"https://openalex.org/S91252481","display_name":"Computer Speech & Language","issn_l":"0885-2308","issn":["0885-2308","1095-8363"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310320990","host_organization_name":"Elsevier BV","host_organization_lineage":["https://openalex.org/P4310320990"],"host_organization_lineage_names":["Elsevier BV"],"type":"journal"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Computer Speech &amp; Language","raw_type":"journal-article"}],"best_oa_location":{"id":"doi:10.1016/j.csl.2025.101923","is_oa":true,"landing_page_url":"https://doi.org/10.1016/j.csl.2025.101923","pdf_url":null,"source":{"id":"https://openalex.org/S91252481","display_name":"Computer Speech & Language","issn_l":"0885-2308","issn":["0885-2308","1095-8363"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310320990","host_organization_name":"Elsevier BV","host_organization_lineage":["https://openalex.org/P4310320990"],"host_organization_lineage_names":["Elsevier BV"],"type":"journal"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Computer Speech &amp; Language","raw_type":"journal-article"},"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320334593","display_name":"Natural Sciences and Engineering Research Council of Canada","ror":"https://ror.org/01h531d29"}],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":21,"referenced_works":["https://openalex.org/W1556278552","https://openalex.org/W1968939597","https://openalex.org/W2013608223","https://openalex.org/W2015394094","https://openalex.org/W2044893557","https://openalex.org/W2051994388","https://openalex.org/W2069681747","https://openalex.org/W2082399300","https://openalex.org/W2121973264","https://openalex.org/W2128653836","https://openalex.org/W2141998673","https://openalex.org/W2962866211","https://openalex.org/W2965390715","https://openalex.org/W3136499730","https://openalex.org/W3147539069","https://openalex.org/W3153863622","https://openalex.org/W3174264304","https://openalex.org/W4205325493","https://openalex.org/W4380434618","https://openalex.org/W4390405852","https://openalex.org/W4403127009"],"related_works":[],"abstract_inverted_index":{"Recovering":[0],"intelligible":[1],"speech":[2,15,181],"in":[3,183],"noise":[4],"is":[5,28,65,76],"essential":[6],"for":[7,179],"robust":[8,180],"communication.":[9],"This":[10],"work":[11],"presents":[12],"an":[13,61],"audio-visual":[14],"enhancement":[16,151,182],"framework":[17],"based":[18],"on":[19],"a":[20,50],"Recurrent":[21],"Variational":[22],"Autoencoder":[23],"(AV-RVAE),":[24],"where":[25],"posterior":[26,177],"inference":[27,73],"extended":[29],"using":[30,78],"sampling-based":[31],"methods":[32],"including":[33],"the":[34,56,104,122,127,137,140,144,157,161,169],"Metropolis-Adjusted":[35],"Langevin":[36,39],"Algorithm":[37],"(MALA),":[38],"Dynamics":[40],"EM":[41],"(LDEM),":[42],"Hamiltonian":[43],"Monte":[44],"Carlo":[45],"(HMC),":[46],"Barker":[47],"sampling,":[48],"and":[49,67,72,89,103,133,150],"hybrid":[51,123],"MALA+Barker":[52,124,141],"variant.":[53],"To":[54],"isolate":[55],"contribution":[57],"of":[58,85,109,171],"visual":[59,172],"cues,":[60],"audio-only":[62,162],"baseline":[63],"(A-RVAE)":[64],"trained":[66],"evaluated":[68],"under":[69],"identical":[70],"data":[71],"conditions.":[74],"Performance":[75],"assessed":[77],"Scale-Invariant":[79],"Signal-to-Distortion":[80],"Ratio":[81],"(SI-SDR),":[82],"Perceptual":[83],"Evaluation":[84],"Speech":[86],"Quality":[87],"(PESQ),":[88],"Short-Time":[90],"Objective":[91],"Intelligibility":[92],"(STOI),":[93],"along":[94],"with":[95,175],"anytime":[96],"convergence":[97],"curves":[98],"(metric":[99],"versus":[100],"wall-clock":[101],"time)":[102],"Real-Time":[105],"Factor":[106],"(RTF;":[107],"ratio":[108],"runtime":[110],"to":[111,114],"audio":[112],"duration)":[113],"measure":[115],"computational":[116],"efficiency.":[117],"Experimental":[118],"results":[119],"show":[120],"that":[121],"sampler":[125,142],"achieves":[126],"best":[128],"overall":[129],"performance,":[130],"while":[131],"LDEM":[132],"step-size-optimized":[134],"MALA":[135],"exhibit":[136],"lowest":[138],"RTFs,":[139],"offers":[143],"most":[145],"favorable":[146],"balance":[147],"between":[148],"efficiency":[149],"quality.":[152],"Across":[153],"all":[154],"sampling":[155,178],"strategies,":[156],"AV-RVAE":[158],"consistently":[159],"surpasses":[160],"baseline,":[163],"particularly":[164],"at":[165],"low":[166],"SNRs,":[167],"confirming":[168],"benefit":[170],"fusion":[173],"combined":[174],"advanced":[176],"challenging":[184],"acoustic":[185],"environments.":[186]},"counts_by_year":[{"year":2026,"cited_by_count":3}],"updated_date":"2026-08-21T09:56:20.448147","created_date":"2025-12-06T00:00:00"}
