{"id":"https://openalex.org/W7165792695","doi":"https://doi.org/10.48550/arxiv.2606.24137","title":"Joint Learning of Covariance Estimation and White Noise Gain for Robust MVDR Beamforming","display_name":"Joint Learning of Covariance Estimation and White Noise Gain for Robust MVDR Beamforming","publication_year":2026,"publication_date":"2026-06-23","ids":{"openalex":"https://openalex.org/W7165792695","doi":"https://doi.org/10.48550/arxiv.2606.24137"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.24137","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.24137","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.24137","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5126493298","display_name":"Yongyi Deng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Deng, Yongyi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5008966430","display_name":"Hanchen Pei","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Pei, Hanchen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5085158197","display_name":"J Y","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ma, Jianbo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139261325","display_name":"Gongping Huang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Huang, Gongping","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139249629","display_name":"Jingdong Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Jingdong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139249614","display_name":"Jacob Benesty","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Benesty, Jacob","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.994700014591217,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.994700014591217,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10283","display_name":"Hearing Loss and Rehabilitation","score":0.0017999999690800905,"subfield":{"id":"https://openalex.org/subfields/2805","display_name":"Cognitive Neuroscience"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},{"id":"https://openalex.org/T11233","display_name":"Advanced Adaptive Filtering Techniques","score":0.0013000000035390258,"subfield":{"id":"https://openalex.org/subfields/2206","display_name":"Computational Mechanics"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/minimum-variance-unbiased-estimator","display_name":"Minimum-variance unbiased estimator","score":0.5835000276565552},{"id":"https://openalex.org/keywords/adaptive-beamformer","display_name":"Adaptive beamformer","score":0.5360999703407288},{"id":"https://openalex.org/keywords/beamforming","display_name":"Beamforming","score":0.534500002861023},{"id":"https://openalex.org/keywords/white-noise","display_name":"White noise","score":0.5070000290870667},{"id":"https://openalex.org/keywords/speech-enhancement","display_name":"Speech enhancement","score":0.48240000009536743},{"id":"https://openalex.org/keywords/covariance-matrix","display_name":"Covariance matrix","score":0.4607999920845032},{"id":"https://openalex.org/keywords/covariance","display_name":"Covariance","score":0.453000009059906},{"id":"https://openalex.org/keywords/noise","display_name":"Noise (video)","score":0.4442000091075897},{"id":"https://openalex.org/keywords/microphone-array","display_name":"Microphone array","score":0.41200000047683716},{"id":"https://openalex.org/keywords/subspace-topology","display_name":"Subspace topology","score":0.3953999876976013}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6669999957084656},{"id":"https://openalex.org/C165646398","wikidata":"https://www.wikidata.org/wiki/Q3755281","display_name":"Minimum-variance unbiased estimator","level":3,"score":0.5835000276565552},{"id":"https://openalex.org/C33378366","wikidata":"https://www.wikidata.org/wiki/Q4680719","display_name":"Adaptive beamformer","level":3,"score":0.5360999703407288},{"id":"https://openalex.org/C54197355","wikidata":"https://www.wikidata.org/wiki/Q5782992","display_name":"Beamforming","level":2,"score":0.534500002861023},{"id":"https://openalex.org/C112633086","wikidata":"https://www.wikidata.org/wiki/Q381287","display_name":"White noise","level":2,"score":0.5070000290870667},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.4982999861240387},{"id":"https://openalex.org/C2776182073","wikidata":"https://www.wikidata.org/wiki/Q7575395","display_name":"Speech enhancement","level":3,"score":0.48240000009536743},{"id":"https://openalex.org/C185142706","wikidata":"https://www.wikidata.org/wiki/Q1134404","display_name":"Covariance matrix","level":2,"score":0.4607999920845032},{"id":"https://openalex.org/C178650346","wikidata":"https://www.wikidata.org/wiki/Q201984","display_name":"Covariance","level":2,"score":0.453000009059906},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.4442000091075897},{"id":"https://openalex.org/C2778806681","wikidata":"https://www.wikidata.org/wiki/Q907293","display_name":"Microphone array","level":4,"score":0.41200000047683716},{"id":"https://openalex.org/C32834561","wikidata":"https://www.wikidata.org/wiki/Q660730","display_name":"Subspace topology","level":2,"score":0.3953999876976013},{"id":"https://openalex.org/C2778263558","wikidata":"https://www.wikidata.org/wiki/Q46384","display_name":"Microphone","level":3,"score":0.385699987411499},{"id":"https://openalex.org/C2776036281","wikidata":"https://www.wikidata.org/wiki/Q48769818","display_name":"Constraint (computer-aided design)","level":2,"score":0.38530001044273376},{"id":"https://openalex.org/C18555067","wikidata":"https://www.wikidata.org/wiki/Q8375051","display_name":"Joint (building)","level":2,"score":0.37279999256134033},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.37119999527931213},{"id":"https://openalex.org/C130367717","wikidata":"https://www.wikidata.org/wiki/Q189791","display_name":"Diagonal","level":2,"score":0.3700000047683716},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.353300005197525},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.3531999886035919},{"id":"https://openalex.org/C60048801","wikidata":"https://www.wikidata.org/wiki/Q1433889","display_name":"Intelligibility (philosophy)","level":2,"score":0.34619998931884766},{"id":"https://openalex.org/C117251300","wikidata":"https://www.wikidata.org/wiki/Q1849855","display_name":"Parametric statistics","level":2,"score":0.3377000093460083},{"id":"https://openalex.org/C100675267","wikidata":"https://www.wikidata.org/wiki/Q1371624","display_name":"Background noise","level":2,"score":0.3370000123977661},{"id":"https://openalex.org/C29265498","wikidata":"https://www.wikidata.org/wiki/Q7047719","display_name":"Noise measurement","level":3,"score":0.33090001344680786},{"id":"https://openalex.org/C114996537","wikidata":"https://www.wikidata.org/wiki/Q4854529","display_name":"Colors of noise","level":3,"score":0.3224000036716461},{"id":"https://openalex.org/C95851461","wikidata":"https://www.wikidata.org/wiki/Q468809","display_name":"Reverberation","level":2,"score":0.31869998574256897},{"id":"https://openalex.org/C167928553","wikidata":"https://www.wikidata.org/wiki/Q1376021","display_name":"Estimation theory","level":2,"score":0.3100999891757965},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.30869999527931213},{"id":"https://openalex.org/C4199805","wikidata":"https://www.wikidata.org/wiki/Q2725903","display_name":"Gaussian noise","level":2,"score":0.28349998593330383},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.2775999903678894},{"id":"https://openalex.org/C159877910","wikidata":"https://www.wikidata.org/wiki/Q2202883","display_name":"Autoregressive model","level":2,"score":0.27480000257492065},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.2655999958515167},{"id":"https://openalex.org/C36922181","wikidata":"https://www.wikidata.org/wiki/Q7047650","display_name":"Noise-canceling microphone","level":5,"score":0.260699987411499},{"id":"https://openalex.org/C172051844","wikidata":"https://www.wikidata.org/wiki/Q5280438","display_name":"Direction of arrival","level":3,"score":0.25839999318122864}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.24137","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.24137","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.24137","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.24137","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"The":[0,76],"minimum":[1],"variance":[2],"distortionless":[3],"response":[4],"(MVDR)":[5],"beamformer":[6],"is":[7,27,101],"widely":[8],"used":[9],"for":[10,84],"multichannel":[11],"speech":[12,114],"enhancement":[13],"due":[14],"to":[15,29,49],"strong":[16],"noise":[17,82],"suppression":[18],"while":[19],"preserving":[20],"target":[21],"signals.":[22],"In":[23],"practice,":[24],"its":[25],"performance":[26,51],"sensitive":[28],"microphone":[30],"self-noise":[31],"and":[32,87,116],"array":[33],"mismatches.":[34],"Existing":[35],"approaches":[36],"typically":[37],"rely":[38],"on":[39],"fixed,":[40],"manually":[41],"tuned":[42],"WNG":[43,69,90],"thresholds":[44],"or":[45,54],"diagonal":[46],"loading,":[47],"leading":[48],"suboptimal":[50],"under":[52],"unknown":[53],"time-varying":[55],"acoustic":[56],"conditions.":[57],"This":[58],"paper":[59],"proposes":[60],"a":[61,72,80,88],"data-driven":[62],"MVDR":[63,99,121],"framework":[64],"that":[65],"adaptively":[66],"estimates":[67],"the":[68,104],"constraint":[70],"using":[71],"deep":[73],"neural":[74],"network.":[75],"network":[77],"jointly":[78],"predicts":[79],"time-frequency":[81],"mask":[83],"covariance":[85],"estimation":[86],"frequency-dependent":[89],"threshold,":[91],"enabling":[92],"dynamic":[93],"robustness-directivity":[94],"control.":[95],"A":[96],"differentiable":[97],"robust":[98],"layer":[100],"integrated":[102],"into":[103],"framework,":[105],"allowing":[106],"end-to-end":[107],"optimization.":[108],"Experiments":[109],"demonstrate":[110],"consistent":[111],"improvements":[112],"in":[113],"quality":[115],"intelligibility":[117],"over":[118],"conventional":[119],"fixed-WNG":[120],"methods.":[122]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-25T00:00:00"}
