{"id":"https://openalex.org/W7166723330","doi":"https://doi.org/10.48550/arxiv.2606.29632","title":"VIB-AVSR: Variational Information Bottleneck for Noise-Robust LLM-Based Audio-Visual Speech Recognition","display_name":"VIB-AVSR: Variational Information Bottleneck for Noise-Robust LLM-Based Audio-Visual Speech Recognition","publication_year":2026,"publication_date":"2026-06-28","ids":{"openalex":"https://openalex.org/W7166723330","doi":"https://doi.org/10.48550/arxiv.2606.29632"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.29632","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.29632","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.29632","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139674930","display_name":"Piyush Arora","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Arora, Piyush","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5021592435","display_name":"Navlika Singh","orcid":"https://orcid.org/0000-0003-1098-3365"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Singh, Navlika","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5043797502","display_name":"Umberto Cappellazzo","orcid":"https://orcid.org/0009-0006-3443-5143"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cappellazzo, Umberto","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5009475700","display_name":"Stavros Petridis","orcid":"https://orcid.org/0000-0001-7478-9479"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Petridis, Stavros","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5016033078","display_name":"Maja Panti\u0107","orcid":"https://orcid.org/0000-0002-3620-5986"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Pantic, Maja","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.991599977016449,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.991599977016449,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10283","display_name":"Hearing Loss and Rehabilitation","score":0.00139999995008111,"subfield":{"id":"https://openalex.org/subfields/2805","display_name":"Cognitive Neuroscience"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},{"id":"https://openalex.org/T11448","display_name":"Face recognition and analysis","score":0.0012000000569969416,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/bottleneck","display_name":"Bottleneck","score":0.7710999846458435},{"id":"https://openalex.org/keywords/encoder","display_name":"Encoder","score":0.6061000227928162},{"id":"https://openalex.org/keywords/degradation","display_name":"Degradation (telecommunications)","score":0.541700005531311},{"id":"https://openalex.org/keywords/noise","display_name":"Noise (video)","score":0.5098000168800354},{"id":"https://openalex.org/keywords/information-bottleneck-method","display_name":"Information bottleneck method","score":0.44359999895095825},{"id":"https://openalex.org/keywords/speaker-recognition","display_name":"Speaker recognition","score":0.44029998779296875},{"id":"https://openalex.org/keywords/voice-activity-detection","display_name":"Voice activity detection","score":0.42910000681877136},{"id":"https://openalex.org/keywords/robustness","display_name":"Robustness (evolution)","score":0.42089998722076416},{"id":"https://openalex.org/keywords/speech-processing","display_name":"Speech processing","score":0.387800008058548}],"concepts":[{"id":"https://openalex.org/C2780513914","wikidata":"https://www.wikidata.org/wiki/Q18210350","display_name":"Bottleneck","level":2,"score":0.7710999846458435},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.748199999332428},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6837000250816345},{"id":"https://openalex.org/C118505674","wikidata":"https://www.wikidata.org/wiki/Q42586063","display_name":"Encoder","level":2,"score":0.6061000227928162},{"id":"https://openalex.org/C2779679103","wikidata":"https://www.wikidata.org/wiki/Q5251805","display_name":"Degradation (telecommunications)","level":2,"score":0.541700005531311},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.5098000168800354},{"id":"https://openalex.org/C60008888","wikidata":"https://www.wikidata.org/wiki/Q6031013","display_name":"Information bottleneck method","level":3,"score":0.44359999895095825},{"id":"https://openalex.org/C133892786","wikidata":"https://www.wikidata.org/wiki/Q1145189","display_name":"Speaker recognition","level":2,"score":0.44029998779296875},{"id":"https://openalex.org/C204201278","wikidata":"https://www.wikidata.org/wiki/Q1332614","display_name":"Voice activity detection","level":3,"score":0.42910000681877136},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4237000048160553},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.42089998722076416},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.387800008058548},{"id":"https://openalex.org/C57273362","wikidata":"https://www.wikidata.org/wiki/Q576722","display_name":"Decoding methods","level":2,"score":0.38659998774528503},{"id":"https://openalex.org/C13895895","wikidata":"https://www.wikidata.org/wiki/Q3270773","display_name":"Speech coding","level":2,"score":0.3716000020503998},{"id":"https://openalex.org/C89611455","wikidata":"https://www.wikidata.org/wiki/Q6804646","display_name":"Mechanism (biology)","level":2,"score":0.3569999933242798},{"id":"https://openalex.org/C100675267","wikidata":"https://www.wikidata.org/wiki/Q1371624","display_name":"Background noise","level":2,"score":0.33640000224113464},{"id":"https://openalex.org/C3017588708","wikidata":"https://www.wikidata.org/wiki/Q758901","display_name":"Audio visual","level":2,"score":0.32359999418258667},{"id":"https://openalex.org/C2776182073","wikidata":"https://www.wikidata.org/wiki/Q7575395","display_name":"Speech enhancement","level":3,"score":0.3075999915599823},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.2962000072002411},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.2944999933242798},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.29350000619888306},{"id":"https://openalex.org/C23224414","wikidata":"https://www.wikidata.org/wiki/Q176769","display_name":"Hidden Markov model","level":2,"score":0.2912999987602234},{"id":"https://openalex.org/C12713177","wikidata":"https://www.wikidata.org/wiki/Q1900281","display_name":"Perspective (graphical)","level":2,"score":0.27079999446868896},{"id":"https://openalex.org/C52622258","wikidata":"https://www.wikidata.org/wiki/Q131222","display_name":"Information theory","level":2,"score":0.263700008392334},{"id":"https://openalex.org/C29265498","wikidata":"https://www.wikidata.org/wiki/Q7047719","display_name":"Noise measurement","level":3,"score":0.2574000060558319},{"id":"https://openalex.org/C163294075","wikidata":"https://www.wikidata.org/wiki/Q581861","display_name":"Noise reduction","level":2,"score":0.2535000145435333}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.29632","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.29632","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.29632","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.29632","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Audio-Visual":[0],"Speech":[1],"Recognition":[2],"takes":[3],"two":[4],"input":[5],"modalities,":[6],"acoustic":[7,55],"and":[8,119],"visual":[9,12],"streams,":[10],"where":[11],"information":[13],"from":[14],"lip":[15],"movements":[16],"aids":[17],"recognition":[18],"when":[19],"audio":[20],"is":[21,71],"noisy.":[22],"Recently,":[23],"LLM-based":[24],"AVSR":[25],"models":[26,49],"have":[27],"emerged":[28],"as":[29],"a":[30],"promising":[31],"paradigm":[32],"by":[33],"connecting":[34],"pre-trained":[35],"audio-visual":[36],"encoders":[37],"to":[38,60,66,73,81,106],"an":[39],"LLM,":[40],"achieving":[41],"strong":[42],"results":[43],"in":[44,84],"clean":[45,54],"conditions.":[46],"However,":[47],"these":[48],"are":[50],"predominantly":[51],"optimized":[52],"for":[53],"conditions,":[56],"with":[57],"limited":[58],"attention":[59],"making":[61],"the":[62,103],"LLM":[63,104],"backbone":[64,105],"robust":[65],"noise.":[67],"No":[68],"explicit":[69],"mechanism":[70],"employed":[72],"produce":[74],"stable":[75],"representations":[76],"under":[77,112],"corrupted":[78],"audio,":[79],"leading":[80],"performance":[82],"degradation":[83,111],"noisy":[85,113],"environments.":[86],"To":[87],"address":[88],"this,":[89],"we":[90],"propose":[91],"VIB-AVSR,":[92],"which":[93],"integrates":[94],"Variational":[95],"Information":[96],"Bottleneck":[97],"layers":[98],"at":[99],"targeted":[100],"positions":[101],"within":[102],"regularize":[107],"representations.":[108],"VIB-AVSR":[109],"reduces":[110],"conditions":[114],"across":[115],"multiple":[116],"SNR":[117],"levels":[118],"noise":[120],"types,":[121],"without":[122],"requiring":[123],"architectural":[124],"modifications":[125],"or":[126],"additional":[127],"training":[128],"data.":[129]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-07-01T00:00:00"}
