{"id":"https://openalex.org/W7154274969","doi":"https://doi.org/10.48550/arxiv.2604.10542","title":"VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories","display_name":"VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories","publication_year":2026,"publication_date":"2026-04-12","ids":{"openalex":"https://openalex.org/W7154274969","doi":"https://doi.org/10.48550/arxiv.2604.10542"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.10542","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.10542","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.10542","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5133626072","display_name":"Qian Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Qian","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5101983011","display_name":"Yuqin Cao","orcid":"https://orcid.org/0000-0002-5087-6559"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cao, Yuqin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5133598681","display_name":"Yixuan Gao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Gao, Yixuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5133602216","display_name":"Xiongkuo Min","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Min, Xiongkuo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T13310","display_name":"Subtitles and Audiovisual Media","score":0.21979999542236328,"subfield":{"id":"https://openalex.org/subfields/1203","display_name":"Language and Linguistics"},"field":{"id":"https://openalex.org/fields/12","display_name":"Arts and Humanities"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},"topics":[{"id":"https://openalex.org/T13310","display_name":"Subtitles and Audiovisual Media","score":0.21979999542236328,"subfield":{"id":"https://openalex.org/subfields/1203","display_name":"Language and Linguistics"},"field":{"id":"https://openalex.org/fields/12","display_name":"Arts and Humanities"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.17219999432563782,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.11400000005960464,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/benchmarking","display_name":"Benchmarking","score":0.5608000159263611},{"id":"https://openalex.org/keywords/consistency","display_name":"Consistency (knowledge bases)","score":0.5138000249862671},{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.4587000012397766},{"id":"https://openalex.org/keywords/benchmark","display_name":"Benchmark (surveying)","score":0.4341999888420105},{"id":"https://openalex.org/keywords/audio-signal-processing","display_name":"Audio signal processing","score":0.3411000072956085},{"id":"https://openalex.org/keywords/sound-production","display_name":"Sound production","score":0.325300008058548}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5932999849319458},{"id":"https://openalex.org/C86251818","wikidata":"https://www.wikidata.org/wiki/Q816754","display_name":"Benchmarking","level":2,"score":0.5608000159263611},{"id":"https://openalex.org/C2776436953","wikidata":"https://www.wikidata.org/wiki/Q5163215","display_name":"Consistency (knowledge bases)","level":2,"score":0.5138000249862671},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.4587000012397766},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.4341999888420105},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.3815000057220459},{"id":"https://openalex.org/C127220857","wikidata":"https://www.wikidata.org/wiki/Q2719318","display_name":"Audio signal processing","level":4,"score":0.3411000072956085},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3328000009059906},{"id":"https://openalex.org/C2992428333","wikidata":"https://www.wikidata.org/wiki/Q11461","display_name":"Sound production","level":2,"score":0.325300008058548},{"id":"https://openalex.org/C44819458","wikidata":"https://www.wikidata.org/wiki/Q27939","display_name":"Singing","level":2,"score":0.30730000138282776},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.30410000681877136},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.288100004196167},{"id":"https://openalex.org/C36464697","wikidata":"https://www.wikidata.org/wiki/Q451553","display_name":"Visualization","level":2,"score":0.28119999170303345},{"id":"https://openalex.org/C34951282","wikidata":"https://www.wikidata.org/wiki/Q864191","display_name":"Bioacoustics","level":2,"score":0.2700999975204468},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.25870001316070557}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.10542","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.10542","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.10542","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.10542","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.7107477784156799,"display_name":"Quality Education","id":"https://metadata.un.org/sdg/4"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Video-to-Audio":[0],"(V2A)":[1],"generation":[2,86],"is":[3],"essential":[4],"for":[5,43,182],"immersive":[6],"multimedia":[7],"experiences,":[8],"yet":[9],"its":[10],"evaluation":[11,45],"remains":[12],"underexplored.":[13],"Existing":[14],"benchmarks":[15,83],"typically":[16],"assess":[17,99],"diverse":[18],"audio":[19,31,57,100,170,192],"types":[20],"under":[21,67],"a":[22,40,145,177],"unified":[23],"protocol,":[24],"overlooking":[25],"the":[26,164,168],"fine-grained":[27],"requirements":[28],"of":[29,166],"distinct":[30],"categories.":[32],"To":[33],"address":[34],"this":[35],"gap,":[36],"we":[37],"propose":[38],"VidAudio-Bench,":[39],"multi-task":[41],"benchmark":[42],"V2A":[44,69,128,184],"with":[46,120],"four":[47,55],"key":[48],"features:":[49],"(1)":[50],"Broad":[51],"Coverage:":[52],"It":[53,77,91,110],"encompasses":[54],"representative":[56],"categories":[58],"-":[59,66],"sound":[60,138],"effects,":[61],"music,":[62],"speech,":[63],"and":[64,70,82,104,134,151,179,186],"singing":[65,135],"both":[68],"Video-Text-to-Audio":[71],"(VT2A)":[72],"settings.":[73],"(2)":[74],"Extensive":[75],"Evaluation:":[76],"comprises":[78],"1,634":[79],"video-text":[80],"pairs":[81],"11":[84],"state-of-the-art":[85],"models.":[87],"(3)":[88],"Comprehensive":[89],"Metrics:":[90],"introduces":[92],"13":[93],"task-specific,":[94],"reference-free":[95],"metrics":[96,113],"to":[97,137],"systematically":[98],"quality,":[101],"video-audio":[102,159],"consistency,":[103],"text-audio":[105],"consistency.":[106],"(4)":[107],"Human":[108],"Alignment:":[109],"validates":[111],"all":[112],"through":[114],"subjective":[115],"studies,":[116],"demonstrating":[117],"strong":[118],"consistency":[119],"human":[121],"preferences.":[122],"Experimental":[123],"results":[124,142],"reveal":[125],"that":[126],"current":[127],"models":[129],"perform":[130],"poorly":[131],"in":[132],"speech":[133],"compared":[136],"effects.":[139],"Our":[140],"VT2A":[141],"further":[143],"highlight":[144],"fundamental":[146],"tension":[147],"between":[148],"instruction":[149],"following":[150],"visually":[152],"grounded":[153],"generation:":[154],"stronger":[155],"visual":[156],"conditioning":[157],"improves":[158],"alignment,":[160],"but":[161],"often":[162],"at":[163],"cost":[165],"generating":[167],"intended":[169],"category.":[171],"These":[172],"findings":[173],"establish":[174],"VidAudio-Bench":[175],"as":[176],"comprehensive":[178],"scalable":[180],"framework":[181],"diagnosing":[183],"systems":[185],"provide":[187],"new":[188],"insights":[189],"into":[190],"multimodal":[191],"generation.":[193]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-04-15T00:00:00"}
