{"id":"https://openalex.org/W7166871161","doi":"https://doi.org/10.18653/v1/2026.findings-acl.235","title":"DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding","display_name":"DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166871161","doi":"https://doi.org/10.18653/v1/2026.findings-acl.235"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.findings-acl.235","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.235","pdf_url":"https://aclanthology.org/2026.findings-acl.235.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.findings-acl.235.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139751239","display_name":"Jiaming Zhou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jiaming Zhou","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139753533","display_name":"Xuxin Cheng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xuxin Cheng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139759611","display_name":"Shiwan Zhao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shiwan Zhao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139843692","display_name":"Yuhang Jia","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yuhang Jia","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5124760555","display_name":"Cao Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cao Liu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139839379","display_name":"Ke Zeng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ke Zeng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139817245","display_name":"Xunliang Cai","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xunliang Cai","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139723216","display_name":"Yong Qin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yong Qin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.87015069,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"4789","last_page":"4805"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.49540001153945923,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.49540001153945923,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.2540000081062317,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.07039999961853027,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.3833000063896179},{"id":"https://openalex.org/keywords/diffusion","display_name":"Diffusion","score":0.35510000586509705},{"id":"https://openalex.org/keywords/field","display_name":"Field (mathematics)","score":0.34929999709129333},{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.2718000113964081},{"id":"https://openalex.org/keywords/feature","display_name":"Feature (linguistics)","score":0.26930001378059387}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6430000066757202},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.40849998593330383},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.3833000063896179},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.3727000057697296},{"id":"https://openalex.org/C69357855","wikidata":"https://www.wikidata.org/wiki/Q163214","display_name":"Diffusion","level":2,"score":0.35510000586509705},{"id":"https://openalex.org/C9652623","wikidata":"https://www.wikidata.org/wiki/Q190109","display_name":"Field (mathematics)","level":2,"score":0.34929999709129333},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.2718000113964081},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.26930001378059387},{"id":"https://openalex.org/C41895202","wikidata":"https://www.wikidata.org/wiki/Q8162","display_name":"Linguistics","level":1,"score":0.26109999418258667},{"id":"https://openalex.org/C12713177","wikidata":"https://www.wikidata.org/wiki/Q1900281","display_name":"Perspective (graphical)","level":2,"score":0.258899986743927},{"id":"https://openalex.org/C179603123","wikidata":"https://www.wikidata.org/wiki/Q1941921","display_name":"Modeling language","level":3,"score":0.2549000084400177},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.2540999948978424},{"id":"https://openalex.org/C61797465","wikidata":"https://www.wikidata.org/wiki/Q1188986","display_name":"Term (time)","level":2,"score":0.2526000142097473}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.findings-acl.235","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.235","pdf_url":"https://aclanthology.org/2026.findings-acl.235.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.findings-acl.235","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.235","pdf_url":"https://aclanthology.org/2026.findings-acl.235.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320306076","display_name":"National Science Foundation","ror":"https://ror.org/021nxhr62"}],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166871161.pdf","grobid_xml":"https://content.openalex.org/works/W7166871161.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Autoregressive":[0],"(AR)":[1],"large":[2,34],"audio":[3,14,68,96,165],"language":[4,35],"models":[5,36],"(LALMs)":[6],"such":[7],"as":[8],"Qwen-2.5-Omnihave":[9],"achieved":[10],"strong":[11,149],"performance":[12],"on":[13,53,133],"understanding":[15,69],"and":[16,25,27,50,105,108,118,124,136,145],"interaction,":[17],"but":[18],"scaling":[19],"them":[20],"remains":[21],"costly":[22],"in":[23],"data":[24],"computation,":[26],"strictly":[28],"sequential":[29],"decoding":[30,86],"limits":[31],"inference":[32],"efficiency.Diffusion":[33],"(dLLMs)":[37],"have":[38],"recently":[39],"been":[40],"shown":[41],"to":[42,148],"make":[43],"effective":[44],"use":[45],"of":[46],"limited":[47],"training":[48,154],"data,":[49],"prior":[51],"work":[52],"DIFFA":[54,144],"indicates":[55],"that":[56,115,139],"replacing":[57],"an":[58],"AR":[59,150],"backbone":[60,162],"with":[61,111],"a":[62,75,90,112,160],"diffusion":[63],"counterpart":[64],"can":[65],"substantially":[66],"improve":[67],"under":[70,152],"matched":[71],"settings,":[72],"albeit":[73],"at":[74],"proof-of-concept":[76],"scale":[77],"without":[78],"large-scale":[79,121,164],"instruction":[80],"tuning,":[81],"preference":[82,126],"alignment,":[83,120],"or":[84],"practical":[85,91,153],"schemes.We":[87],"introduce":[88],"DIFFA-2,":[89],"diffusion-based":[92,157],"LALM":[93],"for":[94,163],"general":[95],"understanding.DIFFA-2":[97],"upgrades":[98],"the":[99],"speech":[100],"encoder,":[101],"employs":[102],"dual":[103],"semantic":[104,117],"acoustic":[106,119],"adapters,":[107],"is":[109,146,159],"trained":[110],"four-stage":[113],"curriculum":[114],"combines":[116],"supervised":[122],"fine-tuning,":[123],"variance-reduced":[125],"optimization,":[127],"using":[128],"only":[129],"fully":[130],"open-source":[131],"corpora.Experiments":[132],"MMSU,":[134],"MMAU,":[135],"MMAR":[137],"show":[138],"DIFFA-2":[140],"consistently":[141],"improves":[142],"over":[143],"competitive":[147],"LALMs":[151],"budgets,":[155],"supporting":[156],"modeling":[158],"viable":[161],"understanding.":[166]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-07-02T00:00:00"}
