{"id":"https://openalex.org/W7165678770","doi":"https://doi.org/10.48550/arxiv.2606.23080","title":"AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation","display_name":"AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation","publication_year":2026,"publication_date":"2026-06-22","ids":{"openalex":"https://openalex.org/W7165678770","doi":"https://doi.org/10.48550/arxiv.2606.23080"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.23080","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.23080","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.23080","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139208689","display_name":"Huadai Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Huadai","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5054339696","display_name":"Kaicheng Luo","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Luo, Kaicheng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139135086","display_name":"Wen Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Wen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139128824","display_name":"Qian Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Qian","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139210521","display_name":"Bin Ma","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ma, Bin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139135119","display_name":"Xiangang Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Xiangang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139157665","display_name":"Wei Xue","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xue, Wei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.16040000319480896,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.16040000319480896,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10775","display_name":"Generative Adversarial Networks and Image Synthesis","score":0.1454000025987625,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11349","display_name":"Music Technology and Sound Studies","score":0.1404999941587448,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.5187000036239624},{"id":"https://openalex.org/keywords/autoregressive-model","display_name":"Autoregressive model","score":0.4767000079154968},{"id":"https://openalex.org/keywords/softmax-function","display_name":"Softmax function","score":0.43320000171661377},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.39989998936653137},{"id":"https://openalex.org/keywords/semantics","display_name":"Semantics (computer science)","score":0.38999998569488525},{"id":"https://openalex.org/keywords/probabilistic-logic","display_name":"Probabilistic logic","score":0.3495999872684479},{"id":"https://openalex.org/keywords/overhead","display_name":"Overhead (engineering)","score":0.34790000319480896},{"id":"https://openalex.org/keywords/natural-language-generation","display_name":"Natural language generation","score":0.34630000591278076}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7821999788284302},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.613099992275238},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.5187000036239624},{"id":"https://openalex.org/C159877910","wikidata":"https://www.wikidata.org/wiki/Q2202883","display_name":"Autoregressive model","level":2,"score":0.4767000079154968},{"id":"https://openalex.org/C188441871","wikidata":"https://www.wikidata.org/wiki/Q7554146","display_name":"Softmax function","level":3,"score":0.43320000171661377},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.39989998936653137},{"id":"https://openalex.org/C184337299","wikidata":"https://www.wikidata.org/wiki/Q1437428","display_name":"Semantics (computer science)","level":2,"score":0.38999998569488525},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.38199999928474426},{"id":"https://openalex.org/C49937458","wikidata":"https://www.wikidata.org/wiki/Q2599292","display_name":"Probabilistic logic","level":2,"score":0.3495999872684479},{"id":"https://openalex.org/C2779960059","wikidata":"https://www.wikidata.org/wiki/Q7113681","display_name":"Overhead (engineering)","level":2,"score":0.34790000319480896},{"id":"https://openalex.org/C2776187449","wikidata":"https://www.wikidata.org/wiki/Q1513879","display_name":"Natural language generation","level":3,"score":0.34630000591278076},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.33219999074935913},{"id":"https://openalex.org/C8521452","wikidata":"https://www.wikidata.org/wiki/Q203790","display_name":"Connectionism","level":3,"score":0.32030001282691956},{"id":"https://openalex.org/C113364801","wikidata":"https://www.wikidata.org/wiki/Q26674","display_name":"High fidelity","level":2,"score":0.29899999499320984},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.29679998755455017},{"id":"https://openalex.org/C155512373","wikidata":"https://www.wikidata.org/wiki/Q287450","display_name":"Residual","level":2,"score":0.28859999775886536},{"id":"https://openalex.org/C127220857","wikidata":"https://www.wikidata.org/wiki/Q2719318","display_name":"Audio signal processing","level":4,"score":0.2856999933719635},{"id":"https://openalex.org/C173853756","wikidata":"https://www.wikidata.org/wiki/Q86915","display_name":"Dialog box","level":2,"score":0.27630001306533813},{"id":"https://openalex.org/C64922751","wikidata":"https://www.wikidata.org/wiki/Q4650799","display_name":"Audio signal","level":3,"score":0.27379998564720154},{"id":"https://openalex.org/C160372630","wikidata":"https://www.wikidata.org/wiki/Q4819855","display_name":"Audio analyzer","level":5,"score":0.2736000120639801},{"id":"https://openalex.org/C2776416436","wikidata":"https://www.wikidata.org/wiki/Q3751781","display_name":"Domino","level":3,"score":0.2728999853134155},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.2696000039577484}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.23080","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.23080","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.23080","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.23080","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","score":0.5147202610969543,"id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Unifying":[0],"speech,":[1,189],"sound,":[2,190],"and":[3,19,67,95,102,109,121,146,163,183,191],"music":[4,103,122,164,192],"generation":[5,38,81,193],"in":[6],"one":[7],"model":[8],"is":[9],"hindered":[10],"by":[11],"tradeoffs":[12],"between":[13],"fidelity,":[14],"end-to-end":[15],"training,":[16],"in-context":[17],"conditioning,":[18],"variable-length":[20],"synthesis":[21],"that":[22,40,135,178],"no":[23,169],"current":[24],"paradigm":[25],"fully":[26],"resolves.":[27],"To":[28],"address":[29,125],"this":[30,126],"challenge,":[31],"we":[32],"present":[33],"AudioCALM,":[34],"a":[35,53,68,131,141,147,155],"universal":[36],"audio":[37,51,80],"framework":[39],"extends":[41],"autoregressive":[42],"(AR)":[43],"next-token":[44],"prediction":[45],"from":[46],"discrete":[47],"tokens":[48],"to":[49,60,91],"continuous":[50],"latents:":[52],"thin":[54],"flow-matching":[55],"head":[56],"replaces":[57],"the":[58,116,166],"softmax":[59],"predict":[61],"rectified-flow":[62],"velocities":[63],"at":[64,128],"each":[65],"position,":[66],"block-causal":[69],"AR-Flow":[70],"attention":[71],"pattern":[72],"produces":[73],"arbitrary-length":[74],"output.":[75],"Joint":[76],"training":[77],"of":[78],"multiple":[79],"tasks":[82,139],"faces":[83],"an":[84],"asymmetric":[85],"text--audio":[86],"mismatch:":[87],"speech":[88,160],"transcripts":[89],"align":[90],"specific":[92],"time":[93],"spans":[94],"demand":[96],"tight,":[97],"time-aligned":[98],"attention,":[99],"whereas":[100],"sound":[101,120,162],"captions":[104],"describe":[105],"only":[106],"overall":[107],"semantics":[108],"rely":[110],"on":[111,172,188],"diffuse,":[112],"holistic":[113],"attention;":[114],"mixing":[115],"two":[117,129],"disproportionately":[118],"degrades":[119],"generation.":[123],"We":[124],"asymmetry":[127],"levels:":[130],"data":[132],"reformulation":[133],"strategy":[134],"unifies":[136],"all":[137],"three":[138],"under":[140],"single":[142],"description-style":[143],"conditioning":[144],"interface,":[145],"novel":[148],"architecture":[149],"Asymmetric":[150],"Mixture-of-Modality-Experts":[151],"(A-MoME),":[152],"which":[153],"adds":[154],"dedicated":[156],"residual":[157],"expert":[158],"for":[159],"while":[161],"share":[165],"backbone,":[167],"incurring":[168],"inference":[170],"overhead":[171],"non-speech":[173],"inputs.":[174],"Experimental":[175],"results":[176],"demonstrate":[177],"AudioCALM":[179],"matches":[180],"modality-specific":[181],"state-of-the-art":[182],"outperforms":[184],"prior":[185],"unified":[186],"baselines":[187],"benchmarks.":[194]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-06-24T00:00:00"}
