{"id":"https://openalex.org/W4392903177","doi":"https://doi.org/10.1109/icassp48485.2024.10447246","title":"Audiosr: Versatile Audio Super-Resolution at Scale","display_name":"Audiosr: Versatile Audio Super-Resolution at Scale","publication_year":2024,"publication_date":"2024-03-18","ids":{"openalex":"https://openalex.org/W4392903177","doi":"https://doi.org/10.1109/icassp48485.2024.10447246"},"language":"en","primary_location":{"id":"doi:10.1109/icassp48485.2024.10447246","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp48485.2024.10447246","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5089924305","display_name":"Haohe Liu","orcid":"https://orcid.org/0000-0003-1036-7888"},"institutions":[{"id":"https://openalex.org/I28290843","display_name":"University of Surrey","ror":"https://ror.org/00ks66431","country_code":"GB","type":"education","lineage":["https://openalex.org/I28290843"]},{"id":"https://openalex.org/I4210121626","display_name":"Signal Processing (United States)","ror":"https://ror.org/021gzyw51","country_code":"US","type":"company","lineage":["https://openalex.org/I4210121626"]}],"countries":["GB","US"],"is_corresponding":false,"raw_author_name":"Haohe Liu","raw_affiliation_strings":["University of Surrey,Centre for Vision Speech and Signal Processing","Centre for Vision Speech and Signal Processing, University of Surrey"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Surrey,Centre for Vision Speech and Signal Processing","institution_ids":["https://openalex.org/I28290843"]},{"raw_affiliation_string":"Centre for Vision Speech and Signal Processing, University of Surrey","institution_ids":["https://openalex.org/I28290843","https://openalex.org/I4210121626"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5100451980","display_name":"Ke Chen","orcid":"https://orcid.org/0000-0001-8357-3741"},"institutions":[{"id":"https://openalex.org/I36258959","display_name":"University of California San Diego","ror":"https://ror.org/0168r3w48","country_code":"US","type":"education","lineage":["https://openalex.org/I36258959"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Ke Chen","raw_affiliation_strings":["University of California San Diego"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of California San Diego","institution_ids":["https://openalex.org/I36258959"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5103162279","display_name":"Qiao Tian","orcid":"https://orcid.org/0000-0002-4078-1273"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Qiao Tian","raw_affiliation_strings":["ByteDance,Speech, Audio &amp; Music Intelligence (SAMI)"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"ByteDance,Speech, Audio &amp; Music Intelligence (SAMI)","institution_ids":[]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5100676721","display_name":"Wenwu Wang","orcid":"https://orcid.org/0000-0002-8393-5703"},"institutions":[{"id":"https://openalex.org/I28290843","display_name":"University of Surrey","ror":"https://ror.org/00ks66431","country_code":"GB","type":"education","lineage":["https://openalex.org/I28290843"]},{"id":"https://openalex.org/I4210121626","display_name":"Signal Processing (United States)","ror":"https://ror.org/021gzyw51","country_code":"US","type":"company","lineage":["https://openalex.org/I4210121626"]}],"countries":["GB","US"],"is_corresponding":false,"raw_author_name":"Wenwu Wang","raw_affiliation_strings":["University of Surrey,Centre for Vision Speech and Signal Processing","Centre for Vision Speech and Signal Processing, University of Surrey"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Surrey,Centre for Vision Speech and Signal Processing","institution_ids":["https://openalex.org/I28290843"]},{"raw_affiliation_string":"Centre for Vision Speech and Signal Processing, University of Surrey","institution_ids":["https://openalex.org/I28290843","https://openalex.org/I4210121626"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5066967599","display_name":"Mark D. Plumbley","orcid":"https://orcid.org/0000-0002-9708-1075"},"institutions":[{"id":"https://openalex.org/I28290843","display_name":"University of Surrey","ror":"https://ror.org/00ks66431","country_code":"GB","type":"education","lineage":["https://openalex.org/I28290843"]},{"id":"https://openalex.org/I4210121626","display_name":"Signal Processing (United States)","ror":"https://ror.org/021gzyw51","country_code":"US","type":"company","lineage":["https://openalex.org/I4210121626"]}],"countries":["GB","US"],"is_corresponding":false,"raw_author_name":"Mark D. Plumbley","raw_affiliation_strings":["University of Surrey,Centre for Vision Speech and Signal Processing","Centre for Vision Speech and Signal Processing, University of Surrey"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Surrey,Centre for Vision Speech and Signal Processing","institution_ids":["https://openalex.org/I28290843"]},{"raw_affiliation_string":"Centre for Vision Speech and Signal Processing, University of Surrey","institution_ids":["https://openalex.org/I28290843","https://openalex.org/I4210121626"]}]}],"institutions":[],"countries_distinct_count":2,"institutions_distinct_count":3,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":14.9203,"has_fulltext":false,"cited_by_count":39,"citation_normalized_percentile":{"value":0.99449822,"is_in_top_1_percent":true,"is_in_top_10_percent":true},"cited_by_percentile_year":{"min":98,"max":100},"biblio":{"volume":null,"issue":null,"first_page":"1076","last_page":"1080"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9990000128746033,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9990000128746033,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.998199999332428,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10283","display_name":"Hearing Loss and Rehabilitation","score":0.9955999851226807,"subfield":{"id":"https://openalex.org/subfields/2805","display_name":"Cognitive Neuroscience"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.8076657652854919},{"id":"https://openalex.org/keywords/bandwidth","display_name":"Bandwidth (computing)","score":0.6482702493667603},{"id":"https://openalex.org/keywords/audio-signal","display_name":"Audio signal","score":0.6046068668365479},{"id":"https://openalex.org/keywords/digital-audio","display_name":"Digital audio","score":0.5724307894706726},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.5492172837257385},{"id":"https://openalex.org/keywords/sound-quality","display_name":"Sound quality","score":0.5401877164840698},{"id":"https://openalex.org/keywords/audio-signal-flow","display_name":"Audio signal flow","score":0.5302350521087646},{"id":"https://openalex.org/keywords/audio-analyzer","display_name":"Audio analyzer","score":0.5197305679321289},{"id":"https://openalex.org/keywords/audio-signal-processing","display_name":"Audio signal processing","score":0.42718178033828735},{"id":"https://openalex.org/keywords/speech-coding","display_name":"Speech coding","score":0.38611650466918945},{"id":"https://openalex.org/keywords/telecommunications","display_name":"Telecommunications","score":0.15238100290298462}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8076657652854919},{"id":"https://openalex.org/C2776257435","wikidata":"https://www.wikidata.org/wiki/Q1576430","display_name":"Bandwidth (computing)","level":2,"score":0.6482702493667603},{"id":"https://openalex.org/C64922751","wikidata":"https://www.wikidata.org/wiki/Q4650799","display_name":"Audio signal","level":3,"score":0.6046068668365479},{"id":"https://openalex.org/C87687168","wikidata":"https://www.wikidata.org/wiki/Q173114","display_name":"Digital audio","level":4,"score":0.5724307894706726},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.5492172837257385},{"id":"https://openalex.org/C167310288","wikidata":"https://www.wikidata.org/wiki/Q7564808","display_name":"Sound quality","level":2,"score":0.5401877164840698},{"id":"https://openalex.org/C167940747","wikidata":"https://www.wikidata.org/wiki/Q63727227","display_name":"Audio signal flow","level":5,"score":0.5302350521087646},{"id":"https://openalex.org/C160372630","wikidata":"https://www.wikidata.org/wiki/Q4819855","display_name":"Audio analyzer","level":5,"score":0.5197305679321289},{"id":"https://openalex.org/C127220857","wikidata":"https://www.wikidata.org/wiki/Q2719318","display_name":"Audio signal processing","level":4,"score":0.42718178033828735},{"id":"https://openalex.org/C13895895","wikidata":"https://www.wikidata.org/wiki/Q3270773","display_name":"Speech coding","level":2,"score":0.38611650466918945},{"id":"https://openalex.org/C76155785","wikidata":"https://www.wikidata.org/wiki/Q418","display_name":"Telecommunications","level":1,"score":0.15238100290298462}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icassp48485.2024.10447246","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp48485.2024.10447246","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320314136","display_name":"British Broadcasting Corporation","ror":"https://ror.org/01qepzr42"},{"id":"https://openalex.org/F4320334627","display_name":"Engineering and Physical Sciences Research Council","ror":"https://ror.org/0439y7842"}],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":29,"referenced_works":["https://openalex.org/W2052666245","https://openalex.org/W2100285470","https://openalex.org/W3001377302","https://openalex.org/W3095802501","https://openalex.org/W3125868443","https://openalex.org/W3197334236","https://openalex.org/W3198234802","https://openalex.org/W3203491020","https://openalex.org/W3213952100","https://openalex.org/W4212774754","https://openalex.org/W4221155904","https://openalex.org/W4283215837","https://openalex.org/W4312933868","https://openalex.org/W4318351475","https://openalex.org/W4380136719","https://openalex.org/W4385473570","https://openalex.org/W4394625831","https://openalex.org/W4396877837","https://openalex.org/W4400033239","https://openalex.org/W6697040288","https://openalex.org/W6778823374","https://openalex.org/W6783713337","https://openalex.org/W6783867762","https://openalex.org/W6802017037","https://openalex.org/W6809884996","https://openalex.org/W6849105126","https://openalex.org/W6849109464","https://openalex.org/W6853096648","https://openalex.org/W6855434424"],"related_works":["https://openalex.org/W2363106653","https://openalex.org/W1975359510","https://openalex.org/W3110605476","https://openalex.org/W2898469868","https://openalex.org/W2155254568","https://openalex.org/W1496727373","https://openalex.org/W296599067","https://openalex.org/W2792033502","https://openalex.org/W4320082704","https://openalex.org/W2020952589"],"abstract_inverted_index":{"Audio":[0],"super-resolution":[1,64,115],"is":[2,58],"a":[3,52,94,103,137,146],"fundamental":[4],"task":[5],"that":[6,57,132],"predicts":[7],"high-frequency":[8],"components":[9],"for":[10],"low-resolution":[11],"audio,":[12],"enhancing":[13],"audio":[14,29,63,67,81,96,114,150],"quality":[15,144],"in":[16],"digital":[17],"applications.":[18],"Previous":[19],"methods":[20],"have":[21],"limitations":[22],"such":[23],"as":[24,136],"the":[25,84,118,123,142],"limited":[26],"scope":[27],"of":[28,60,87,106,145,149],"types":[30],"(e.g.,":[31,41],"music,":[32,72],"speech)":[33],"and":[34,73,156,160],"specific":[35],"bandwidth":[36,85,101],"settings":[37],"they":[38],"can":[39,77,134],"handle":[40],"4":[42],"kHz":[43,89,92,100],"to":[44,90,93,140],"8":[45],"kHz).":[46],"In":[47,126],"this":[48],"paper,":[49],"we":[50],"introduce":[51],"diffusion-based":[53],"generative":[54,151],"model,":[55],"AudioSR,":[56],"capable":[59],"performing":[61],"robust":[62],"on":[65,112],"versatile":[66],"types,":[68],"including":[69,153],"sound":[70],"effects,":[71],"speech.":[74],"Specifically,":[75],"AudioSR":[76,133],"upsample":[78],"any":[79],"input":[80],"signal":[82,97],"within":[83],"range":[86,148],"2":[88],"16":[91],"high-resolution":[95],"at":[98,164],"24":[99],"with":[102],"sampling":[104],"rate":[105],"48":[107],"kHz.":[108],"Extensive":[109],"objective":[110],"evaluation":[111,130],"various":[113],"benchmarks":[116],"demonstrates":[117],"strong":[119],"result":[120],"achieved":[121],"by":[122],"proposed":[124],"model.":[125],"addition,":[127],"our":[128],"subjective":[129],"shows":[131],"act":[135],"plug-and-play":[138],"module":[139],"enhance":[141],"generation":[143],"wide":[147],"models,":[152],"AudioLDM,":[154],"Fastspeech2,":[155],"MusicGen.":[157],"Our":[158],"code":[159],"demo":[161],"are":[162],"available":[163],"https://audioldm.github.io/audiosr.":[165]},"counts_by_year":[{"year":2026,"cited_by_count":14},{"year":2025,"cited_by_count":19},{"year":2024,"cited_by_count":6}],"updated_date":"2026-08-26T07:47:46.906454","created_date":"2025-10-10T00:00:00"}
