{"id":"https://openalex.org/W7164941987","doi":"https://doi.org/10.48550/arxiv.2606.15751","title":"Acoustic Prompting via Stage-wise Modulation for Few-Shot Learning in Audio Language Models","display_name":"Acoustic Prompting via Stage-wise Modulation for Few-Shot Learning in Audio Language Models","publication_year":2026,"publication_date":"2026-06-14","ids":{"openalex":"https://openalex.org/W7164941987","doi":"https://doi.org/10.48550/arxiv.2606.15751"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.15751","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.15751","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.15751","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5019443662","display_name":"Hyebin Cho","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cho, Hyebin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138728299","display_name":"Jaehyuk Jang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jang, Jaehyuk","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5069759184","display_name":"Changick Kim","orcid":"https://orcid.org/0000-0001-9323-8488"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kim, Changick","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5138724742","display_name":"Joon Son Chung","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chung, Joon Son","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.5605000257492065,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.5605000257492065,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.17090000212192535,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.05689999833703041,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/focus","display_name":"Focus (optics)","score":0.6762999892234802},{"id":"https://openalex.org/keywords/encoder","display_name":"Encoder","score":0.6639000177383423},{"id":"https://openalex.org/keywords/representation","display_name":"Representation (politics)","score":0.5044000148773193},{"id":"https://openalex.org/keywords/audio-signal","display_name":"Audio signal","score":0.4465999901294708},{"id":"https://openalex.org/keywords/code","display_name":"Code (set theory)","score":0.3984000086784363},{"id":"https://openalex.org/keywords/space","display_name":"Space (punctuation)","score":0.3874000012874603},{"id":"https://openalex.org/keywords/feature-learning","display_name":"Feature learning","score":0.34860000014305115},{"id":"https://openalex.org/keywords/encoding","display_name":"Encoding (memory)","score":0.33090001344680786},{"id":"https://openalex.org/keywords/modulation","display_name":"Modulation (music)","score":0.32749998569488525}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7659000158309937},{"id":"https://openalex.org/C192209626","wikidata":"https://www.wikidata.org/wiki/Q190909","display_name":"Focus (optics)","level":2,"score":0.6762999892234802},{"id":"https://openalex.org/C118505674","wikidata":"https://www.wikidata.org/wiki/Q42586063","display_name":"Encoder","level":2,"score":0.6639000177383423},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.6100000143051147},{"id":"https://openalex.org/C2776359362","wikidata":"https://www.wikidata.org/wiki/Q2145286","display_name":"Representation (politics)","level":3,"score":0.5044000148773193},{"id":"https://openalex.org/C64922751","wikidata":"https://www.wikidata.org/wiki/Q4650799","display_name":"Audio signal","level":3,"score":0.4465999901294708},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4106000065803528},{"id":"https://openalex.org/C2776760102","wikidata":"https://www.wikidata.org/wiki/Q5139990","display_name":"Code (set theory)","level":3,"score":0.3984000086784363},{"id":"https://openalex.org/C2778572836","wikidata":"https://www.wikidata.org/wiki/Q380933","display_name":"Space (punctuation)","level":2,"score":0.3874000012874603},{"id":"https://openalex.org/C59404180","wikidata":"https://www.wikidata.org/wiki/Q17013334","display_name":"Feature learning","level":2,"score":0.34860000014305115},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.33090001344680786},{"id":"https://openalex.org/C123079801","wikidata":"https://www.wikidata.org/wiki/Q750240","display_name":"Modulation (music)","level":2,"score":0.32749998569488525},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.3246000111103058},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.323199987411499},{"id":"https://openalex.org/C157968479","wikidata":"https://www.wikidata.org/wiki/Q3079876","display_name":"Audio mining","level":4,"score":0.3158000111579895},{"id":"https://openalex.org/C155635449","wikidata":"https://www.wikidata.org/wiki/Q4674699","display_name":"Acoustic model","level":3,"score":0.31439998745918274},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.3091999888420105},{"id":"https://openalex.org/C160372630","wikidata":"https://www.wikidata.org/wiki/Q4819855","display_name":"Audio analyzer","level":5,"score":0.3077999949455261},{"id":"https://openalex.org/C197424946","wikidata":"https://www.wikidata.org/wiki/Q1165717","display_name":"Waveform","level":3,"score":0.3066999912261963},{"id":"https://openalex.org/C167310288","wikidata":"https://www.wikidata.org/wiki/Q7564808","display_name":"Sound quality","level":2,"score":0.2930000126361847},{"id":"https://openalex.org/C2778488704","wikidata":"https://www.wikidata.org/wiki/Q15190726","display_name":"Audio equipment","level":2,"score":0.29249998927116394},{"id":"https://openalex.org/C43126263","wikidata":"https://www.wikidata.org/wiki/Q128751","display_name":"Source code","level":2,"score":0.2888999879360199},{"id":"https://openalex.org/C77618280","wikidata":"https://www.wikidata.org/wiki/Q1155772","display_name":"Scheme (mathematics)","level":2,"score":0.287200003862381},{"id":"https://openalex.org/C127220857","wikidata":"https://www.wikidata.org/wiki/Q2719318","display_name":"Audio signal processing","level":4,"score":0.27250000834465027},{"id":"https://openalex.org/C36503486","wikidata":"https://www.wikidata.org/wiki/Q11235244","display_name":"Domain (mathematical analysis)","level":2,"score":0.2531000077724457}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.15751","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.15751","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.15751","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.15751","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Audio-Language":[0],"Models":[1],"(ALMs)":[2],"have":[3],"shown":[4],"remarkable":[5],"success":[6],"in":[7],"zero-shot":[8],"audio":[9,13,45,62,115],"classification":[10],"by":[11],"aligning":[12],"waveforms":[14],"with":[15,76],"text.":[16],"Recent":[17],"efforts":[18],"to":[19,64,105],"improve":[20],"downstream":[21],"performance":[22,106],"focus":[23,32],"on":[24,33],"learning":[25,75],"optimal":[26],"text":[27,35,100],"prompts.":[28],"However,":[29],"previous":[30],"approaches":[31,79],"the":[34,38,44,61,114],"encoder,":[36],"leaving":[37],"potential":[39],"of":[40],"learnable":[41],"prompts":[42,59],"within":[43],"encoder":[46,63],"unexplored.":[47],"In":[48],"this":[49],"paper,":[50],"we":[51],"propose":[52],"a":[53,95],"novel":[54],"framework":[55],"that":[56,71,90,111],"introduces":[57],"trainable":[58],"into":[60],"capture":[65],"task-specific":[66],"acoustic":[67],"features.":[68],"We":[69],"demonstrate":[70],"integrating":[72,91],"audio-side":[73],"prompt":[74,101],"existing":[77,99],"text-side":[78],"enhances":[80],"few-shot":[81],"adaptation.":[82],"Through":[83],"extensive":[84],"experiments":[85],"across":[86],"11":[87],"datasets":[88],"show":[89],"our":[92],"method":[93],"as":[94],"plug-and-play":[96],"module":[97],"alongside":[98],"tuning":[102],"generally":[103],"leads":[104],"improvements.":[107],"These":[108],"findings":[109],"suggest":[110],"explicitly":[112],"modulating":[113],"representation":[116],"space":[117],"effectively":[118],"complements":[119],"text-only":[120],"prompting":[121],"approaches.":[122],"The":[123],"code":[124],"is":[125],"available":[126],"at":[127],"https://github.com/hyebin-c/aspl.":[128]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-17T00:00:00"}
