{"id":"https://openalex.org/W4415524293","doi":"https://doi.org/10.1109/mlsp62443.2025.11204339","title":"AudioMAE++: Learning Better Masked Audio Representations with Swiglu FFNS","display_name":"AudioMAE++: Learning Better Masked Audio Representations with Swiglu FFNS","publication_year":2025,"publication_date":"2025-08-31","ids":{"openalex":"https://openalex.org/W4415524293","doi":"https://doi.org/10.1109/mlsp62443.2025.11204339"},"language":"en","primary_location":{"id":"doi:10.1109/mlsp62443.2025.11204339","is_oa":false,"landing_page_url":"https://doi.org/10.1109/mlsp62443.2025.11204339","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE 35th International Workshop on Machine Learning for Signal Processing (MLSP)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://arxiv.org/pdf/2507.10464","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5000317921","display_name":"Sarthak Yadav","orcid":"https://orcid.org/0000-0002-1979-9460"},"institutions":[{"id":"https://openalex.org/I891191580","display_name":"Aalborg University","ror":"https://ror.org/04m5j1k67","country_code":"DK","type":"education","lineage":["https://openalex.org/I891191580"]}],"countries":["DK"],"is_corresponding":false,"raw_author_name":"Sarthak Yadav","raw_affiliation_strings":["Aalborg University,Denmark"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Aalborg University,Denmark","institution_ids":["https://openalex.org/I891191580"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5085953846","display_name":"Sergios Theodoridis","orcid":"https://orcid.org/0000-0001-5040-161X"},"institutions":[{"id":"https://openalex.org/I891191580","display_name":"Aalborg University","ror":"https://ror.org/04m5j1k67","country_code":"DK","type":"education","lineage":["https://openalex.org/I891191580"]}],"countries":["DK"],"is_corresponding":false,"raw_author_name":"Sergios Theodoridis","raw_affiliation_strings":["Aalborg University,Denmark"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Aalborg University,Denmark","institution_ids":["https://openalex.org/I891191580"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5090108098","display_name":"Zheng\u2010Hua Tan","orcid":"https://orcid.org/0000-0001-6856-8928"},"institutions":[{"id":"https://openalex.org/I891191580","display_name":"Aalborg University","ror":"https://ror.org/04m5j1k67","country_code":"DK","type":"education","lineage":["https://openalex.org/I891191580"]}],"countries":["DK"],"is_corresponding":false,"raw_author_name":"Zheng-Hua Tan","raw_affiliation_strings":["Aalborg University,Denmark"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Aalborg University,Denmark","institution_ids":["https://openalex.org/I891191580"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I891191580"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":true,"cited_by_count":1,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"6"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9977999925613403,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9977999925613403,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9901999831199646,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9779000282287598,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/transformer","display_name":"Transformer","score":0.6937000155448914},{"id":"https://openalex.org/keywords/spectrogram","display_name":"Spectrogram","score":0.6444000005722046},{"id":"https://openalex.org/keywords/autoencoder","display_name":"Autoencoder","score":0.6294999718666077},{"id":"https://openalex.org/keywords/leverage","display_name":"Leverage (statistics)","score":0.5045999884605408},{"id":"https://openalex.org/keywords/audio-signal","display_name":"Audio signal","score":0.39489999413490295},{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.39399999380111694},{"id":"https://openalex.org/keywords/deep-learning","display_name":"Deep learning","score":0.3402000069618225}],"concepts":[{"id":"https://openalex.org/C66322947","wikidata":"https://www.wikidata.org/wiki/Q11658","display_name":"Transformer","level":3,"score":0.6937000155448914},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6851999759674072},{"id":"https://openalex.org/C45273575","wikidata":"https://www.wikidata.org/wiki/Q578970","display_name":"Spectrogram","level":2,"score":0.6444000005722046},{"id":"https://openalex.org/C101738243","wikidata":"https://www.wikidata.org/wiki/Q786435","display_name":"Autoencoder","level":3,"score":0.6294999718666077},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.5479999780654907},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.5045999884605408},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4643999934196472},{"id":"https://openalex.org/C64922751","wikidata":"https://www.wikidata.org/wiki/Q4650799","display_name":"Audio signal","level":3,"score":0.39489999413490295},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.39399999380111694},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.3402000069618225},{"id":"https://openalex.org/C59404180","wikidata":"https://www.wikidata.org/wiki/Q17013334","display_name":"Feature learning","level":2,"score":0.3337000012397766},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.32260000705718994},{"id":"https://openalex.org/C150899416","wikidata":"https://www.wikidata.org/wiki/Q1820378","display_name":"Transfer of learning","level":2,"score":0.31290000677108765},{"id":"https://openalex.org/C155635449","wikidata":"https://www.wikidata.org/wiki/Q4674699","display_name":"Acoustic model","level":3,"score":0.2896000146865845},{"id":"https://openalex.org/C13895895","wikidata":"https://www.wikidata.org/wiki/Q3270773","display_name":"Speech coding","level":2,"score":0.2858999967575073},{"id":"https://openalex.org/C127220857","wikidata":"https://www.wikidata.org/wiki/Q2719318","display_name":"Audio signal processing","level":4,"score":0.2849000096321106},{"id":"https://openalex.org/C99844830","wikidata":"https://www.wikidata.org/wiki/Q102441924","display_name":"Scaling","level":2,"score":0.27469998598098755},{"id":"https://openalex.org/C2778263558","wikidata":"https://www.wikidata.org/wiki/Q46384","display_name":"Microphone","level":3,"score":0.2678999900817871},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.26739999651908875},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.2526000142097473}],"mesh":[],"locations_count":2,"locations":[{"id":"doi:10.1109/mlsp62443.2025.11204339","is_oa":false,"landing_page_url":"https://doi.org/10.1109/mlsp62443.2025.11204339","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE 35th International Workshop on Machine Learning for Signal Processing (MLSP)","raw_type":"proceedings-article"},{"id":"pmh:oai:pure.atira.dk:publications/ce061866-1308-4bf1-bd66-53903b368616","is_oa":true,"landing_page_url":"https://vbn.aau.dk/da/publications/ce061866-1308-4bf1-bd66-53903b368616","pdf_url":"https://arxiv.org/pdf/2507.10464","source":{"id":"https://openalex.org/S4306401731","display_name":"VBN Forskningsportal (Aalborg Universitet)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I891191580","host_organization_name":"Aalborg University","host_organization_lineage":["https://openalex.org/I891191580"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"Yadav, S, Theodoridis, S & Tan, Z H 2025, AudioMAE++ : Learning Better Masked Audio Representations with Swiglu FFNS. in 2025 IEEE 35th International Workshop on Machine Learning for Signal Processing (MLSP). IEEE (Institute of Electrical and Electronics Engineers), IEEE Workshop on Machine Learning for Signal Processing, 35th IEEE International Workshop on Machine Learning for Signal Processing, Istanbul, Turkey, 31/08/2025. https://doi.org/10.1109/MLSP62443.2025.11204339","raw_type":"info:eu-repo/semantics/conferenceObject"}],"best_oa_location":{"id":"pmh:oai:pure.atira.dk:publications/ce061866-1308-4bf1-bd66-53903b368616","is_oa":true,"landing_page_url":"https://vbn.aau.dk/da/publications/ce061866-1308-4bf1-bd66-53903b368616","pdf_url":"https://arxiv.org/pdf/2507.10464","source":{"id":"https://openalex.org/S4306401731","display_name":"VBN Forskningsportal (Aalborg Universitet)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I891191580","host_organization_name":"Aalborg University","host_organization_lineage":["https://openalex.org/I891191580"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"Yadav, S, Theodoridis, S & Tan, Z H 2025, AudioMAE++ : Learning Better Masked Audio Representations with Swiglu FFNS. in 2025 IEEE 35th International Workshop on Machine Learning for Signal Processing (MLSP). IEEE (Institute of Electrical and Electronics Engineers), IEEE Workshop on Machine Learning for Signal Processing, 35th IEEE International Workshop on Machine Learning for Signal Processing, Istanbul, Turkey, 31/08/2025. https://doi.org/10.1109/MLSP62443.2025.11204339","raw_type":"info:eu-repo/semantics/conferenceObject"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W4415524293.pdf","grobid_xml":"https://content.openalex.org/works/W4415524293.grobid-xml"},"referenced_works_count":19,"referenced_works":["https://openalex.org/W2593116425","https://openalex.org/W2964110616","https://openalex.org/W3205475937","https://openalex.org/W3206996142","https://openalex.org/W3209059054","https://openalex.org/W3209984917","https://openalex.org/W4297841853","https://openalex.org/W4312685069","https://openalex.org/W4312804044","https://openalex.org/W4313156423","https://openalex.org/W4385245566","https://openalex.org/W4385570645","https://openalex.org/W4386076493","https://openalex.org/W4386352556","https://openalex.org/W4388979610","https://openalex.org/W4390874379","https://openalex.org/W4402111418","https://openalex.org/W4402112144","https://openalex.org/W4402112407"],"related_works":[],"abstract_inverted_index":{"Masked":[0],"Autoencoders":[1],"(MAEs)":[2],"trained":[3],"on":[4,30,81,94,102],"audio":[5,17,31,64,103],"spectrogram":[6],"patches":[7],"have":[8,23],"emerged":[9],"as":[10],"a":[11,62],"prominent":[12],"approach":[13],"for":[14],"learning":[15],"self-supervised":[16],"representations.":[18],"While":[19],"several":[20],"recent":[21],"papers":[22],"evaluated":[24],"key":[25],"aspects":[26],"of":[27,35,52],"training":[28],"MAEs":[29],"data,":[32],"the":[33,45,82,85],"majority":[34],"these":[36],"approaches":[37,93],"still":[38],"leverage":[39],"vanilla":[40],"transformer":[41,46,73],"building":[42],"blocks,":[43],"whereas":[44],"community":[47],"has":[48],"seen":[49],"steady":[50],"integration":[51],"newer":[53],"architectural":[54],"advancements.":[55],"In":[56],"this":[57],"work,":[58],"we":[59],"propose":[60],"AudioMAE++,":[61],"revamped":[63],"masked":[65],"autoencoder":[66],"with":[67,75,123],"two":[68],"such":[69],"enhancements,":[70],"namely":[71],"macaron-style":[72],"blocks":[74],"gated":[76],"linear":[77],"units.":[78],"When":[79],"pretrained":[80],"AudioSet":[83],"dataset,":[84],"proposed":[86,109],"AudioMAE++":[87,110],"models":[88,111],"outperform":[89],"existing":[90],"MAE":[91,121],"based":[92],"10":[95],"diverse":[96],"downstream":[97],"tasks,":[98],"demon-strating":[99],"excellent":[100,114],"performance":[101],"classification":[104],"and":[105],"speech-based":[106],"benchmarks.":[107],"The":[108],"also":[112],"demonstrate":[113],"scaling":[115],"characteristics,":[116],"outperforming":[117],"directly":[118],"comparable":[119],"standard":[120],"baselines":[122],"up":[124],"to":[125],"<tex":[126],"xmlns:mml=\"http://www.w3.org/1998/Math/MathML\"":[127],"xmlns:xlink=\"http://www.w3.org/1999/xlink\">$4":[128],"\\times$</tex>":[129],"more":[130],"parameters.":[131]},"counts_by_year":[{"year":2026,"cited_by_count":1}],"updated_date":"2026-07-18T07:39:51.176621","created_date":"2025-10-24T00:00:00"}
