{"id":"https://openalex.org/W7130545864","doi":"https://doi.org/10.1109/ictc66702.2025.11387940","title":"Mamba2 Meets Silence: Robust Vocal Source Separation for Sparse Regions","display_name":"Mamba2 Meets Silence: Robust Vocal Source Separation for Sparse Regions","publication_year":2025,"publication_date":"2025-10-14","ids":{"openalex":"https://openalex.org/W7130545864","doi":"https://doi.org/10.1109/ictc66702.2025.11387940"},"language":null,"primary_location":{"id":"doi:10.1109/ictc66702.2025.11387940","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ictc66702.2025.11387940","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 16th International Conference on Information and Communication Technology Convergence (ICTC)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5089723036","display_name":"E. S. Kim","orcid":null},"institutions":[{"id":"https://openalex.org/I161024014","display_name":"Kwangwoon University","ror":"https://ror.org/02e9zc863","country_code":"KR","type":"education","lineage":["https://openalex.org/I161024014"]}],"countries":["KR"],"is_corresponding":false,"raw_author_name":"Euiyeon Kim","raw_affiliation_strings":["Kwangwoon University,Division of Robotics,Seoul,Korea"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Kwangwoon University,Division of Robotics,Seoul,Korea","institution_ids":["https://openalex.org/I161024014"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5101817296","display_name":"Yonghoon Choi","orcid":"https://orcid.org/0000-0002-5218-4513"},"institutions":[{"id":"https://openalex.org/I161024014","display_name":"Kwangwoon University","ror":"https://ror.org/02e9zc863","country_code":"KR","type":"education","lineage":["https://openalex.org/I161024014"]}],"countries":["KR"],"is_corresponding":false,"raw_author_name":"Yong-Hoon Choi","raw_affiliation_strings":["Kwangwoon University,Division of Robotics,Seoul,Korea"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Kwangwoon University,Division of Robotics,Seoul,Korea","institution_ids":["https://openalex.org/I161024014"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I161024014"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"828","last_page":"832"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9312000274658203,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9312000274658203,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.027300000190734863,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.02280000038444996,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/source-separation","display_name":"Source separation","score":0.5719000101089478},{"id":"https://openalex.org/keywords/audio-signal-processing","display_name":"Audio signal processing","score":0.4530999958515167},{"id":"https://openalex.org/keywords/separation","display_name":"Separation (statistics)","score":0.451200008392334},{"id":"https://openalex.org/keywords/blind-signal-separation","display_name":"Blind signal separation","score":0.4413999915122986},{"id":"https://openalex.org/keywords/space","display_name":"Space (punctuation)","score":0.359499990940094},{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.35670000314712524},{"id":"https://openalex.org/keywords/state","display_name":"State (computer science)","score":0.3506999909877777},{"id":"https://openalex.org/keywords/signal-processing","display_name":"Signal processing","score":0.3111000061035156}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7192999720573425},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.5885000228881836},{"id":"https://openalex.org/C2776864781","wikidata":"https://www.wikidata.org/wiki/Q52617913","display_name":"Source separation","level":2,"score":0.5719000101089478},{"id":"https://openalex.org/C127220857","wikidata":"https://www.wikidata.org/wiki/Q2719318","display_name":"Audio signal processing","level":4,"score":0.4530999958515167},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4521999955177307},{"id":"https://openalex.org/C2776061190","wikidata":"https://www.wikidata.org/wiki/Q7451805","display_name":"Separation (statistics)","level":2,"score":0.451200008392334},{"id":"https://openalex.org/C120317606","wikidata":"https://www.wikidata.org/wiki/Q17105967","display_name":"Blind signal separation","level":3,"score":0.4413999915122986},{"id":"https://openalex.org/C2778572836","wikidata":"https://www.wikidata.org/wiki/Q380933","display_name":"Space (punctuation)","level":2,"score":0.359499990940094},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.35670000314712524},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.3506999909877777},{"id":"https://openalex.org/C104267543","wikidata":"https://www.wikidata.org/wiki/Q208163","display_name":"Signal processing","level":3,"score":0.3111000061035156},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.3050999939441681},{"id":"https://openalex.org/C64922751","wikidata":"https://www.wikidata.org/wiki/Q4650799","display_name":"Audio signal","level":3,"score":0.30000001192092896},{"id":"https://openalex.org/C2985998994","wikidata":"https://www.wikidata.org/wiki/Q3644502","display_name":"Source model","level":2,"score":0.2919999957084656},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.2897000014781952},{"id":"https://openalex.org/C72434380","wikidata":"https://www.wikidata.org/wiki/Q230930","display_name":"State space","level":2,"score":0.2879999876022339},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.28349998593330383},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.26109999418258667},{"id":"https://openalex.org/C128422554","wikidata":"https://www.wikidata.org/wiki/Q20077126","display_name":"Sound recording and reproduction","level":2,"score":0.2517000138759613},{"id":"https://openalex.org/C2776182073","wikidata":"https://www.wikidata.org/wiki/Q7575395","display_name":"Speech enhancement","level":3,"score":0.25110000371932983}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/ictc66702.2025.11387940","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ictc66702.2025.11387940","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 16th International Conference on Information and Communication Technology Convergence (ICTC)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320324625","display_name":"Korea Agency for Infrastructure Technology Advancement","ror":"https://ror.org/00rxf7n07"}],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":15,"referenced_works":["https://openalex.org/W2963750251","https://openalex.org/W2998562534","https://openalex.org/W3081279708","https://openalex.org/W3162801840","https://openalex.org/W3199957557","https://openalex.org/W4372260250","https://openalex.org/W4375928773","https://openalex.org/W4392903379","https://openalex.org/W4392909836","https://openalex.org/W4392931574","https://openalex.org/W4394916053","https://openalex.org/W4402671720","https://openalex.org/W4406461266","https://openalex.org/W4408354310","https://openalex.org/W4408565860"],"related_works":[],"abstract_inverted_index":{"We":[0],"introduce":[1],"a":[2,28,47,63],"new":[3,108],"music":[4],"source":[5],"separation":[6],"model":[7,25,79],"tailored":[8],"for":[9,101,110],"accurate":[10],"vocal":[11,90],"isolation.":[12],"Unlike":[13],"Transformer-based":[14],"approaches,":[15],"which":[16],"often":[17],"fail":[18],"to":[19,33,70],"capture":[20,35],"intermittently":[21],"occurring":[22],"vocals,":[23],"our":[24,56],"leverages":[26],"Mamba2,":[27],"recent":[29,59],"state":[30],"space":[31],"model,":[32],"better":[34],"long-range":[36],"temporal":[37],"dependencies.":[38],"To":[39],"handle":[40],"long":[41],"input":[42,87],"sequences":[43],"efficiently,":[44],"we":[45],"combine":[46],"band-splitting":[48],"strategy":[49],"with":[50],"dual-path":[51],"architecture.":[52],"Experiments":[53],"show":[54],"that":[55],"approach":[57],"outperforms":[58],"state-of-the-art":[60],"models,":[61],"achieving":[62,72],"cSDR":[64],"of":[65,98],"11.03":[66],"dB\u2014the":[67],"best":[68],"reported":[69],"date\u2014and":[71],"substantial":[73],"improvements":[74],"in":[75,113],"uSDR.":[76],"Moreover,":[77],"the":[78,96],"exhibits":[80],"stable":[81],"and":[82,89,105],"consistent":[83],"performance":[84],"across":[85],"varying":[86],"lengths":[88],"occurrence":[91],"patterns.":[92],"These":[93],"results":[94],"demonstrate":[95],"effectiveness":[97],"Mamba-based":[99],"models":[100],"high-resolution":[102],"audio":[103,114],"processing":[104],"open":[106],"up":[107],"directions":[109],"broader":[111],"applications":[112],"research.":[115]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2026-02-20T00:00:00"}
