{"id":"https://openalex.org/W2939246703","doi":"https://doi.org/10.1109/icassp.2019.8682274","title":"Low-latency Speaker-independent Continuous Speech Separation","display_name":"Low-latency Speaker-independent Continuous Speech Separation","publication_year":2019,"publication_date":"2019-04-17","ids":{"openalex":"https://openalex.org/W2939246703","doi":"https://doi.org/10.1109/icassp.2019.8682274","mag":"2939246703"},"language":"en","primary_location":{"id":"doi:10.1109/icassp.2019.8682274","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2019.8682274","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5101618071","display_name":"Takuya Yoshioka","orcid":"https://orcid.org/0009-0003-7791-3545"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Takuya Yoshioka","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5100345092","display_name":"Zhuo Chen","orcid":"https://orcid.org/0000-0002-9011-7928"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhuo Chen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5022890229","display_name":"Changliang Liu","orcid":"https://orcid.org/0009-0005-8201-0871"},"institutions":[{"id":"https://openalex.org/I1290206253","display_name":"Microsoft (United States)","ror":"https://ror.org/00d0nc645","country_code":"US","type":"company","lineage":["https://openalex.org/I1290206253"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Changliang Liu","raw_affiliation_strings":["Microsoft, One Microsoft Way, Redmond, WA, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Microsoft, One Microsoft Way, Redmond, WA, USA","institution_ids":["https://openalex.org/I1290206253"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5101602536","display_name":"Xiong Xiao","orcid":"https://orcid.org/0009-0001-5128-6518"},"institutions":[{"id":"https://openalex.org/I1290206253","display_name":"Microsoft (United States)","ror":"https://ror.org/00d0nc645","country_code":"US","type":"company","lineage":["https://openalex.org/I1290206253"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Xiong Xiao","raw_affiliation_strings":["Microsoft, One Microsoft Way, Redmond, WA, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Microsoft, One Microsoft Way, Redmond, WA, USA","institution_ids":["https://openalex.org/I1290206253"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5065994318","display_name":"Hakan Erdo\u011fan","orcid":"https://orcid.org/0000-0003-3140-8642"},"institutions":[{"id":"https://openalex.org/I1290206253","display_name":"Microsoft (United States)","ror":"https://ror.org/00d0nc645","country_code":"US","type":"company","lineage":["https://openalex.org/I1290206253"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Hakan Erdogan","raw_affiliation_strings":["Microsoft, One Microsoft Way, Redmond, WA, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Microsoft, One Microsoft Way, Redmond, WA, USA","institution_ids":["https://openalex.org/I1290206253"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5115044944","display_name":"Dimitrios Dimitriadis","orcid":"https://orcid.org/0000-0001-8483-0105"},"institutions":[{"id":"https://openalex.org/I1290206253","display_name":"Microsoft (United States)","ror":"https://ror.org/00d0nc645","country_code":"US","type":"company","lineage":["https://openalex.org/I1290206253"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Dimitrios Dimitriadis","raw_affiliation_strings":["Microsoft, One Microsoft Way, Redmond, WA, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Microsoft, One Microsoft Way, Redmond, WA, USA","institution_ids":["https://openalex.org/I1290206253"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":29,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"6980","last_page":"6984"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":1.0,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":1.0,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9991999864578247,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9987999796867371,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.7736937999725342},{"id":"https://openalex.org/keywords/microphone","display_name":"Microphone","score":0.7716543078422546},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7710021734237671},{"id":"https://openalex.org/keywords/voice-activity-detection","display_name":"Voice activity detection","score":0.5638285279273987},{"id":"https://openalex.org/keywords/utterance","display_name":"Utterance","score":0.5488675832748413},{"id":"https://openalex.org/keywords/latency","display_name":"Latency (audio)","score":0.5447448492050171},{"id":"https://openalex.org/keywords/transcription","display_name":"Transcription (linguistics)","score":0.5111818909645081},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.5075646638870239},{"id":"https://openalex.org/keywords/speech-processing","display_name":"Speech processing","score":0.5060219168663025},{"id":"https://openalex.org/keywords/speaker-diarisation","display_name":"Speaker diarisation","score":0.4643474221229553},{"id":"https://openalex.org/keywords/telephone-network","display_name":"Telephone network","score":0.43731021881103516},{"id":"https://openalex.org/keywords/speaker-recognition","display_name":"Speaker recognition","score":0.389498233795166},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.27201586961746216},{"id":"https://openalex.org/keywords/computer-network","display_name":"Computer network","score":0.0997164249420166},{"id":"https://openalex.org/keywords/telecommunications","display_name":"Telecommunications","score":0.07973012328147888}],"concepts":[{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.7736937999725342},{"id":"https://openalex.org/C2778263558","wikidata":"https://www.wikidata.org/wiki/Q46384","display_name":"Microphone","level":3,"score":0.7716543078422546},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7710021734237671},{"id":"https://openalex.org/C204201278","wikidata":"https://www.wikidata.org/wiki/Q1332614","display_name":"Voice activity detection","level":3,"score":0.5638285279273987},{"id":"https://openalex.org/C2775852435","wikidata":"https://www.wikidata.org/wiki/Q258403","display_name":"Utterance","level":2,"score":0.5488675832748413},{"id":"https://openalex.org/C82876162","wikidata":"https://www.wikidata.org/wiki/Q17096504","display_name":"Latency (audio)","level":2,"score":0.5447448492050171},{"id":"https://openalex.org/C179926584","wikidata":"https://www.wikidata.org/wiki/Q207714","display_name":"Transcription (linguistics)","level":2,"score":0.5111818909645081},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.5075646638870239},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.5060219168663025},{"id":"https://openalex.org/C149838564","wikidata":"https://www.wikidata.org/wiki/Q7574248","display_name":"Speaker diarisation","level":3,"score":0.4643474221229553},{"id":"https://openalex.org/C197698232","wikidata":"https://www.wikidata.org/wiki/Q2354216","display_name":"Telephone network","level":2,"score":0.43731021881103516},{"id":"https://openalex.org/C133892786","wikidata":"https://www.wikidata.org/wiki/Q1145189","display_name":"Speaker recognition","level":2,"score":0.389498233795166},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.27201586961746216},{"id":"https://openalex.org/C31258907","wikidata":"https://www.wikidata.org/wiki/Q1301371","display_name":"Computer network","level":1,"score":0.0997164249420166},{"id":"https://openalex.org/C76155785","wikidata":"https://www.wikidata.org/wiki/Q418","display_name":"Telecommunications","level":1,"score":0.07973012328147888},{"id":"https://openalex.org/C68115822","wikidata":"https://www.wikidata.org/wiki/Q1068172","display_name":"Sound pressure","level":2,"score":0.0},{"id":"https://openalex.org/C138885662","wikidata":"https://www.wikidata.org/wiki/Q5891","display_name":"Philosophy","level":0,"score":0.0},{"id":"https://openalex.org/C41895202","wikidata":"https://www.wikidata.org/wiki/Q8162","display_name":"Linguistics","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icassp.2019.8682274","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2019.8682274","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/16","display_name":"Peace, Justice and strong institutions","score":0.4099999964237213}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":24,"referenced_works":["https://openalex.org/W262275730","https://openalex.org/W285277413","https://openalex.org/W1983812858","https://openalex.org/W2003203076","https://openalex.org/W2031583051","https://openalex.org/W2113990625","https://openalex.org/W2167689159","https://openalex.org/W2221409856","https://openalex.org/W2288645994","https://openalex.org/W2289480995","https://openalex.org/W2519091744","https://openalex.org/W2558649592","https://openalex.org/W2563666542","https://openalex.org/W2734774145","https://openalex.org/W2750380122","https://openalex.org/W2757672955","https://openalex.org/W2803322398","https://openalex.org/W2803583024","https://openalex.org/W2888954542","https://openalex.org/W2889503488","https://openalex.org/W2892163332","https://openalex.org/W2892300106","https://openalex.org/W2909607850","https://openalex.org/W6651134346"],"related_works":["https://openalex.org/W2206035908","https://openalex.org/W2162158162","https://openalex.org/W4247736853","https://openalex.org/W1493012537","https://openalex.org/W2175373321","https://openalex.org/W2125642021","https://openalex.org/W4310979479","https://openalex.org/W2696990509","https://openalex.org/W1999004162","https://openalex.org/W114661351"],"abstract_inverted_index":{"Speaker":[0],"independent":[1],"continuous":[2,12,28],"speech":[3,36,88,96,153],"separation":[4,154],"(SI-CSS)":[5],"is":[6,46,68,130,146],"a":[7,11,24,87,103,112,124,139,151,159,169,176],"task":[8],"of":[9,20,27,31,43,50,134,171],"converting":[10],"audio":[13],"stream,":[14],"which":[15,32],"may":[16],"contain":[17],"overlapping":[18,35],"voices":[19],"unknown":[21],"speakers,":[22],"into":[23],"fixed":[25,172],"number":[26],"signals":[29,81],"each":[30,44],"contains":[33],"no":[34],"segment.":[37],"A":[38,64],"separated,":[39],"or":[40],"cleaned,":[41],"version":[42],"utterance":[45],"generated":[47],"from":[48],"one":[49],"SI-CSS's":[51],"output":[52,80],"channels":[53],"nondeterministically":[54],"without":[55],"being":[56],"split":[57],"up":[58],"and":[59,111,115,163],"distributed":[60],"to":[61,86,132],"multiple":[62],"channels.":[63],"typical":[65],"application":[66],"scenario":[67],"transcribing":[69],"multi-party":[70],"conversations,":[71],"such":[72],"as":[73],"meetings,":[74],"recorded":[75],"with":[76,107,158,168],"microphone":[77,140],"arrays.":[78],"The":[79,98],"can":[82],"be":[83],"simply":[84],"sent":[85],"recognition":[89],"engine":[90],"because":[91],"they":[92],"do":[93],"not":[94],"include":[95],"overlaps.":[97],"previous":[99,136],"SI-CSS":[100,126],"method":[101,127,137],"uses":[102],"neural":[104,177],"network":[105,155],"trained":[106],"permutation":[108],"invariant":[109],"training":[110],"data-driven":[113],"beamformer":[114],"thus":[116],"requires":[117],"much":[118],"processing":[119],"latency.":[120],"This":[121,145],"paper":[122],"proposes":[123],"low-latency":[125],"whose":[128],"performance":[129],"comparable":[131],"that":[133],"the":[135],"in":[138],"array-based":[141],"meeting":[142],"transcription":[143],"task.":[144],"achieved":[147],"(1)":[148],"by":[149,165,175],"using":[150],"new":[152],"architecture":[156],"combined":[157],"double":[160],"buffering":[161],"scheme":[162],"(2)":[164],"performing":[166],"enhancement":[167],"set":[170],"beamformers":[173],"followed":[174],"post-filter.":[178]},"counts_by_year":[{"year":2023,"cited_by_count":4},{"year":2022,"cited_by_count":4},{"year":2021,"cited_by_count":10},{"year":2020,"cited_by_count":5},{"year":2019,"cited_by_count":6}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
