{"id":"https://openalex.org/W4408353459","doi":"https://doi.org/10.1109/icassp49660.2025.10890667","title":"Semi-Supervised Speaker Diarization Using Graph Transformers and LLMs on Naturalistic Apollo 11 Data","display_name":"Semi-Supervised Speaker Diarization Using Graph Transformers and LLMs on Naturalistic Apollo 11 Data","publication_year":2025,"publication_date":"2025-03-12","ids":{"openalex":"https://openalex.org/W4408353459","doi":"https://doi.org/10.1109/icassp49660.2025.10890667"},"language":"en","primary_location":{"id":"doi:10.1109/icassp49660.2025.10890667","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp49660.2025.10890667","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ICASSP 2025 - 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5059065485","display_name":"Meena M. C. Shekar","orcid":null},"institutions":[{"id":"https://openalex.org/I162577319","display_name":"The University of Texas at Dallas","ror":"https://ror.org/049emcs32","country_code":"US","type":"education","lineage":["https://openalex.org/I162577319"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Meena M. C. Shekar","raw_affiliation_strings":["The University of Texas at Dallas,Center for Robust Speech Systems,Richardson,USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"The University of Texas at Dallas,Center for Robust Speech Systems,Richardson,USA","institution_ids":["https://openalex.org/I162577319"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5057910370","display_name":"John H. L. Hansen","orcid":"https://orcid.org/0000-0003-1382-9929"},"institutions":[{"id":"https://openalex.org/I162577319","display_name":"The University of Texas at Dallas","ror":"https://ror.org/049emcs32","country_code":"US","type":"education","lineage":["https://openalex.org/I162577319"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"John H. L. Hansen","raw_affiliation_strings":["The University of Texas at Dallas,Center for Robust Speech Systems,Richardson,USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"The University of Texas at Dallas,Center for Robust Speech Systems,Richardson,USA","institution_ids":["https://openalex.org/I162577319"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I162577319"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"5"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9980000257492065,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9980000257492065,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9729999899864197,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9352999925613403,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/speaker-diarisation","display_name":"Speaker diarisation","score":0.6537374258041382},{"id":"https://openalex.org/keywords/apollo","display_name":"Apollo","score":0.6249978542327881},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.6238348484039307},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.4116438627243042},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.3344130516052246},{"id":"https://openalex.org/keywords/speaker-recognition","display_name":"Speaker recognition","score":0.29855069518089294}],"concepts":[{"id":"https://openalex.org/C149838564","wikidata":"https://www.wikidata.org/wiki/Q7574248","display_name":"Speaker diarisation","level":3,"score":0.6537374258041382},{"id":"https://openalex.org/C2779821442","wikidata":"https://www.wikidata.org/wiki/Q41633","display_name":"Apollo","level":2,"score":0.6249978542327881},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6238348484039307},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.4116438627243042},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3344130516052246},{"id":"https://openalex.org/C133892786","wikidata":"https://www.wikidata.org/wiki/Q1145189","display_name":"Speaker recognition","level":2,"score":0.29855069518089294},{"id":"https://openalex.org/C90856448","wikidata":"https://www.wikidata.org/wiki/Q431","display_name":"Zoology","level":1,"score":0.0},{"id":"https://openalex.org/C86803240","wikidata":"https://www.wikidata.org/wiki/Q420","display_name":"Biology","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icassp49660.2025.10890667","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp49660.2025.10890667","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ICASSP 2025 - 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320306076","display_name":"National Science Foundation","ror":"https://ror.org/021nxhr62"}],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":30,"referenced_works":["https://openalex.org/W1591607137","https://openalex.org/W2081074144","https://openalex.org/W2126854862","https://openalex.org/W2194775991","https://openalex.org/W2726515241","https://openalex.org/W2808631503","https://openalex.org/W2972869740","https://openalex.org/W3008357631","https://openalex.org/W3025260599","https://openalex.org/W3043783436","https://openalex.org/W3097636940","https://openalex.org/W3167533889","https://openalex.org/W3198793808","https://openalex.org/W3212886388","https://openalex.org/W4283780157","https://openalex.org/W4367595522","https://openalex.org/W4385822475","https://openalex.org/W4387068218","https://openalex.org/W4391136507","https://openalex.org/W4391855109","https://openalex.org/W4392240262","https://openalex.org/W4392902855","https://openalex.org/W4392902861","https://openalex.org/W4392911124","https://openalex.org/W4402112398","https://openalex.org/W6603931906","https://openalex.org/W6638667902","https://openalex.org/W6760045743","https://openalex.org/W6787995345","https://openalex.org/W6858023062"],"related_works":["https://openalex.org/W2748952813","https://openalex.org/W4389984014","https://openalex.org/W2144208207","https://openalex.org/W2111874347","https://openalex.org/W2405439032","https://openalex.org/W3120512183","https://openalex.org/W2118860825","https://openalex.org/W1509309911","https://openalex.org/W2096510939","https://openalex.org/W1599425004"],"abstract_inverted_index":{"Speaker":[0],"diarization":[1,64,133],"is":[2],"the":[3,131,137,155,168],"process":[4],"of":[5,44,136,149],"segmenting":[6],"and":[7,52,83,161,177],"tagging":[8],"audio":[9,117],"streams":[10],"based":[11],"on":[12,154],"speaker":[13,49,63,75,99,111,165,175],"identity.":[14],"Traditional":[15],"methods":[16],"face":[17],"significant":[18],"challenges":[19,39],"in":[20,144],"real-world":[21,38],"scenarios":[22],"when":[23],"applied":[24],"to":[25,72,96,108,129,172],"spontaneous":[26],"multi-speaker":[27],"conversational":[28,84,178],"speech.":[29],"The":[30,119],"Fearless":[31],"Steps":[32],"Apollo":[33],"11":[34],"corpus":[35],"(FS-A11)":[36],"presents":[37],"such":[40],"as":[41],"inconsistent":[42],"number":[43],"speakers":[45],"per":[46],"channel,":[47],"varying":[48],"utterance":[50],"duration,":[51],"diverse":[53],"acoustic":[54],"environments.":[55],"In":[56],"this":[57],"study,":[58],"we":[59,102,159],"introduce":[60],"a":[61,92,104,141],"novel":[62],"framework":[65],"that":[66],"leverages":[67],"Large":[68],"Language":[69],"Models":[70],"(LLMs)":[71],"generate":[73],"initial":[74],"change":[76],"labels":[77,87],"by":[78,113],"analyzing":[79],"both":[80],"speech":[81],"content":[82],"dynamics.":[85],"These":[86],"are":[88,121],"further":[89],"refined":[90,98],"using":[91,124],"proposed":[93,138],"multi-segmentation":[94],"system":[95,139],"obtain":[97],"turns.":[100],"Finally,":[101],"propose":[103],"Graph":[105],"Transformer":[106],"architecture":[107],"build":[109],"robust":[110],"embeddings":[112,120],"modeling":[114],"relationships":[115],"between":[116],"segments.":[118],"then":[122],"clustered":[123],"agglomerative":[125],"hierarchical":[126],"clustering":[127],"(AHC)":[128],"produce":[130],"final":[132],"output.":[134],"Evaluation":[135],"demonstrates":[140],"relative":[142],"improvement":[143],"Diarization":[145],"Error":[146],"Rate":[147],"(DER)":[148],"+12.8%":[150],"over":[151,167],"baseline":[152],"systems":[153],"FS-A11":[156],"dataset.":[157],"Furthermore,":[158],"analyze":[160,173],"track":[162],"5":[163],"key":[164],"roles":[166],"entire":[169],"Apollo-11":[170],"mission":[171,181],"primary":[174],"engagement":[176],"dynamics":[179],"across":[180],"communication":[182],"channels.":[183]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
