{"id":"https://openalex.org/W7160661098","doi":"https://doi.org/10.48550/arxiv.2605.05231","title":"Prompting Whisper for Joint Speech Transcription and Diarization","display_name":"Prompting Whisper for Joint Speech Transcription and Diarization","publication_year":2026,"publication_date":"2026-04-24","ids":{"openalex":"https://openalex.org/W7160661098","doi":"https://doi.org/10.48550/arxiv.2605.05231"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.05231","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.05231","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.05231","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5135692869","display_name":"Mariia Zamyrova","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zamyrova, Mariia","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5042937911","display_name":"Henk van den Heuvel","orcid":"https://orcid.org/0000-0003-2064-0630"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Heuvel, Henk van den","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.5873000025749207,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.5873000025749207,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12031","display_name":"Speech and dialogue systems","score":0.2110999971628189,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.07760000228881836,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/speaker-diarisation","display_name":"Speaker diarisation","score":0.8148000240325928},{"id":"https://openalex.org/keywords/transcription","display_name":"Transcription (linguistics)","score":0.7702999711036682},{"id":"https://openalex.org/keywords/joint","display_name":"Joint (building)","score":0.5742999911308289},{"id":"https://openalex.org/keywords/timestamp","display_name":"Timestamp","score":0.43479999899864197},{"id":"https://openalex.org/keywords/line","display_name":"Line (geometry)","score":0.36239999532699585}],"concepts":[{"id":"https://openalex.org/C149838564","wikidata":"https://www.wikidata.org/wiki/Q7574248","display_name":"Speaker diarisation","level":3,"score":0.8148000240325928},{"id":"https://openalex.org/C179926584","wikidata":"https://www.wikidata.org/wiki/Q207714","display_name":"Transcription (linguistics)","level":2,"score":0.7702999711036682},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6488000154495239},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.6331999897956848},{"id":"https://openalex.org/C18555067","wikidata":"https://www.wikidata.org/wiki/Q8375051","display_name":"Joint (building)","level":2,"score":0.5742999911308289},{"id":"https://openalex.org/C113954288","wikidata":"https://www.wikidata.org/wiki/Q186885","display_name":"Timestamp","level":2,"score":0.43479999899864197},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.3855000138282776},{"id":"https://openalex.org/C198352243","wikidata":"https://www.wikidata.org/wiki/Q37105","display_name":"Line (geometry)","level":2,"score":0.36239999532699585},{"id":"https://openalex.org/C2777853878","wikidata":"https://www.wikidata.org/wiki/Q743569","display_name":"Phonetic transcription","level":2,"score":0.34290000796318054},{"id":"https://openalex.org/C41895202","wikidata":"https://www.wikidata.org/wiki/Q8162","display_name":"Linguistics","level":1,"score":0.2651999890804291},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.26170000433921814},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.2533000111579895},{"id":"https://openalex.org/C66746571","wikidata":"https://www.wikidata.org/wiki/Q1134833","display_name":"ENCODE","level":3,"score":0.2524999976158142}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.05231","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.05231","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.05231","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.05231","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"As":[0],"part":[1],"of":[2,31,69,86,101,119],"the":[3,60,99],"MediSpeech":[4],"project,":[5],"we":[6,28,50],"aim":[7],"to":[8,41,56,77,84,130],"develop":[9],"a":[10,81],"system":[11],"that":[12,46,52,85,121],"transcribes":[13],"and":[14,20,104,126],"diarizes":[15],"Dutch":[16],"conversations":[17],"between":[18],"doctors":[19],"patients":[21],"in":[22,80],"real-time.":[23],"In":[24],"this":[25,67],"research":[26,70],"(in-progress)":[27],"explore":[29],"ways":[30],"efficiently":[32],"combining":[33],"Whisper":[34,43,73,92],"with":[35,44,62,74],"speaker":[36,48,96],"diarization":[37],"(SD).":[38],"After":[39],"trying":[40],"prompt":[42],"text":[45],"contains":[47],"labels,":[49],"observed":[51],"it":[53],"is":[54],"able":[55],"insert":[57],"labels":[58],"into":[59],"transcription":[61],"promising":[63],"accuracy.":[64],"We":[65],"continued":[66],"line":[68],"by":[71],"fine-tuning":[72],"speaker-labelled":[75],"prompts":[76,125],"generate":[78],"transcriptions":[79],"format":[82],"similar":[83],"Serialized":[87],"Output":[88],"Training":[89],"(SOT).":[90],"Fine-tuning":[91],"yielded":[93],"more":[94],"consistent":[95],"IDs":[97],"across":[98],"chunks":[100],"long-form":[102],"audio":[103],"improved":[105],"verbatim":[106],"transcription.":[107],"The":[108],"study":[109],"uncovered":[110],"new":[111],"challenges":[112],"as":[113],"Whisper's":[114],"SD":[115],"performance":[116],"suffers":[117],"because":[118],"mistakes":[120],"get":[122],"propagated":[123],"through":[124],"inaccurate":[127],"timestamps":[128],"assigned":[129],"overlapping":[131],"speech.":[132]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-09T00:00:00"}
