{"id":"https://openalex.org/W2911510444","doi":"https://doi.org/10.1109/slt.2018.8639595","title":"Detection and Calibration of Whisper for Speaker Recognition","display_name":"Detection and Calibration of Whisper for Speaker Recognition","publication_year":2018,"publication_date":"2018-12-01","ids":{"openalex":"https://openalex.org/W2911510444","doi":"https://doi.org/10.1109/slt.2018.8639595","mag":"2911510444"},"language":"en","primary_location":{"id":"doi:10.1109/slt.2018.8639595","is_oa":false,"landing_page_url":"https://doi.org/10.1109/slt.2018.8639595","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2018 IEEE Spoken Language Technology Workshop (SLT)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5087883012","display_name":"Finnian Kelly","orcid":null},"institutions":[{"id":"https://openalex.org/I162577319","display_name":"The University of Texas at Dallas","ror":"https://ror.org/049emcs32","country_code":"US","type":"education","lineage":["https://openalex.org/I162577319"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Finnian Kelly","raw_affiliation_strings":["Center for Robust Speech Systems (CRSS), The University of Texas at Dallas, Richardson, Texas, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Center for Robust Speech Systems (CRSS), The University of Texas at Dallas, Richardson, Texas, USA","institution_ids":["https://openalex.org/I162577319"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5057910370","display_name":"John H. L. Hansen","orcid":"https://orcid.org/0000-0003-1382-9929"},"institutions":[{"id":"https://openalex.org/I162577319","display_name":"The University of Texas at Dallas","ror":"https://ror.org/049emcs32","country_code":"US","type":"education","lineage":["https://openalex.org/I162577319"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"John H. L. Hansen","raw_affiliation_strings":["Center for Robust Speech Systems (CRSS), The University of Texas at Dallas, Richardson, Texas, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Center for Robust Speech Systems (CRSS), The University of Texas at Dallas, Richardson, Texas, USA","institution_ids":["https://openalex.org/I162577319"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I162577319"],"apc_list":null,"apc_paid":null,"fwci":0.7216,"has_fulltext":false,"cited_by_count":5,"citation_normalized_percentile":{"value":0.71412082,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":89,"max":95},"biblio":{"volume":null,"issue":null,"first_page":"1060","last_page":"1065"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998000264167786,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9891999959945679,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7730836868286133},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.6871504783630371},{"id":"https://openalex.org/keywords/calibration","display_name":"Calibration","score":0.6629428863525391},{"id":"https://openalex.org/keywords/detector","display_name":"Detector","score":0.5911468863487244},{"id":"https://openalex.org/keywords/modal","display_name":"Modal","score":0.5801934003829956},{"id":"https://openalex.org/keywords/speaker-recognition","display_name":"Speaker recognition","score":0.4881022870540619},{"id":"https://openalex.org/keywords/pattern-recognition","display_name":"Pattern recognition (psychology)","score":0.4501044452190399},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.3744962215423584},{"id":"https://openalex.org/keywords/statistics","display_name":"Statistics","score":0.07979705929756165},{"id":"https://openalex.org/keywords/telecommunications","display_name":"Telecommunications","score":0.05833485722541809},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.05307832360267639}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7730836868286133},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.6871504783630371},{"id":"https://openalex.org/C165838908","wikidata":"https://www.wikidata.org/wiki/Q736777","display_name":"Calibration","level":2,"score":0.6629428863525391},{"id":"https://openalex.org/C94915269","wikidata":"https://www.wikidata.org/wiki/Q1834857","display_name":"Detector","level":2,"score":0.5911468863487244},{"id":"https://openalex.org/C71139939","wikidata":"https://www.wikidata.org/wiki/Q910194","display_name":"Modal","level":2,"score":0.5801934003829956},{"id":"https://openalex.org/C133892786","wikidata":"https://www.wikidata.org/wiki/Q1145189","display_name":"Speaker recognition","level":2,"score":0.4881022870540619},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.4501044452190399},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3744962215423584},{"id":"https://openalex.org/C105795698","wikidata":"https://www.wikidata.org/wiki/Q12483","display_name":"Statistics","level":1,"score":0.07979705929756165},{"id":"https://openalex.org/C76155785","wikidata":"https://www.wikidata.org/wiki/Q418","display_name":"Telecommunications","level":1,"score":0.05833485722541809},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.05307832360267639},{"id":"https://openalex.org/C188027245","wikidata":"https://www.wikidata.org/wiki/Q750446","display_name":"Polymer chemistry","level":1,"score":0.0},{"id":"https://openalex.org/C185592680","wikidata":"https://www.wikidata.org/wiki/Q2329","display_name":"Chemistry","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/slt.2018.8639595","is_oa":false,"landing_page_url":"https://doi.org/10.1109/slt.2018.8639595","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2018 IEEE Spoken Language Technology Workshop (SLT)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/10","score":0.5600000023841858,"display_name":"Reduced inequalities"},{"id":"https://metadata.un.org/sdg/16","score":0.46000000834465027,"display_name":"Peace, Justice and strong institutions"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":26,"referenced_works":["https://openalex.org/W620149980","https://openalex.org/W1481604723","https://openalex.org/W1997237632","https://openalex.org/W2016770751","https://openalex.org/W2022047569","https://openalex.org/W2023238506","https://openalex.org/W2023582935","https://openalex.org/W2055589033","https://openalex.org/W2057888214","https://openalex.org/W2059673175","https://openalex.org/W2106790438","https://openalex.org/W2143694533","https://openalex.org/W2150769028","https://openalex.org/W2155517073","https://openalex.org/W2166943505","https://openalex.org/W2395750323","https://openalex.org/W2400137844","https://openalex.org/W2404617565","https://openalex.org/W2406312423","https://openalex.org/W2608946313","https://openalex.org/W2792811594","https://openalex.org/W2802973008","https://openalex.org/W2888794453","https://openalex.org/W2890964092","https://openalex.org/W6684352069","https://openalex.org/W6713727690"],"related_works":["https://openalex.org/W4297807400","https://openalex.org/W1491159402","https://openalex.org/W4313854686","https://openalex.org/W321304764","https://openalex.org/W2249138175","https://openalex.org/W3162054169","https://openalex.org/W1813780412","https://openalex.org/W289407349","https://openalex.org/W2029134149","https://openalex.org/W2368768466"],"abstract_inverted_index":{"Whisper":[0],"is":[1,22,55,79,82,99],"a":[2,43,113],"commonly":[3],"encountered":[4],"form":[5],"of":[6,30,35,46,95],"speech":[7,58,109],"that":[8],"differs":[9],"significantly":[10],"from":[11],"modal":[12],"speech.":[13],"As":[14],"speaker":[15,48],"recognition":[16,49],"technology":[17],"becomes":[18],"more":[19],"ubiquitous,":[20],"it":[21],"important":[23],"to":[24,62,67,76,84,102,112],"assess":[25],"the":[26,33,96],"abilities":[27],"and":[28,70,81,118],"limitations":[29],"systems":[31],"in":[32,115],"presence":[34],"variability":[36],"such":[37],"as":[38],"whisper.":[39],"In":[40],"this":[41],"paper,":[42],"comparative":[44],"evaluation":[45],"whispered":[47,108],"performance":[50,65],"across":[51,87],"two":[52],"independent":[53],"datasets":[54,88],"presented.":[56],"Whisper-neutral":[57],"comparisons":[59],"are":[60],"observed":[61],"consistently":[63],"degrade":[64],"relative":[66],"both":[68],"neutral-neutral":[69],"whisper-whisper":[71],"comparisons.":[72],"An":[73],"i-vector-based":[74],"approach":[75],"whisper":[77,97],"detection":[78],"introduced,":[80],"shown":[83],"perform":[85],"accurately":[86],"even":[89],"at":[90],"short":[91],"durations.":[92],"The":[93],"output":[94],"detector":[98],"subsequently":[100],"used":[101],"select":[103],"score":[104],"calibration":[105,117],"parameters":[106],"for":[107],"comparisons,":[110],"leading":[111],"reduction":[114],"global":[116],"discrimination":[119],"error.":[120]},"counts_by_year":[{"year":2024,"cited_by_count":1},{"year":2021,"cited_by_count":2},{"year":2020,"cited_by_count":1},{"year":2019,"cited_by_count":1}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
