{"id":"https://openalex.org/W2554224824","doi":"https://doi.org/10.1109/mlsp.2016.7738889","title":"A discriminative unsupervised method for speaker recognition using deep learning","display_name":"A discriminative unsupervised method for speaker recognition using deep learning","publication_year":2016,"publication_date":"2016-09-01","ids":{"openalex":"https://openalex.org/W2554224824","doi":"https://doi.org/10.1109/mlsp.2016.7738889","mag":"2554224824"},"language":"en","primary_location":{"id":"doi:10.1109/mlsp.2016.7738889","is_oa":false,"landing_page_url":"https://doi.org/10.1109/mlsp.2016.7738889","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2016 IEEE 26th International Workshop on Machine Learning for Signal Processing (MLSP)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5109351532","display_name":"Muhammad Muneeb Saleem","orcid":null},"institutions":[{"id":"https://openalex.org/I162577319","display_name":"The University of Texas at Dallas","ror":"https://ror.org/049emcs32","country_code":"US","type":"education","lineage":["https://openalex.org/I162577319"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Muhammad Muneeb Saleem","raw_affiliation_strings":["CRSS, University of Texas at Dallas","VWGoA, Electronics Research Laboratory"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"CRSS, University of Texas at Dallas","institution_ids":["https://openalex.org/I162577319"]},{"raw_affiliation_string":"VWGoA, Electronics Research Laboratory","institution_ids":[]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5057910370","display_name":"John H. L. Hansen","orcid":"https://orcid.org/0000-0003-1382-9929"},"institutions":[{"id":"https://openalex.org/I162577319","display_name":"The University of Texas at Dallas","ror":"https://ror.org/049emcs32","country_code":"US","type":"education","lineage":["https://openalex.org/I162577319"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"John H.L. Hansen","raw_affiliation_strings":["CRSS, University of Texas at Dallas"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"CRSS, University of Texas at Dallas","institution_ids":["https://openalex.org/I162577319"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I162577319"],"apc_list":null,"apc_paid":null,"fwci":0.5824,"has_fulltext":false,"cited_by_count":5,"citation_normalized_percentile":{"value":0.69569224,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":89,"max":96},"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"5"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9991999864578247,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9987000226974487,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/discriminative-model","display_name":"Discriminative model","score":0.8060605525970459},{"id":"https://openalex.org/keywords/cluster-analysis","display_name":"Cluster analysis","score":0.7201480865478516},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7090976238250732},{"id":"https://openalex.org/keywords/mixture-model","display_name":"Mixture model","score":0.6612690687179565},{"id":"https://openalex.org/keywords/nist","display_name":"NIST","score":0.6421605348587036},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.632916271686554},{"id":"https://openalex.org/keywords/pattern-recognition","display_name":"Pattern recognition (psychology)","score":0.6190744042396545},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.6015320420265198},{"id":"https://openalex.org/keywords/restricted-boltzmann-machine","display_name":"Restricted Boltzmann machine","score":0.5641059875488281},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.5315204858779907},{"id":"https://openalex.org/keywords/acoustic-space","display_name":"Acoustic space","score":0.5089035034179688},{"id":"https://openalex.org/keywords/feature-vector","display_name":"Feature vector","score":0.508815348148346},{"id":"https://openalex.org/keywords/speaker-recognition","display_name":"Speaker recognition","score":0.4939013123512268},{"id":"https://openalex.org/keywords/acoustic-wave","display_name":"Acoustic wave","score":0.07441109418869019}],"concepts":[{"id":"https://openalex.org/C97931131","wikidata":"https://www.wikidata.org/wiki/Q5282087","display_name":"Discriminative model","level":2,"score":0.8060605525970459},{"id":"https://openalex.org/C73555534","wikidata":"https://www.wikidata.org/wiki/Q622825","display_name":"Cluster analysis","level":2,"score":0.7201480865478516},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7090976238250732},{"id":"https://openalex.org/C61224824","wikidata":"https://www.wikidata.org/wiki/Q2260434","display_name":"Mixture model","level":2,"score":0.6612690687179565},{"id":"https://openalex.org/C111219384","wikidata":"https://www.wikidata.org/wiki/Q6954384","display_name":"NIST","level":2,"score":0.6421605348587036},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.632916271686554},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.6190744042396545},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.6015320420265198},{"id":"https://openalex.org/C199354608","wikidata":"https://www.wikidata.org/wiki/Q7316287","display_name":"Restricted Boltzmann machine","level":3,"score":0.5641059875488281},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.5315204858779907},{"id":"https://openalex.org/C108250783","wikidata":"https://www.wikidata.org/wiki/Q4674710","display_name":"Acoustic space","level":3,"score":0.5089035034179688},{"id":"https://openalex.org/C83665646","wikidata":"https://www.wikidata.org/wiki/Q42139305","display_name":"Feature vector","level":2,"score":0.508815348148346},{"id":"https://openalex.org/C133892786","wikidata":"https://www.wikidata.org/wiki/Q1145189","display_name":"Speaker recognition","level":2,"score":0.4939013123512268},{"id":"https://openalex.org/C204723758","wikidata":"https://www.wikidata.org/wiki/Q3882459","display_name":"Acoustic wave","level":2,"score":0.07441109418869019},{"id":"https://openalex.org/C120665830","wikidata":"https://www.wikidata.org/wiki/Q14620","display_name":"Optics","level":1,"score":0.0},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/mlsp.2016.7738889","is_oa":false,"landing_page_url":"https://doi.org/10.1109/mlsp.2016.7738889","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2016 IEEE 26th International Workshop on Machine Learning for Signal Processing (MLSP)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Reduced inequalities","score":0.7300000190734863,"id":"https://metadata.un.org/sdg/10"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":19,"referenced_works":["https://openalex.org/W1563120900","https://openalex.org/W2004497042","https://openalex.org/W2034626437","https://openalex.org/W2037786411","https://openalex.org/W2039057510","https://openalex.org/W2090716422","https://openalex.org/W2091825929","https://openalex.org/W2136922672","https://openalex.org/W2150769028","https://openalex.org/W2160815625","https://openalex.org/W2183016404","https://openalex.org/W2184045248","https://openalex.org/W2286791092","https://openalex.org/W2400388989","https://openalex.org/W2403004610","https://openalex.org/W2964138484","https://openalex.org/W4285719527","https://openalex.org/W6660100217","https://openalex.org/W6695989856"],"related_works":["https://openalex.org/W1197719229","https://openalex.org/W2381158726","https://openalex.org/W1992796048","https://openalex.org/W2129090883","https://openalex.org/W1516392727","https://openalex.org/W2379906719","https://openalex.org/W2412815366","https://openalex.org/W2181956362","https://openalex.org/W2136153680","https://openalex.org/W2972577568"],"abstract_inverted_index":{"A":[0],"Gaussian":[1],"mixture":[2],"model":[3,62],"(GMM)":[4],"is":[5,28,79,97,106,119,139,157],"used":[6,81,99,140],"in":[7,34,187],"state-of-the-art":[8],"i-Vector":[9],"based":[10,159],"speaker":[11],"recognition":[12],"systems":[13],"for":[14,64,100,112,116,145],"acoustic":[15,25,32,101,147],"space":[16,26,66,102,148],"division":[17],"and":[18,68,150],"prediction.":[19,69,151],"The":[20,110,173],"main":[21,42],"purpose":[22],"of":[23,44,88,142,166],"such":[24,117],"clustering":[27,67,149,156],"to":[29,58,82,122],"constrain":[30],"the":[31,41,59,84,89,95,104,120,143,155,161],"comparison":[33],"small":[35],"regions":[36],"where":[37],"between-speaker":[38],"differences":[39],"are":[40],"source":[43],"variability.":[45],"In":[46,70,91,129,152],"this":[47,92,153],"study,":[48],"we":[49],"investigate":[50],"two":[51],"unsupervised":[52],"discriminative":[53],"approaches":[54],"as":[55],"an":[56],"alternative":[57],"universal":[60],"background":[61],"(UBM)":[63],"feature":[65],"our":[71,130,178],"first":[72,179],"approach,":[73,93,132,154],"a":[74,114,133,170],"deep":[75],"neural":[76],"network":[77],"(DNN)":[78],"directly":[80],"estimate":[83],"mixture-wise":[85],"posterior":[86],"probabilities":[87],"UBM.":[90],"while":[94],"UBM":[96,144],"still":[98],"division,":[103],"prediction":[105,118],"performed":[107,158],"using":[108,113,169,177],"DNN.":[109],"motivation":[111],"DNN":[115],"ability":[121],"learn":[123],"invariant":[124],"higher":[125,162],"level":[126,163],"features":[127,168],"discriminatively.":[128],"second":[131],"stacked":[134,171],"restricted":[135],"Boltzmann":[136],"machine":[137],"(RBM)":[138],"instead":[141],"both":[146],"on":[160,191],"distributed":[164],"representations":[165],"speech":[167],"RBM.":[172],"stand":[174],"alone":[175],"system":[176],"approach":[180],"(UBM-DNN)":[181],"improves":[182],"overall":[183],"performance":[184],"by":[185],"+14%":[186],"minDCFio":[188],"when":[189],"evaluated":[190],"NIST":[192],"SRE":[193],"2010.":[194]},"counts_by_year":[{"year":2021,"cited_by_count":1},{"year":2020,"cited_by_count":1},{"year":2019,"cited_by_count":1},{"year":2018,"cited_by_count":2}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
