{"id":"https://openalex.org/W2962985762","doi":"https://doi.org/10.1109/icdsp.2018.8631697","title":"End-to-End Residual CNN with L-GM Loss Speaker Verification System","display_name":"End-to-End Residual CNN with L-GM Loss Speaker Verification System","publication_year":2018,"publication_date":"2018-11-01","ids":{"openalex":"https://openalex.org/W2962985762","doi":"https://doi.org/10.1109/icdsp.2018.8631697","mag":"2962985762"},"language":"en","primary_location":{"id":"doi:10.1109/icdsp.2018.8631697","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icdsp.2018.8631697","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2018 IEEE 23rd International Conference on Digital Signal Processing (DSP)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5101907238","display_name":"Xuan Shi","orcid":"https://orcid.org/0000-0002-1387-5418"},"institutions":[{"id":"https://openalex.org/I113940042","display_name":"Shanghai University","ror":"https://ror.org/006teas31","country_code":"CN","type":"education","lineage":["https://openalex.org/I113940042"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Xuan Shi","raw_affiliation_strings":["School of Communication and Information Engineering, Shanghai University Shanghai, China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"School of Communication and Information Engineering, Shanghai University Shanghai, China","institution_ids":["https://openalex.org/I113940042"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5091528537","display_name":"Xingjian Du","orcid":null},"institutions":[{"id":"https://openalex.org/I113940042","display_name":"Shanghai University","ror":"https://ror.org/006teas31","country_code":"CN","type":"education","lineage":["https://openalex.org/I113940042"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Xingjian Du","raw_affiliation_strings":["School of Communication and Information Engineering, Shanghai University Shanghai, China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"School of Communication and Information Engineering, Shanghai University Shanghai, China","institution_ids":["https://openalex.org/I113940042"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5100612418","display_name":"Mengyao Zhu","orcid":"https://orcid.org/0000-0002-1069-4427"},"institutions":[{"id":"https://openalex.org/I113940042","display_name":"Shanghai University","ror":"https://ror.org/006teas31","country_code":"CN","type":"education","lineage":["https://openalex.org/I113940042"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Mengyao Zhu","raw_affiliation_strings":["School of Communication and Information Engineering, Shanghai University Shanghai, China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"School of Communication and Information Engineering, Shanghai University Shanghai, China","institution_ids":["https://openalex.org/I113940042"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I113940042"],"apc_list":null,"apc_paid":null,"fwci":0.4527,"has_fulltext":false,"cited_by_count":4,"citation_normalized_percentile":{"value":0.69417963,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":89,"max":96},"biblio":{"volume":"64","issue":null,"first_page":"1","last_page":"5"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9997000098228455,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9997000098228455,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9987999796867371,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9965000152587891,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/residual","display_name":"Residual","score":0.7893028259277344},{"id":"https://openalex.org/keywords/margin","display_name":"Margin (machine learning)","score":0.7290279865264893},{"id":"https://openalex.org/keywords/speaker-verification","display_name":"Speaker verification","score":0.7147400379180908},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.6736551523208618},{"id":"https://openalex.org/keywords/residual-neural-network","display_name":"Residual neural network","score":0.653713047504425},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.6273692846298218},{"id":"https://openalex.org/keywords/gaussian","display_name":"Gaussian","score":0.6185331344604492},{"id":"https://openalex.org/keywords/mixture-model","display_name":"Mixture model","score":0.5724403858184814},{"id":"https://openalex.org/keywords/regularization","display_name":"Regularization (linguistics)","score":0.5385592579841614},{"id":"https://openalex.org/keywords/speaker-recognition","display_name":"Speaker recognition","score":0.47925519943237305},{"id":"https://openalex.org/keywords/end-to-end-principle","display_name":"End-to-end principle","score":0.46383652091026306},{"id":"https://openalex.org/keywords/utterance","display_name":"Utterance","score":0.45965686440467834},{"id":"https://openalex.org/keywords/pattern-recognition","display_name":"Pattern recognition (psychology)","score":0.4163843095302582},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.39217495918273926},{"id":"https://openalex.org/keywords/algorithm","display_name":"Algorithm","score":0.32136639952659607},{"id":"https://openalex.org/keywords/machine-learning","display_name":"Machine learning","score":0.16505736112594604}],"concepts":[{"id":"https://openalex.org/C155512373","wikidata":"https://www.wikidata.org/wiki/Q287450","display_name":"Residual","level":2,"score":0.7893028259277344},{"id":"https://openalex.org/C774472","wikidata":"https://www.wikidata.org/wiki/Q6760393","display_name":"Margin (machine learning)","level":2,"score":0.7290279865264893},{"id":"https://openalex.org/C2982762665","wikidata":"https://www.wikidata.org/wiki/Q1145189","display_name":"Speaker verification","level":3,"score":0.7147400379180908},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6736551523208618},{"id":"https://openalex.org/C2944601119","wikidata":"https://www.wikidata.org/wiki/Q43744058","display_name":"Residual neural network","level":3,"score":0.653713047504425},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.6273692846298218},{"id":"https://openalex.org/C163716315","wikidata":"https://www.wikidata.org/wiki/Q901177","display_name":"Gaussian","level":2,"score":0.6185331344604492},{"id":"https://openalex.org/C61224824","wikidata":"https://www.wikidata.org/wiki/Q2260434","display_name":"Mixture model","level":2,"score":0.5724403858184814},{"id":"https://openalex.org/C2776135515","wikidata":"https://www.wikidata.org/wiki/Q17143721","display_name":"Regularization (linguistics)","level":2,"score":0.5385592579841614},{"id":"https://openalex.org/C133892786","wikidata":"https://www.wikidata.org/wiki/Q1145189","display_name":"Speaker recognition","level":2,"score":0.47925519943237305},{"id":"https://openalex.org/C74296488","wikidata":"https://www.wikidata.org/wiki/Q2527392","display_name":"End-to-end principle","level":2,"score":0.46383652091026306},{"id":"https://openalex.org/C2775852435","wikidata":"https://www.wikidata.org/wiki/Q258403","display_name":"Utterance","level":2,"score":0.45965686440467834},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.4163843095302582},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.39217495918273926},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.32136639952659607},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.16505736112594604},{"id":"https://openalex.org/C62520636","wikidata":"https://www.wikidata.org/wiki/Q944","display_name":"Quantum mechanics","level":1,"score":0.0},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icdsp.2018.8631697","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icdsp.2018.8631697","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2018 IEEE 23rd International Conference on Digital Signal Processing (DSP)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"score":0.4699999988079071,"display_name":"Quality Education","id":"https://metadata.un.org/sdg/4"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":21,"referenced_works":["https://openalex.org/W2039057510","https://openalex.org/W2096733369","https://openalex.org/W2111805153","https://openalex.org/W2114925438","https://openalex.org/W2137286467","https://openalex.org/W2139634554","https://openalex.org/W2150769028","https://openalex.org/W2160815625","https://openalex.org/W2161471225","https://openalex.org/W2167924613","https://openalex.org/W2520774990","https://openalex.org/W2612434969","https://openalex.org/W2619896406","https://openalex.org/W2725282991","https://openalex.org/W2726515241","https://openalex.org/W2782645198","https://openalex.org/W2963166243","https://openalex.org/W3099206234","https://openalex.org/W4234330420","https://openalex.org/W6677390740","https://openalex.org/W6737575990"],"related_works":["https://openalex.org/W2018623685","https://openalex.org/W66821593","https://openalex.org/W1521299571","https://openalex.org/W1197719229","https://openalex.org/W2381158726","https://openalex.org/W2316548414","https://openalex.org/W4235705411","https://openalex.org/W1992796048","https://openalex.org/W2972909277","https://openalex.org/W4380906377"],"abstract_inverted_index":{"We":[0],"propose":[1],"an":[2],"end-to-end":[3,23],"speaker":[4,24,43,68],"verification":[5,25,69],"system":[6,26],"based":[7],"on":[8],"the":[9,48,56,67,75],"neural":[10],"network":[11],"and":[12,45,58],"trained":[13],"by":[14,55,87],"a":[15,32],"loss":[16,52,64,82],"function":[17,65],"with":[18,78],"less":[19],"computational":[20],"complexity.":[21],"The":[22],"in":[27,92],"this":[28],"paper":[29],"consists":[30],"of":[31],"ResNet":[33],"architecture":[34],"to":[35],"extract":[36],"features":[37],"from":[38],"utterance,":[39],"then":[40],"produces":[41],"utterance-level":[42],"embeddings,":[44],"train":[46],"using":[47],"large-margin":[49,57,61,79],"Gaussian":[50,62,80],"Mixture":[51,63,81],"function.":[53],"Influenced":[54],"likelihood":[59],"regularization,":[60],"benefits":[66],"performance.":[70],"Experimental":[71],"results":[72],"demonstrate":[73],"that":[74],"Residual":[76],"CNN":[77],"outperforms":[83],"DNN-based":[84],"i-vector":[85],"baseline":[86],"more":[88],"than":[89],"10%":[90],"improvement":[91],"accuracy":[93],"rate.":[94]},"counts_by_year":[{"year":2021,"cited_by_count":1},{"year":2020,"cited_by_count":2},{"year":2019,"cited_by_count":1}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
