{"id":"https://openalex.org/W2641129314","doi":"https://doi.org/10.1109/icassp.2017.7953086","title":"Unsupervised speaker adaptation of batch normalized acoustic models for robust ASR","display_name":"Unsupervised speaker adaptation of batch normalized acoustic models for robust ASR","publication_year":2017,"publication_date":"2017-03-01","ids":{"openalex":"https://openalex.org/W2641129314","doi":"https://doi.org/10.1109/icassp.2017.7953086","mag":"2641129314"},"language":"en","primary_location":{"id":"doi:10.1109/icassp.2017.7953086","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2017.7953086","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5101607498","display_name":"Zhong-Qiu Wang","orcid":"https://orcid.org/0000-0002-4204-9430"},"institutions":[{"id":"https://openalex.org/I52357470","display_name":"The Ohio State University","ror":"https://ror.org/00rs6vg23","country_code":"US","type":"education","lineage":["https://openalex.org/I52357470"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Zhong-Qiu Wang","raw_affiliation_strings":["Department of Computer Science and Engineering, The Ohio State University, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Computer Science and Engineering, The Ohio State University, USA","institution_ids":["https://openalex.org/I52357470"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5051837453","display_name":"DeLiang Wang","orcid":"https://orcid.org/0000-0001-8195-6319"},"institutions":[{"id":"https://openalex.org/I52357470","display_name":"The Ohio State University","ror":"https://ror.org/00rs6vg23","country_code":"US","type":"education","lineage":["https://openalex.org/I52357470"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"DeLiang Wang","raw_affiliation_strings":["Center for Cognitive and Brain Sciences, The Ohio State University, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Center for Cognitive and Brain Sciences, The Ohio State University, USA","institution_ids":["https://openalex.org/I52357470"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I52357470"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":18,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"4890","last_page":"4894"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9993000030517578,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9983000159263611,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/normalization","display_name":"Normalization (sociology)","score":0.9186230897903442},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7119104862213135},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.6438024640083313},{"id":"https://openalex.org/keywords/decoding-methods","display_name":"Decoding methods","score":0.523207426071167},{"id":"https://openalex.org/keywords/pattern-recognition","display_name":"Pattern recognition (psychology)","score":0.5231099128723145},{"id":"https://openalex.org/keywords/adaptation","display_name":"Adaptation (eye)","score":0.5086041688919067},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.4739546775817871},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.47129666805267334},{"id":"https://openalex.org/keywords/linear-model","display_name":"Linear model","score":0.4256684184074402},{"id":"https://openalex.org/keywords/deep-neural-networks","display_name":"Deep neural networks","score":0.4226624071598053},{"id":"https://openalex.org/keywords/algorithm","display_name":"Algorithm","score":0.2705105245113373},{"id":"https://openalex.org/keywords/machine-learning","display_name":"Machine learning","score":0.21306970715522766}],"concepts":[{"id":"https://openalex.org/C136886441","wikidata":"https://www.wikidata.org/wiki/Q926129","display_name":"Normalization (sociology)","level":2,"score":0.9186230897903442},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7119104862213135},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.6438024640083313},{"id":"https://openalex.org/C57273362","wikidata":"https://www.wikidata.org/wiki/Q576722","display_name":"Decoding methods","level":2,"score":0.523207426071167},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.5231099128723145},{"id":"https://openalex.org/C139807058","wikidata":"https://www.wikidata.org/wiki/Q352374","display_name":"Adaptation (eye)","level":2,"score":0.5086041688919067},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4739546775817871},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.47129666805267334},{"id":"https://openalex.org/C163175372","wikidata":"https://www.wikidata.org/wiki/Q3339222","display_name":"Linear model","level":2,"score":0.4256684184074402},{"id":"https://openalex.org/C2984842247","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep neural networks","level":3,"score":0.4226624071598053},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.2705105245113373},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.21306970715522766},{"id":"https://openalex.org/C120665830","wikidata":"https://www.wikidata.org/wiki/Q14620","display_name":"Optics","level":1,"score":0.0},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.0},{"id":"https://openalex.org/C19165224","wikidata":"https://www.wikidata.org/wiki/Q23404","display_name":"Anthropology","level":1,"score":0.0},{"id":"https://openalex.org/C144024400","wikidata":"https://www.wikidata.org/wiki/Q21201","display_name":"Sociology","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icassp.2017.7953086","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2017.7953086","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"score":0.5400000214576721,"id":"https://metadata.un.org/sdg/4","display_name":"Quality Education"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":45,"referenced_works":["https://openalex.org/W82936479","https://openalex.org/W1836465849","https://openalex.org/W1895577753","https://openalex.org/W1989364685","https://openalex.org/W1989549063","https://openalex.org/W2002342963","https://openalex.org/W2010362084","https://openalex.org/W2035576074","https://openalex.org/W2048526313","https://openalex.org/W2056738732","https://openalex.org/W2062164080","https://openalex.org/W2069681747","https://openalex.org/W2079623482","https://openalex.org/W2087006792","https://openalex.org/W2094147890","https://openalex.org/W2141411743","https://openalex.org/W2146502635","https://openalex.org/W2160306971","https://openalex.org/W2168379380","https://openalex.org/W2176412452","https://openalex.org/W2193413348","https://openalex.org/W2213952365","https://openalex.org/W2239847623","https://openalex.org/W2288645994","https://openalex.org/W2289394825","https://openalex.org/W2289480995","https://openalex.org/W2289731793","https://openalex.org/W2290075840","https://openalex.org/W2295119550","https://openalex.org/W2296167893","https://openalex.org/W2398042854","https://openalex.org/W2406264770","https://openalex.org/W2407299475","https://openalex.org/W2408125366","https://openalex.org/W2949117887","https://openalex.org/W2963285578","https://openalex.org/W3125118953","https://openalex.org/W6603403951","https://openalex.org/W6638667902","https://openalex.org/W6672565315","https://openalex.org/W6681435938","https://openalex.org/W6685562342","https://openalex.org/W6687566353","https://openalex.org/W6688428952","https://openalex.org/W6697090674"],"related_works":["https://openalex.org/W2591697403","https://openalex.org/W2953716828","https://openalex.org/W2904857019","https://openalex.org/W2944728705","https://openalex.org/W3011538607","https://openalex.org/W2904022177","https://openalex.org/W2359348847","https://openalex.org/W4321441197","https://openalex.org/W4287755480","https://openalex.org/W3113607506"],"abstract_inverted_index":{"Batch":[0],"normalization":[1,59],"is":[2,20,49],"a":[3,35,139],"standard":[4],"technique":[5,40],"for":[6,41,60,80],"training":[7,97],"deep":[8],"neural":[9],"networks.":[10],"In":[11],"batch":[12,42,58],"normalization,":[13],"the":[14,52,62,67,72,76,84,88,96,101,105,108,120,124,129,145],"input":[15,89],"of":[16,71,87,90,107,123],"each":[17,81,91],"hidden":[18,63,92],"layer":[19,93],"first":[21],"mean-variance":[22],"normalized":[23,43],"and":[24,138],"then":[25],"linearly":[26],"transformed":[27],"before":[28],"applying":[29],"non-linear":[30],"activation":[31],"functions.":[32],"We":[33],"propose":[34],"novel":[36],"unsupervised":[37],"speaker":[38],"adaptation":[39,111],"acoustic":[44],"models.":[45],"The":[46],"key":[47],"idea":[48],"to":[50,66,136],"adjust":[51],"linear":[53,78],"transformations":[54,79],"previously":[55],"learned":[56],"by":[57],"all":[61],"layers":[64],"according":[65],"first-pass":[68],"decoding":[69],"results":[70],"speaker-independent":[73],"model.":[74],"With":[75],"adjusted":[77],"test":[82,85,125],"speaker,":[83],"distribution":[86],"better":[94],"matches":[95],"distribution.":[98],"Experiments":[99],"on":[100,119,133],"CHiME-3":[102],"dataset":[103,135],"demonstrate":[104],"effectiveness":[106],"proposed":[109],"layer-wise":[110],"approach.":[112],"Our":[113],"overall":[114],"system":[115],"obtains":[116],"4.24%":[117],"WER":[118],"real":[121],"subset":[122],"data,":[126],"which":[127],"represents":[128],"best":[130,147],"reported":[131],"result":[132],"this":[134],"date":[137],"relative":[140],"27.3%":[141],"error":[142],"reduction":[143],"over":[144],"previous":[146],"result.":[148]},"counts_by_year":[{"year":2023,"cited_by_count":3},{"year":2021,"cited_by_count":1},{"year":2020,"cited_by_count":4},{"year":2019,"cited_by_count":3},{"year":2018,"cited_by_count":6},{"year":2017,"cited_by_count":1}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
