{"id":"https://openalex.org/W1982589563","doi":"https://doi.org/10.1109/icassp.1991.150302","title":"Improved acoustic modeling for speaker independent large vocabulary continuous speech recognition","display_name":"Improved acoustic modeling for speaker independent large vocabulary continuous speech recognition","publication_year":1991,"publication_date":"1991-01-01","ids":{"openalex":"https://openalex.org/W1982589563","doi":"https://doi.org/10.1109/icassp.1991.150302","mag":"1982589563"},"language":"en","primary_location":{"id":"doi:10.1109/icassp.1991.150302","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.1991.150302","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"[Proceedings] ICASSP 91: 1991 International Conference on Acoustics, Speech, and Signal Processing","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5012762061","display_name":"C.-H. Lee","orcid":null},"institutions":[{"id":"https://openalex.org/I180949307","display_name":"Illinois Institute of Technology","ror":"https://ror.org/037t3ry66","country_code":"US","type":"education","lineage":["https://openalex.org/I180949307"]}],"countries":["US"],"is_corresponding":true,"raw_author_name":"C.-H. Lee","raw_affiliation_strings":["Dept of Electr. & Comput. Eng., Illinois Inst. of Technol., Chicago, IL, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Dept of Electr. & Comput. Eng., Illinois Inst. of Technol., Chicago, IL, USA","institution_ids":["https://openalex.org/I180949307"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":["https://openalex.org/A5012762061"],"corresponding_institution_ids":["https://openalex.org/I180949307"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":24,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"161","last_page":"164 vol.1"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":1.0,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":1.0,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.996999979019165,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9965999722480774,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.8006378412246704},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7738518714904785},{"id":"https://openalex.org/keywords/perplexity","display_name":"Perplexity","score":0.7556831240653992},{"id":"https://openalex.org/keywords/hidden-markov-model","display_name":"Hidden Markov model","score":0.7399325370788574},{"id":"https://openalex.org/keywords/word-error-rate","display_name":"Word error rate","score":0.6892375946044922},{"id":"https://openalex.org/keywords/vocabulary","display_name":"Vocabulary","score":0.5684434175491333},{"id":"https://openalex.org/keywords/word","display_name":"Word (group theory)","score":0.5680783987045288},{"id":"https://openalex.org/keywords/viterbi-algorithm","display_name":"Viterbi algorithm","score":0.5620539784431458},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.5304775834083557},{"id":"https://openalex.org/keywords/context","display_name":"Context (archaeology)","score":0.5295950770378113},{"id":"https://openalex.org/keywords/natural-language-processing","display_name":"Natural language processing","score":0.4437847435474396},{"id":"https://openalex.org/keywords/grammar","display_name":"Grammar","score":0.43958431482315063},{"id":"https://openalex.org/keywords/speaker-recognition","display_name":"Speaker recognition","score":0.43276649713516235},{"id":"https://openalex.org/keywords/feature","display_name":"Feature (linguistics)","score":0.4248066842556},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.22626981139183044},{"id":"https://openalex.org/keywords/linguistics","display_name":"Linguistics","score":0.09228917956352234}],"concepts":[{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.8006378412246704},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7738518714904785},{"id":"https://openalex.org/C100279451","wikidata":"https://www.wikidata.org/wiki/Q372193","display_name":"Perplexity","level":3,"score":0.7556831240653992},{"id":"https://openalex.org/C23224414","wikidata":"https://www.wikidata.org/wiki/Q176769","display_name":"Hidden Markov model","level":2,"score":0.7399325370788574},{"id":"https://openalex.org/C40969351","wikidata":"https://www.wikidata.org/wiki/Q3516228","display_name":"Word error rate","level":2,"score":0.6892375946044922},{"id":"https://openalex.org/C2777601683","wikidata":"https://www.wikidata.org/wiki/Q6499736","display_name":"Vocabulary","level":2,"score":0.5684434175491333},{"id":"https://openalex.org/C90805587","wikidata":"https://www.wikidata.org/wiki/Q10944557","display_name":"Word (group theory)","level":2,"score":0.5680783987045288},{"id":"https://openalex.org/C60582962","wikidata":"https://www.wikidata.org/wiki/Q83886","display_name":"Viterbi algorithm","level":3,"score":0.5620539784431458},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5304775834083557},{"id":"https://openalex.org/C2779343474","wikidata":"https://www.wikidata.org/wiki/Q3109175","display_name":"Context (archaeology)","level":2,"score":0.5295950770378113},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.4437847435474396},{"id":"https://openalex.org/C26022165","wikidata":"https://www.wikidata.org/wiki/Q8091","display_name":"Grammar","level":2,"score":0.43958431482315063},{"id":"https://openalex.org/C133892786","wikidata":"https://www.wikidata.org/wiki/Q1145189","display_name":"Speaker recognition","level":2,"score":0.43276649713516235},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.4248066842556},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.22626981139183044},{"id":"https://openalex.org/C41895202","wikidata":"https://www.wikidata.org/wiki/Q8162","display_name":"Linguistics","level":1,"score":0.09228917956352234},{"id":"https://openalex.org/C86803240","wikidata":"https://www.wikidata.org/wiki/Q420","display_name":"Biology","level":0,"score":0.0},{"id":"https://openalex.org/C151730666","wikidata":"https://www.wikidata.org/wiki/Q7205","display_name":"Paleontology","level":1,"score":0.0},{"id":"https://openalex.org/C138885662","wikidata":"https://www.wikidata.org/wiki/Q5891","display_name":"Philosophy","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icassp.1991.150302","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.1991.150302","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"[Proceedings] ICASSP 91: 1991 International Conference on Acoustics, Speech, and Signal Processing","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"score":0.5099999904632568,"id":"https://metadata.un.org/sdg/4","display_name":"Quality Education"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":9,"referenced_works":["https://openalex.org/W195864613","https://openalex.org/W1988155194","https://openalex.org/W2000629566","https://openalex.org/W2014058104","https://openalex.org/W2019914509","https://openalex.org/W2075815989","https://openalex.org/W2104687512","https://openalex.org/W2115002762","https://openalex.org/W2141790304"],"related_works":["https://openalex.org/W2136652457","https://openalex.org/W2169849734","https://openalex.org/W2160171981","https://openalex.org/W2116722627","https://openalex.org/W2385954530","https://openalex.org/W1975869217","https://openalex.org/W2236912844","https://openalex.org/W2129150969","https://openalex.org/W2401728283","https://openalex.org/W2383829109"],"abstract_inverted_index":{"The":[0,97],"authors":[1],"report":[2],"recent":[3],"improvements":[4],"to":[5,34],"an":[6,29],"HMM":[7],"(hidden,":[8],"Markov":[9],"model)-based,":[10],"continuous":[11],"speech":[12],"recognition":[13,36,51],"system.":[14,96],"These":[15],"advances,":[16],"which":[17,38],"include":[18],"the":[19,53,60,72,79,89,94,104,114],"incorporation":[20],"of":[21,52,68,76],"interword":[22],"context-dependent":[23],"units":[24,27],"and":[25,28,44],"position-dependent":[26],"improved":[30,73],"feature":[31],"analysis,":[32],"lead":[33],"a":[35,40,66],"system":[37],"gives":[39],"95%":[41],"word":[42,62,105,111],"accuracy":[43,47,112],"75%":[45],"sentence":[46],"for":[48,113],"speaker":[49],"independent":[50],"1000-word,":[54],"DARPA":[55,116],"resource":[56],"management":[57],"task":[58],"using":[59,103],"standard":[61],"pair":[63,106],"grammar":[64,107],"(with":[65],"perplexity":[67],"about":[69],"60).":[70],"With":[71],"acoustic":[74],"modeling":[75],"subword":[77],"units,":[78],"overall":[80],"error":[81],"rate":[82],"reduction":[83],"was":[84],"over":[85],"42%":[86],"compared":[87],"with":[88],"performance":[90],"results":[91,99],"reported":[92],"in":[93],"baseline":[95],"best":[98],"obtained":[100],"so":[101],"far":[102],"gave":[108],"95.2%":[109],"average":[110],"three":[115],"evaluation":[117],"sets.<":[118],"<ETX":[119],"xmlns:mml=\"http://www.w3.org/1998/Math/MathML\"":[120],"xmlns:xlink=\"http://www.w3.org/1999/xlink\">&gt;</ETX>":[121]},"counts_by_year":[{"year":2021,"cited_by_count":1},{"year":2014,"cited_by_count":1},{"year":2012,"cited_by_count":1}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
