{"id":"https://openalex.org/W3029837356","doi":"https://doi.org/10.1145/3383972.3384050","title":"Application of Word2vec in Phoneme Recognition","display_name":"Application of Word2vec in Phoneme Recognition","publication_year":2020,"publication_date":"2020-02-15","ids":{"openalex":"https://openalex.org/W3029837356","doi":"https://doi.org/10.1145/3383972.3384050","mag":"3029837356"},"language":"en","primary_location":{"id":"doi:10.1145/3383972.3384050","is_oa":false,"landing_page_url":"https://doi.org/10.1145/3383972.3384050","pdf_url":null,"source":null,"license":"public-domain","license_id":"https://openalex.org/licenses/public-domain","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 2020 12th International Conference on Machine Learning and Computing","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5090985486","display_name":"Xin Feng","orcid":"https://orcid.org/0000-0002-8430-1980"},"institutions":[{"id":"https://openalex.org/I139759216","display_name":"Beijing University of Posts and Telecommunications","ror":"https://ror.org/04w9fbh59","country_code":"CN","type":"education","lineage":["https://openalex.org/I139759216"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Xin Feng","raw_affiliation_strings":["Beijing University of Posts and Telecommunications, Beijing, China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Beijing University of Posts and Telecommunications, Beijing, China","institution_ids":["https://openalex.org/I139759216"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5101580334","display_name":"Lei Wang","orcid":"https://orcid.org/0000-0003-3334-8348"},"institutions":[{"id":"https://openalex.org/I139759216","display_name":"Beijing University of Posts and Telecommunications","ror":"https://ror.org/04w9fbh59","country_code":"CN","type":"education","lineage":["https://openalex.org/I139759216"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Lei Wang","raw_affiliation_strings":["Beijing University of Posts and Telecommunications, Beijing, China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Beijing University of Posts and Telecommunications, Beijing, China","institution_ids":["https://openalex.org/I139759216"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I139759216"],"apc_list":null,"apc_paid":null,"fwci":0.23,"has_fulltext":false,"cited_by_count":2,"citation_normalized_percentile":{"value":0.46980224,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":89,"max":94},"biblio":{"volume":null,"issue":null,"first_page":"495","last_page":"499"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9987999796867371,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9987999796867371,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9854000210762024,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9828000068664551,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/word2vec","display_name":"Word2vec","score":0.8431020975112915},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.8262491226196289},{"id":"https://openalex.org/keywords/overfitting","display_name":"Overfitting","score":0.7489897012710571},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.7218965888023376},{"id":"https://openalex.org/keywords/timit","display_name":"TIMIT","score":0.666069507598877},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.5372030735015869},{"id":"https://openalex.org/keywords/pattern-recognition","display_name":"Pattern recognition (psychology)","score":0.4816947877407074},{"id":"https://openalex.org/keywords/acoustic-model","display_name":"Acoustic model","score":0.4771796464920044},{"id":"https://openalex.org/keywords/embedding","display_name":"Embedding","score":0.43982982635498047},{"id":"https://openalex.org/keywords/data-modeling","display_name":"Data modeling","score":0.41952186822891235},{"id":"https://openalex.org/keywords/hidden-markov-model","display_name":"Hidden Markov model","score":0.3614787757396698},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.30066296458244324},{"id":"https://openalex.org/keywords/speech-processing","display_name":"Speech processing","score":0.19120198488235474},{"id":"https://openalex.org/keywords/database","display_name":"Database","score":0.13478082418441772}],"concepts":[{"id":"https://openalex.org/C2776461190","wikidata":"https://www.wikidata.org/wiki/Q22673982","display_name":"Word2vec","level":3,"score":0.8431020975112915},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8262491226196289},{"id":"https://openalex.org/C22019652","wikidata":"https://www.wikidata.org/wiki/Q331309","display_name":"Overfitting","level":3,"score":0.7489897012710571},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.7218965888023376},{"id":"https://openalex.org/C2778724510","wikidata":"https://www.wikidata.org/wiki/Q7670405","display_name":"TIMIT","level":3,"score":0.666069507598877},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5372030735015869},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.4816947877407074},{"id":"https://openalex.org/C155635449","wikidata":"https://www.wikidata.org/wiki/Q4674699","display_name":"Acoustic model","level":3,"score":0.4771796464920044},{"id":"https://openalex.org/C41608201","wikidata":"https://www.wikidata.org/wiki/Q980509","display_name":"Embedding","level":2,"score":0.43982982635498047},{"id":"https://openalex.org/C67186912","wikidata":"https://www.wikidata.org/wiki/Q367664","display_name":"Data modeling","level":2,"score":0.41952186822891235},{"id":"https://openalex.org/C23224414","wikidata":"https://www.wikidata.org/wiki/Q176769","display_name":"Hidden Markov model","level":2,"score":0.3614787757396698},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.30066296458244324},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.19120198488235474},{"id":"https://openalex.org/C77088390","wikidata":"https://www.wikidata.org/wiki/Q8513","display_name":"Database","level":1,"score":0.13478082418441772}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1145/3383972.3384050","is_oa":false,"landing_page_url":"https://doi.org/10.1145/3383972.3384050","pdf_url":null,"source":null,"license":"public-domain","license_id":"https://openalex.org/licenses/public-domain","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 2020 12th International Conference on Machine Learning and Computing","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Quality Education","score":0.6700000166893005,"id":"https://metadata.un.org/sdg/4"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":16,"referenced_works":["https://openalex.org/W423095831","https://openalex.org/W648786980","https://openalex.org/W854541894","https://openalex.org/W1635512741","https://openalex.org/W1995562189","https://openalex.org/W2102113734","https://openalex.org/W2153579005","https://openalex.org/W2160815625","https://openalex.org/W2193413348","https://openalex.org/W2293634267","https://openalex.org/W2327501763","https://openalex.org/W2606429533","https://openalex.org/W2627092829","https://openalex.org/W2730845691","https://openalex.org/W6600384961","https://openalex.org/W6621869305"],"related_works":["https://openalex.org/W4288040805","https://openalex.org/W2962874523","https://openalex.org/W2125329182","https://openalex.org/W2935794029","https://openalex.org/W2050397613","https://openalex.org/W2972574141","https://openalex.org/W2100768664","https://openalex.org/W2927191280","https://openalex.org/W2072788898","https://openalex.org/W2971257213"],"abstract_inverted_index":{"In":[0],"this":[1],"paper,":[2],"we":[3,82],"present":[4],"how":[5],"to":[6,40,67,96,104],"hybridize":[7],"a":[8,20,37,84,120],"Word2vec":[9],"model":[10,35,39,78,127],"and":[11,28],"an":[12],"attention-based":[13],"end-to-end":[14],"speech":[15],"recognition":[16,22,34,77],"model.":[17,30],"We":[18],"build":[19],"phoneme":[21,33,58,76,90,108],"system":[23],"based":[24],"on":[25,79],"Listen,":[26],"Attend":[27],"Spell":[29],"And":[31],"the":[32,42,46,49,54,57,62,69,74,99,102,112,117,130,134],"uses":[36],"word2vec":[38],"initialize":[41],"embedding":[43,59],"matrix":[44],"for":[45,123],"improvement":[47],"of":[48,71,101,114],"performance,":[50],"which":[51,137],"can":[52,128],"increase":[53],"distance":[55],"among":[56],"vectors.":[60],"At":[61,111],"same":[63],"time,":[64],"in":[65,73],"order":[66],"solve":[68],"problem":[70],"overfitting":[72],"61":[75,107],"TIMIT":[80,135],"dataset,":[81],"propose":[83],"new":[85],"training":[86,109],"method.":[87],"A":[88],"61-39":[89],"mapping":[91],"comparison":[92],"table":[93],"is":[94,138],"used":[95],"inverse":[97],"map":[98],"phonemes":[100],"dataset":[103,118,122,136],"generate":[105],"more":[106],"data.":[110],"end":[113],"training,":[115],"replace":[116],"with":[119],"standard":[121],"corrective":[124],"training.":[125],"Our":[126],"achieve":[129],"best":[131],"result":[132],"under":[133],"16.5%":[139],"PER":[140],"(Phoneme":[141],"Error":[142],"Rate).":[143]},"counts_by_year":[{"year":2023,"cited_by_count":1},{"year":2020,"cited_by_count":1}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
