{"id":"https://openalex.org/W2892258132","doi":"https://doi.org/10.1109/icassp.2018.8462044","title":"Application of Progressive Neural Networks for Multi-Stream Wfst Combination in One-Pass Decoding","display_name":"Application of Progressive Neural Networks for Multi-Stream Wfst Combination in One-Pass Decoding","publication_year":2018,"publication_date":"2018-04-01","ids":{"openalex":"https://openalex.org/W2892258132","doi":"https://doi.org/10.1109/icassp.2018.8462044","mag":"2892258132"},"language":"en","primary_location":{"id":"doi:10.1109/icassp.2018.8462044","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2018.8462044","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5111241700","display_name":"Sirui Xu","orcid":null},"institutions":[{"id":"https://openalex.org/I52357470","display_name":"The Ohio State University","ror":"https://ror.org/00rs6vg23","country_code":"US","type":"education","lineage":["https://openalex.org/I52357470"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Sirui Xu","raw_affiliation_strings":["Department of Computer Science and Engineering, The Ohio State University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Computer Science and Engineering, The Ohio State University","institution_ids":["https://openalex.org/I52357470"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5056667180","display_name":"Eric Fosler\u2010Lussier","orcid":"https://orcid.org/0000-0001-8004-5169"},"institutions":[{"id":"https://openalex.org/I52357470","display_name":"The Ohio State University","ror":"https://ror.org/00rs6vg23","country_code":"US","type":"education","lineage":["https://openalex.org/I52357470"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Eric Fosler-Lussier","raw_affiliation_strings":["Department of Computer Science and Engineering, The Ohio State University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Computer Science and Engineering, The Ohio State University","institution_ids":["https://openalex.org/I52357470"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I52357470"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":2,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":"27","issue":null,"first_page":"5914","last_page":"5918"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998000264167786,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998000264167786,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9993000030517578,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9945999979972839,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.8021600246429443},{"id":"https://openalex.org/keywords/decoding-methods","display_name":"Decoding methods","score":0.7354438900947571},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.6684615015983582},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.5652319192886353},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.5169007778167725},{"id":"https://openalex.org/keywords/word","display_name":"Word (group theory)","score":0.4982142448425293},{"id":"https://openalex.org/keywords/noise","display_name":"Noise (video)","score":0.4818488359451294},{"id":"https://openalex.org/keywords/waveform","display_name":"Waveform","score":0.43887633085250854},{"id":"https://openalex.org/keywords/deep-neural-networks","display_name":"Deep neural networks","score":0.41911011934280396},{"id":"https://openalex.org/keywords/pattern-recognition","display_name":"Pattern recognition (psychology)","score":0.39829081296920776},{"id":"https://openalex.org/keywords/algorithm","display_name":"Algorithm","score":0.11960935592651367}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8021600246429443},{"id":"https://openalex.org/C57273362","wikidata":"https://www.wikidata.org/wiki/Q576722","display_name":"Decoding methods","level":2,"score":0.7354438900947571},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.6684615015983582},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.5652319192886353},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5169007778167725},{"id":"https://openalex.org/C90805587","wikidata":"https://www.wikidata.org/wiki/Q10944557","display_name":"Word (group theory)","level":2,"score":0.4982142448425293},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.4818488359451294},{"id":"https://openalex.org/C197424946","wikidata":"https://www.wikidata.org/wiki/Q1165717","display_name":"Waveform","level":3,"score":0.43887633085250854},{"id":"https://openalex.org/C2984842247","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep neural networks","level":3,"score":0.41911011934280396},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.39829081296920776},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.11960935592651367},{"id":"https://openalex.org/C138885662","wikidata":"https://www.wikidata.org/wiki/Q5891","display_name":"Philosophy","level":0,"score":0.0},{"id":"https://openalex.org/C41895202","wikidata":"https://www.wikidata.org/wiki/Q8162","display_name":"Linguistics","level":1,"score":0.0},{"id":"https://openalex.org/C115961682","wikidata":"https://www.wikidata.org/wiki/Q860623","display_name":"Image (mathematics)","level":2,"score":0.0},{"id":"https://openalex.org/C76155785","wikidata":"https://www.wikidata.org/wiki/Q418","display_name":"Telecommunications","level":1,"score":0.0},{"id":"https://openalex.org/C554190296","wikidata":"https://www.wikidata.org/wiki/Q47528","display_name":"Radar","level":2,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icassp.2018.8462044","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2018.8462044","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":15,"referenced_works":["https://openalex.org/W173561343","https://openalex.org/W1904457459","https://openalex.org/W1920478749","https://openalex.org/W2289394825","https://openalex.org/W2515510010","https://openalex.org/W2594610113","https://openalex.org/W2916979304","https://openalex.org/W2952629144","https://openalex.org/W2963130397","https://openalex.org/W4299901747","https://openalex.org/W4302114989","https://openalex.org/W4319988532","https://openalex.org/W6607114211","https://openalex.org/W6726720044","https://openalex.org/W6844057175"],"related_works":["https://openalex.org/W1974895211","https://openalex.org/W2129841057","https://openalex.org/W2176409448","https://openalex.org/W3040712279","https://openalex.org/W2364769705","https://openalex.org/W2056136368","https://openalex.org/W2374664672","https://openalex.org/W4367555392","https://openalex.org/W2883092465","https://openalex.org/W2114441484"],"abstract_inverted_index":{"Many":[0],"state-of-the-art":[1],"automatic":[2],"speech":[3,30],"recognition":[4,13],"(ASR)":[5],"systems":[6],"adopt":[7],"system":[8,37,123],"combination":[9,124],"techniques":[10],"to":[11,69],"improve":[12],"performance.":[14],"In":[15],"this":[16],"paper,":[17],"we":[18,126],"investigate":[19],"the":[20,46,54,88,91,110,114],"possibility":[21],"of":[22,42,48,57,90],"transferring":[23],"knowledge":[24,71,120],"between":[25,73],"models":[26,35],"for":[27,52],"different":[28,74],"noisy":[29,58,67],"domains":[31],"and":[32,122],"integrating":[33],"these":[34],"via":[36],"combination.":[38],"The":[39,100],"first":[40],"contribution":[41,79],"our":[43],"work":[44],"is":[45,80,103],"use":[47],"progressive":[49,62,92],"neural":[50,63,135],"networks":[51,64,93],"modeling":[53],"acoustic":[55],"features":[56],"speech.":[59],"We":[60],"train":[61],"on":[65,113],"subdivided":[66],"data":[68],"achieve":[70,127],"transfer":[72,121],"noise":[75],"conditions.":[76],"Our":[77],"second":[78],"an":[81],"improved":[82,128],"multi-stream":[83],"WFST":[84],"framework":[85],"that":[86],"combines":[87],"output":[89],"at":[94,109],"longer":[95],"timescales":[96],"(e.g.,":[97],"word":[98,111],"hypotheses).":[99],"score":[101],"fusion":[102],"performed":[104],"by":[105],"a":[106],"trained":[107,133],"LSTM":[108],"boundary":[112],"decoding":[115],"lattice.":[116],"By":[117],"adopting":[118],"both":[119],"techniques,":[125],"performance":[129],"compared":[130],"with":[131],"independently":[132],"deep":[134],"networks.":[136]},"counts_by_year":[{"year":2019,"cited_by_count":1},{"year":2018,"cited_by_count":1}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
