{"id":"https://openalex.org/W1588593315","doi":"https://doi.org/10.1109/icassp.2005.1415062","title":"Discriminative Training of Acoustic Models Applied to Domains with Unreliable Transcripts","display_name":"Discriminative Training of Acoustic Models Applied to Domains with Unreliable Transcripts","publication_year":2006,"publication_date":"2006-10-11","ids":{"openalex":"https://openalex.org/W1588593315","doi":"https://doi.org/10.1109/icassp.2005.1415062","mag":"1588593315"},"language":"en","primary_location":{"id":"doi:10.1109/icassp.2005.1415062","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2005.1415062","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings. (ICASSP '05). IEEE International Conference on Acoustics, Speech, and Signal Processing, 2005.","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5051519610","display_name":"Lambert Mathias","orcid":"https://orcid.org/0000-0002-2996-8141"},"institutions":[{"id":"https://openalex.org/I145311948","display_name":"Johns Hopkins University","ror":"https://ror.org/00za53h95","country_code":"US","type":"education","lineage":["https://openalex.org/I145311948"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"L. Mathias","raw_affiliation_strings":["Center for Language and Speech Processing, Johns Hopkins University, Baltimore, MD, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Center for Language and Speech Processing, Johns Hopkins University, Baltimore, MD, USA","institution_ids":["https://openalex.org/I145311948"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5015619860","display_name":"G. Yegnanarayanan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"G. Yegnanarayanan","raw_affiliation_strings":["Multimodal Technologies, Inc., Pittsburgh, PA, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Multimodal Technologies, Inc., Pittsburgh, PA, USA","institution_ids":[]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5085847246","display_name":"J\u00fcrgen Fritsch","orcid":"https://orcid.org/0000-0001-6909-6096"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"J. Fritsch","raw_affiliation_strings":["Multimodal Technologies, Inc., Pittsburgh, PA, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Multimodal Technologies, Inc., Pittsburgh, PA, USA","institution_ids":[]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.7328,"has_fulltext":false,"cited_by_count":18,"citation_normalized_percentile":{"value":0.66769327,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":90,"max":98},"biblio":{"volume":"1","issue":null,"first_page":"109","last_page":"112"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998000264167786,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998000264167786,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9958000183105469,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9926999807357788,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/discriminative-model","display_name":"Discriminative model","score":0.9275679588317871},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7037898302078247},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.6503006815910339},{"id":"https://openalex.org/keywords/word-error-rate","display_name":"Word error rate","score":0.6451600790023804},{"id":"https://openalex.org/keywords/transcription","display_name":"Transcription (linguistics)","score":0.6334472298622131},{"id":"https://openalex.org/keywords/workflow","display_name":"Workflow","score":0.5918006300926208},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.4904133975505829},{"id":"https://openalex.org/keywords/frame","display_name":"Frame (networking)","score":0.4704683721065521},{"id":"https://openalex.org/keywords/acoustic-model","display_name":"Acoustic model","score":0.43957817554473877},{"id":"https://openalex.org/keywords/hidden-markov-model","display_name":"Hidden Markov model","score":0.4180441200733185},{"id":"https://openalex.org/keywords/pattern-recognition","display_name":"Pattern recognition (psychology)","score":0.37586551904678345},{"id":"https://openalex.org/keywords/speech-processing","display_name":"Speech processing","score":0.23767876625061035}],"concepts":[{"id":"https://openalex.org/C97931131","wikidata":"https://www.wikidata.org/wiki/Q5282087","display_name":"Discriminative model","level":2,"score":0.9275679588317871},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7037898302078247},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.6503006815910339},{"id":"https://openalex.org/C40969351","wikidata":"https://www.wikidata.org/wiki/Q3516228","display_name":"Word error rate","level":2,"score":0.6451600790023804},{"id":"https://openalex.org/C179926584","wikidata":"https://www.wikidata.org/wiki/Q207714","display_name":"Transcription (linguistics)","level":2,"score":0.6334472298622131},{"id":"https://openalex.org/C177212765","wikidata":"https://www.wikidata.org/wiki/Q627335","display_name":"Workflow","level":2,"score":0.5918006300926208},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4904133975505829},{"id":"https://openalex.org/C126042441","wikidata":"https://www.wikidata.org/wiki/Q1324888","display_name":"Frame (networking)","level":2,"score":0.4704683721065521},{"id":"https://openalex.org/C155635449","wikidata":"https://www.wikidata.org/wiki/Q4674699","display_name":"Acoustic model","level":3,"score":0.43957817554473877},{"id":"https://openalex.org/C23224414","wikidata":"https://www.wikidata.org/wiki/Q176769","display_name":"Hidden Markov model","level":2,"score":0.4180441200733185},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.37586551904678345},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.23767876625061035},{"id":"https://openalex.org/C76155785","wikidata":"https://www.wikidata.org/wiki/Q418","display_name":"Telecommunications","level":1,"score":0.0},{"id":"https://openalex.org/C77088390","wikidata":"https://www.wikidata.org/wiki/Q8513","display_name":"Database","level":1,"score":0.0},{"id":"https://openalex.org/C138885662","wikidata":"https://www.wikidata.org/wiki/Q5891","display_name":"Philosophy","level":0,"score":0.0},{"id":"https://openalex.org/C41895202","wikidata":"https://www.wikidata.org/wiki/Q8162","display_name":"Linguistics","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icassp.2005.1415062","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2005.1415062","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings. (ICASSP '05). IEEE International Conference on Acoustics, Speech, and Signal Processing, 2005.","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"score":0.7099999785423279,"display_name":"Reduced inequalities","id":"https://metadata.un.org/sdg/10"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":8,"referenced_works":["https://openalex.org/W1481751294","https://openalex.org/W1574530145","https://openalex.org/W1877570817","https://openalex.org/W1975113979","https://openalex.org/W2003123121","https://openalex.org/W2111164644","https://openalex.org/W2143577772","https://openalex.org/W2153687006"],"related_works":["https://openalex.org/W2167155152","https://openalex.org/W2150890698","https://openalex.org/W2162582511","https://openalex.org/W4245698648","https://openalex.org/W2401394187","https://openalex.org/W2405257913","https://openalex.org/W3133710586","https://openalex.org/W2125964738","https://openalex.org/W2098529290","https://openalex.org/W2026402306"],"abstract_inverted_index":{"Training":[0],"automatic":[1,69],"speech":[2,14],"recognition":[3],"(ASR)":[4],"systems":[5],"requires":[6],"the":[7,13,28,32,44,57,68,84,126],"availability":[8],"of":[9,43,71,122],"training":[10,91,103,114],"transcripts":[11,18,72],"for":[12,27,67,90],"data.":[15,59],"Obtaining":[16],"these":[17,74],"is":[19,110],"a":[20,41,65],"time":[21],"consuming":[22],"and":[23,100],"costly":[24],"process,":[25],"especially":[26],"medical":[29,35,46,75],"domain.":[30],"On":[31],"other":[33],"hand,":[34],"reports":[36],"which":[37],"are":[38,49,107],"generated":[39],"as":[40],"by-product":[42],"normal":[45],"transcription":[47],"workflow":[48],"available":[50],"easily.":[51],"However,":[52],"they":[53],"only":[54],"partially":[55],"represent":[56],"acoustic":[58,92],"In":[60,77],"this":[61],"paper,":[62],"we":[63,79],"present":[64],"method":[66],"generation":[70],"from":[73],"reports.":[76],"particular,":[78],"identify":[80],"\"reliable\"":[81],"regions":[82],"in":[83],"transcript":[85],"that":[86,112],"can":[87],"be":[88],"used":[89],"models.":[93],"Experiments":[94],"based":[95],"on":[96],"maximum":[97],"likelihood":[98],"(ML)":[99],"lattice-based":[101],"discriminative":[102,113],"with":[104],"frame":[105],"filtering":[106],"presented.":[108],"It":[109],"shown":[111],"gives":[115],"us":[116],"word":[117],"error":[118],"rate":[119],"(WER)":[120],"reductions":[121],"8-15%":[123],"relative":[124],"to":[125],"baseline.":[127]},"counts_by_year":[{"year":2020,"cited_by_count":2},{"year":2019,"cited_by_count":5},{"year":2018,"cited_by_count":2},{"year":2016,"cited_by_count":1},{"year":2015,"cited_by_count":2},{"year":2013,"cited_by_count":3}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
