{"id":"https://openalex.org/W2039285212","doi":"https://doi.org/10.1109/icassp.2014.6854671","title":"Data Augmentation for deep neural network acoustic modeling","display_name":"Data Augmentation for deep neural network acoustic modeling","publication_year":2014,"publication_date":"2014-05-01","ids":{"openalex":"https://openalex.org/W2039285212","doi":"https://doi.org/10.1109/icassp.2014.6854671","mag":"2039285212"},"language":"en","primary_location":{"id":"doi:10.1109/icassp.2014.6854671","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2014.6854671","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2014 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5102014291","display_name":"Xiaodong Cui","orcid":"https://orcid.org/0000-0003-4865-1307"},"institutions":[{"id":"https://openalex.org/I1341412227","display_name":"IBM (United States)","ror":"https://ror.org/05hh8d621","country_code":"US","type":"company","lineage":["https://openalex.org/I1341412227"]},{"id":"https://openalex.org/I4210114115","display_name":"IBM Research - Thomas J. Watson Research Center","ror":"https://ror.org/0265w5591","country_code":"US","type":"facility","lineage":["https://openalex.org/I1341412227","https://openalex.org/I4210114115"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Xiaodong Cui","raw_affiliation_strings":["IBM T. J. Watson Research Center, Yorktown Heights, NY, USA","IBM T. J. Watson Research Center, Yorktown Heights , NY, USA#TAB#"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"IBM T. J. Watson Research Center, Yorktown Heights, NY, USA","institution_ids":["https://openalex.org/I4210114115"]},{"raw_affiliation_string":"IBM T. J. Watson Research Center, Yorktown Heights , NY, USA#TAB#","institution_ids":["https://openalex.org/I1341412227"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5034451965","display_name":"Vaibhava Goel","orcid":"https://orcid.org/0000-0002-5504-3863"},"institutions":[{"id":"https://openalex.org/I1341412227","display_name":"IBM (United States)","ror":"https://ror.org/05hh8d621","country_code":"US","type":"company","lineage":["https://openalex.org/I1341412227"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Vaibhava Goel","raw_affiliation_strings":["IBM T. J. Watson Research Center, Yorktown Heights, NY 10598, USA","IBM T. J. Watson Research Center, Yorktown Heights , NY, USA#TAB#"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"IBM T. J. Watson Research Center, Yorktown Heights, NY 10598, USA","institution_ids":[]},{"raw_affiliation_string":"IBM T. J. Watson Research Center, Yorktown Heights , NY, USA#TAB#","institution_ids":["https://openalex.org/I1341412227"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5003725957","display_name":"Brian Kingsbury","orcid":"https://orcid.org/0000-0002-1343-6837"},"institutions":[{"id":"https://openalex.org/I1341412227","display_name":"IBM (United States)","ror":"https://ror.org/05hh8d621","country_code":"US","type":"company","lineage":["https://openalex.org/I1341412227"]},{"id":"https://openalex.org/I4210114115","display_name":"IBM Research - Thomas J. Watson Research Center","ror":"https://ror.org/0265w5591","country_code":"US","type":"facility","lineage":["https://openalex.org/I1341412227","https://openalex.org/I4210114115"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Brian Kingsbury","raw_affiliation_strings":["IBM T. J. Watson Research Center, Yorktown Heights, NY, USA","IBM T. J. Watson Research Center, Yorktown Heights , NY, USA#TAB#"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"IBM T. J. Watson Research Center, Yorktown Heights, NY, USA","institution_ids":["https://openalex.org/I4210114115"]},{"raw_affiliation_string":"IBM T. J. Watson Research Center, Yorktown Heights , NY, USA#TAB#","institution_ids":["https://openalex.org/I1341412227"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":82,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"5582","last_page":"5586"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9997000098228455,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9997000098228455,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7998136281967163},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.6741244196891785},{"id":"https://openalex.org/keywords/deep-neural-networks","display_name":"Deep neural networks","score":0.6225292682647705},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.6216048002243042},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.5649797916412354},{"id":"https://openalex.org/keywords/pattern-recognition","display_name":"Pattern recognition (psychology)","score":0.5270270109176636},{"id":"https://openalex.org/keywords/vocal-tract","display_name":"Vocal tract","score":0.5115740895271301},{"id":"https://openalex.org/keywords/acoustic-model","display_name":"Acoustic model","score":0.4735131561756134},{"id":"https://openalex.org/keywords/deep-learning","display_name":"Deep learning","score":0.4545823335647583},{"id":"https://openalex.org/keywords/feature","display_name":"Feature (linguistics)","score":0.43178844451904297},{"id":"https://openalex.org/keywords/assamese","display_name":"Assamese","score":0.41220802068710327},{"id":"https://openalex.org/keywords/speech-processing","display_name":"Speech processing","score":0.2845585346221924}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7998136281967163},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.6741244196891785},{"id":"https://openalex.org/C2984842247","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep neural networks","level":3,"score":0.6225292682647705},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.6216048002243042},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5649797916412354},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.5270270109176636},{"id":"https://openalex.org/C47401133","wikidata":"https://www.wikidata.org/wiki/Q748953","display_name":"Vocal tract","level":2,"score":0.5115740895271301},{"id":"https://openalex.org/C155635449","wikidata":"https://www.wikidata.org/wiki/Q4674699","display_name":"Acoustic model","level":3,"score":0.4735131561756134},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.4545823335647583},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.43178844451904297},{"id":"https://openalex.org/C2777834912","wikidata":"https://www.wikidata.org/wiki/Q29401","display_name":"Assamese","level":2,"score":0.41220802068710327},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.2845585346221924},{"id":"https://openalex.org/C41895202","wikidata":"https://www.wikidata.org/wiki/Q8162","display_name":"Linguistics","level":1,"score":0.0},{"id":"https://openalex.org/C138885662","wikidata":"https://www.wikidata.org/wiki/Q5891","display_name":"Philosophy","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icassp.2014.6854671","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2014.6854671","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2014 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/4","score":0.6499999761581421,"display_name":"Quality Education"}],"awards":[],"funders":[{"id":"https://openalex.org/F4320306078","display_name":"U.S. Department of Defense","ror":"https://ror.org/0447fe631"},{"id":"https://openalex.org/F4320333051","display_name":"Intelligence Advanced Research Projects Activity","ror":"https://ror.org/01v3fsc55"},{"id":"https://openalex.org/F4320338295","display_name":"Army Research Laboratory","ror":"https://ror.org/011hc8f90"}],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":19,"referenced_works":["https://openalex.org/W1967260196","https://openalex.org/W1974205368","https://openalex.org/W2002342963","https://openalex.org/W2080401855","https://openalex.org/W2099621636","https://openalex.org/W2106554350","https://openalex.org/W2112796928","https://openalex.org/W2146871184","https://openalex.org/W2155117693","https://openalex.org/W2156163116","https://openalex.org/W2160306971","https://openalex.org/W2160815625","https://openalex.org/W2163605009","https://openalex.org/W2164931619","https://openalex.org/W2394932179","https://openalex.org/W2403195671","https://openalex.org/W6670628740","https://openalex.org/W6675409298","https://openalex.org/W6684191040"],"related_works":["https://openalex.org/W70126818","https://openalex.org/W2595800753","https://openalex.org/W3136670730","https://openalex.org/W2891067899","https://openalex.org/W4294250292","https://openalex.org/W3111362937","https://openalex.org/W4377865163","https://openalex.org/W3193857078","https://openalex.org/W3208304128","https://openalex.org/W3000197790"],"abstract_inverted_index":{"Data":[0],"augmentation":[1,27,65],"using":[2,32,53],"label":[3],"preserving":[4],"transformations":[5],"has":[6,98],"been":[7,99],"shown":[8],"to":[9,16,29],"be":[10],"effective":[11],"for":[12,37],"neural":[13,34],"network":[14],"training":[15,111],"make":[17],"invariant":[18],"predictions.":[19],"In":[20],"this":[21],"paper":[22],"we":[23],"focus":[24],"on":[25,68,82],"data":[26,64],"approaches":[28],"acoustic":[30],"modeling":[31],"deep":[33],"networks":[35],"(DNNs)":[36],"automatic":[38],"speech":[39],"recognition":[40,96],"(ASR).":[41],"We":[42],"first":[43],"investigate":[44],"a":[45,49,62,74],"modified":[46],"version":[47],"of":[48,112],"previously":[50],"studied":[51],"approach":[52,66],"vocal":[54],"tract":[55],"length":[56],"perturbation":[57],"(VTLP)":[58],"and":[59,84,105],"then":[60],"propose":[61],"novel":[63],"based":[67],"stochastic":[69],"feature":[70,77],"mapping":[71],"(SFM)":[72],"in":[73],"speaker":[75],"adaptive":[76],"space.":[78],"Experiments":[79],"were":[80],"conducted":[81],"Bengali":[83],"Assamese":[85],"limited":[86],"language":[87],"packs":[88],"(LLPs)":[89],"from":[90],"the":[91],"IARPA":[92],"Babel":[93],"program.":[94],"Improved":[95],"performance":[97],"observed":[100],"after":[101],"both":[102],"cross-entropy":[103],"(CE)":[104],"state-level":[106],"minimum":[107],"Bayes":[108],"risk":[109],"(sMBR)":[110],"DNN":[113],"models.":[114]},"counts_by_year":[{"year":2026,"cited_by_count":1},{"year":2025,"cited_by_count":2},{"year":2024,"cited_by_count":4},{"year":2023,"cited_by_count":7},{"year":2022,"cited_by_count":3},{"year":2021,"cited_by_count":13},{"year":2020,"cited_by_count":4},{"year":2019,"cited_by_count":11},{"year":2018,"cited_by_count":6},{"year":2017,"cited_by_count":7},{"year":2016,"cited_by_count":7},{"year":2015,"cited_by_count":11},{"year":2014,"cited_by_count":6}],"updated_date":"2026-07-17T09:13:05.818461","created_date":"2025-10-10T00:00:00"}
