{"id":"https://openalex.org/W2142983806","doi":"https://doi.org/10.1109/icassp.2006.1660215","title":"Arabic Broadcast News Transcription Using a One Million Word Vocalized Vocabulary","display_name":"Arabic Broadcast News Transcription Using a One Million Word Vocalized Vocabulary","publication_year":2006,"publication_date":"2006-08-03","ids":{"openalex":"https://openalex.org/W2142983806","doi":"https://doi.org/10.1109/icassp.2006.1660215","mag":"2142983806"},"language":"en","primary_location":{"id":"doi:10.1109/icassp.2006.1660215","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2006.1660215","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2006 IEEE International Conference on Acoustics Speed and Signal Processing Proceedings","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5108517024","display_name":"Abdelkhalek Messaoudi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"A. Messaoudi","raw_affiliation_strings":["Spoken Language Processing Group, CNRS, Orsay cedex, FRANCE"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Spoken Language Processing Group, CNRS, Orsay cedex, FRANCE","institution_ids":[]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5109050158","display_name":"J.-L. Gauvain","orcid":null},"institutions":[{"id":"https://openalex.org/I1294671590","display_name":"Centre National de la Recherche Scientifique","ror":"https://ror.org/02feahw73","country_code":"FR","type":"government","lineage":["https://openalex.org/I1294671590"]},{"id":"https://openalex.org/I4210115485","display_name":"Laboratoire d'Informatique pour la M\u00e9canique et les Sciences de l'Ing\u00e9nieur","ror":"https://ror.org/01raq4x89","country_code":"FR","type":"facility","lineage":["https://openalex.org/I102197404","https://openalex.org/I1294671590","https://openalex.org/I4210115485","https://openalex.org/I4210159245"]}],"countries":["FR"],"is_corresponding":false,"raw_author_name":"J. Gauvain","raw_affiliation_strings":["Spoken Language Processing Group, CNRS, Orsay cedex, FRANCE","Spoken Language Processing Group, LIMSI-CNRS, Orsay, France"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Spoken Language Processing Group, CNRS, Orsay cedex, FRANCE","institution_ids":[]},{"raw_affiliation_string":"Spoken Language Processing Group, LIMSI-CNRS, Orsay, France","institution_ids":["https://openalex.org/I1294671590","https://openalex.org/I4210115485"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5062446882","display_name":"Lori Lamel","orcid":"https://orcid.org/0000-0001-7443-9938"},"institutions":[{"id":"https://openalex.org/I1294671590","display_name":"Centre National de la Recherche Scientifique","ror":"https://ror.org/02feahw73","country_code":"FR","type":"government","lineage":["https://openalex.org/I1294671590"]},{"id":"https://openalex.org/I4210115485","display_name":"Laboratoire d'Informatique pour la M\u00e9canique et les Sciences de l'Ing\u00e9nieur","ror":"https://ror.org/01raq4x89","country_code":"FR","type":"facility","lineage":["https://openalex.org/I102197404","https://openalex.org/I1294671590","https://openalex.org/I4210115485","https://openalex.org/I4210159245"]}],"countries":["FR"],"is_corresponding":false,"raw_author_name":"L. Lamel","raw_affiliation_strings":["Spoken Language Processing Group, CNRS, Orsay cedex, FRANCE","Spoken Language Processing Group, LIMSI-CNRS, Orsay, France"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Spoken Language Processing Group, CNRS, Orsay cedex, FRANCE","institution_ids":[]},{"raw_affiliation_string":"Spoken Language Processing Group, LIMSI-CNRS, Orsay, France","institution_ids":["https://openalex.org/I1294671590","https://openalex.org/I4210115485"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":3.6641,"has_fulltext":false,"cited_by_count":36,"citation_normalized_percentile":{"value":0.94148376,"is_in_top_1_percent":false,"is_in_top_10_percent":true},"cited_by_percentile_year":{"min":89,"max":98},"biblio":{"volume":"1","issue":null,"first_page":"I","last_page":"1093"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10181","display_name":"Natural Language Processing Techniques","score":0.9980999827384949,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9965999722480774,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/vocabulary","display_name":"Vocabulary","score":0.7815418243408203},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7785700559616089},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.6984481811523438},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.5769330859184265},{"id":"https://openalex.org/keywords/natural-language-processing","display_name":"Natural language processing","score":0.5756499767303467},{"id":"https://openalex.org/keywords/word","display_name":"Word (group theory)","score":0.5684317350387573},{"id":"https://openalex.org/keywords/arabic","display_name":"Arabic","score":0.511046290397644},{"id":"https://openalex.org/keywords/word-error-rate","display_name":"Word error rate","score":0.5001280307769775},{"id":"https://openalex.org/keywords/vowel","display_name":"Vowel","score":0.4660799205303192},{"id":"https://openalex.org/keywords/variety","display_name":"Variety (cybernetics)","score":0.45961257815361023},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.4501028060913086},{"id":"https://openalex.org/keywords/word-lists-by-frequency","display_name":"Word lists by frequency","score":0.42053964734077454},{"id":"https://openalex.org/keywords/linguistics","display_name":"Linguistics","score":0.19130805134773254}],"concepts":[{"id":"https://openalex.org/C2777601683","wikidata":"https://www.wikidata.org/wiki/Q6499736","display_name":"Vocabulary","level":2,"score":0.7815418243408203},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7785700559616089},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.6984481811523438},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.5769330859184265},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.5756499767303467},{"id":"https://openalex.org/C90805587","wikidata":"https://www.wikidata.org/wiki/Q10944557","display_name":"Word (group theory)","level":2,"score":0.5684317350387573},{"id":"https://openalex.org/C96455323","wikidata":"https://www.wikidata.org/wiki/Q13955","display_name":"Arabic","level":2,"score":0.511046290397644},{"id":"https://openalex.org/C40969351","wikidata":"https://www.wikidata.org/wiki/Q3516228","display_name":"Word error rate","level":2,"score":0.5001280307769775},{"id":"https://openalex.org/C2779581591","wikidata":"https://www.wikidata.org/wiki/Q36244","display_name":"Vowel","level":2,"score":0.4660799205303192},{"id":"https://openalex.org/C136197465","wikidata":"https://www.wikidata.org/wiki/Q1729295","display_name":"Variety (cybernetics)","level":2,"score":0.45961257815361023},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4501028060913086},{"id":"https://openalex.org/C175293574","wikidata":"https://www.wikidata.org/wiki/Q697133","display_name":"Word lists by frequency","level":3,"score":0.42053964734077454},{"id":"https://openalex.org/C41895202","wikidata":"https://www.wikidata.org/wiki/Q8162","display_name":"Linguistics","level":1,"score":0.19130805134773254},{"id":"https://openalex.org/C2777530160","wikidata":"https://www.wikidata.org/wiki/Q41796","display_name":"Sentence","level":2,"score":0.0},{"id":"https://openalex.org/C138885662","wikidata":"https://www.wikidata.org/wiki/Q5891","display_name":"Philosophy","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icassp.2006.1660215","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2006.1660215","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2006 IEEE International Conference on Acoustics Speed and Signal Processing Proceedings","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Quality Education","score":0.7900000214576721,"id":"https://metadata.un.org/sdg/4"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":18,"referenced_works":["https://openalex.org/W3765491","https://openalex.org/W26431120","https://openalex.org/W139627991","https://openalex.org/W171797550","https://openalex.org/W1571931074","https://openalex.org/W1749539841","https://openalex.org/W2016243284","https://openalex.org/W2020079054","https://openalex.org/W2100969003","https://openalex.org/W2132959327","https://openalex.org/W2146871184","https://openalex.org/W3152004739","https://openalex.org/W6600154122","https://openalex.org/W6601052428","https://openalex.org/W6605634612","https://openalex.org/W6607090388","https://openalex.org/W6634380342","https://openalex.org/W6637573916"],"related_works":["https://openalex.org/W1566315437","https://openalex.org/W2594897229","https://openalex.org/W4221142855","https://openalex.org/W2151348424","https://openalex.org/W2050138804","https://openalex.org/W4290708361","https://openalex.org/W2129812225","https://openalex.org/W2523799048","https://openalex.org/W2155620340","https://openalex.org/W1494910745"],"abstract_inverted_index":{"Recently":[0],"it":[1],"has":[2],"been":[3],"shown":[4],"that":[5,192],"modeling":[6],"short":[7],"vowels":[8],"in":[9,67,114,185],"Arabic":[10,22,98],"can":[11],"significantly":[12],"improve":[13],"performance":[14,190],"even":[15],"when":[16],"producing":[17],"a":[18,71,109,129,167],"non-vocalized":[19],"transcript.":[20],"Since":[21],"texts":[23],"and":[24,53,156],"audio":[25,79],"transcripts":[26,80,184],"are":[27],"almost":[28],"exclusively":[29],"non-vocalized,":[30],"the":[31,42,45,64,68,78,84,90,97,115,147,162,174,181,186],"training":[32],"methods":[33],"have":[34],"to":[35,61,120,150,196],"overcome":[36],"this":[37,127],"missing":[38],"data":[39,52,165],"problem.":[40],"For":[41],"acoustic":[43],"models":[44],"procedure":[46],"was":[47,81],"bootstrapped":[48],"with":[49,55,83,108],"manually":[50,163],"vocalized":[51,57,72,130,136,157,183],"extended":[54,154],"semi-automatically":[56],"data.":[58,178],"In":[59],"order":[60],"also":[62],"capture":[63],"vowel":[65],"information":[66],"language":[69,74,99,158,187],"model,":[70],"4-gram":[73,86],"model":[75,87,159,188],"trained":[76,88,160],"on":[77,89,161,173],"interpolated":[82],"original":[85],"(non-vocalized)":[91],"written":[92],"texts.":[93],"Another":[94],"challenge":[95],"of":[96,117],"is":[100,113,143],"its":[101],"large":[102],"lexical":[103],"variety.":[104],"The":[105,153],"out-of-vocabulary":[106,148],"rate":[107,149],"65k":[110],"word":[111,141,170],"vocabulary":[112,131,155],"range":[116],"4-8%":[118],"(compared":[119],"under":[121],"1%":[122],"for":[123],"English).":[124],"To":[125],"address":[126],"problem":[128],"containing":[132],"over":[133],"1":[134],"million":[135],"words,":[137],"grouped":[138],"into":[139],"200k":[140],"classes":[142],"used.":[144],"This":[145],"reduces":[146,189],"about":[151],"2%.":[152],"annotated":[164],"give":[166],"1.2%":[168],"absolute":[169],"error":[171],"reduction":[172],"DARPA":[175],"RT04":[176],"development":[177],"However,":[179],"including":[180],"automatically":[182],"indicating":[191],"automatic":[193],"vocalization":[194],"needs":[195],"be":[197],"improved":[198]},"counts_by_year":[{"year":2020,"cited_by_count":1},{"year":2017,"cited_by_count":2},{"year":2016,"cited_by_count":1},{"year":2015,"cited_by_count":1},{"year":2014,"cited_by_count":5},{"year":2013,"cited_by_count":4},{"year":2012,"cited_by_count":1}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
