{"id":"https://openalex.org/W7123740718","doi":"https://doi.org/10.48550/arxiv.2601.06802","title":"Doing More with Less: Data Augmentation for Sudanese Dialect Automatic Speech Recognition","display_name":"Doing More with Less: Data Augmentation for Sudanese Dialect Automatic Speech Recognition","publication_year":2026,"publication_date":"2026-01-11","ids":{"openalex":"https://openalex.org/W7123740718","doi":"https://doi.org/10.48550/arxiv.2601.06802"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2601.06802","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2601.06802","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2601.06802","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5070815285","display_name":"Ayman Mansour","orcid":"https://orcid.org/0000-0001-7086-1613"},"institutions":[],"countries":[],"is_corresponding":true,"raw_author_name":"Mansour, Ayman","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":["https://openalex.org/A5070815285"],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.40299999713897705,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.40299999713897705,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10181","display_name":"Natural Language Processing Techniques","score":0.14419999718666077,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11640","display_name":"Linguistic Variation and Morphology","score":0.07880000025033951,"subfield":{"id":"https://openalex.org/subfields/3310","display_name":"Linguistics and Language"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/arabic","display_name":"Arabic","score":0.6898999810218811},{"id":"https://openalex.org/keywords/benchmark","display_name":"Benchmark (surveying)","score":0.5701000094413757},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.555400013923645},{"id":"https://openalex.org/keywords/word-error-rate","display_name":"Word error rate","score":0.5321000218391418},{"id":"https://openalex.org/keywords/modern-standard-arabic","display_name":"Modern Standard Arabic","score":0.5281000137329102},{"id":"https://openalex.org/keywords/training-set","display_name":"Training set","score":0.4311999976634979},{"id":"https://openalex.org/keywords/word","display_name":"Word (group theory)","score":0.40869998931884766}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7651000022888184},{"id":"https://openalex.org/C96455323","wikidata":"https://www.wikidata.org/wiki/Q13955","display_name":"Arabic","level":2,"score":0.6898999810218811},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.6101999878883362},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.5701000094413757},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.555400013923645},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.5478000044822693},{"id":"https://openalex.org/C40969351","wikidata":"https://www.wikidata.org/wiki/Q3516228","display_name":"Word error rate","level":2,"score":0.5321000218391418},{"id":"https://openalex.org/C2778243841","wikidata":"https://www.wikidata.org/wiki/Q56467","display_name":"Modern Standard Arabic","level":3,"score":0.5281000137329102},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5062999725341797},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.4311999976634979},{"id":"https://openalex.org/C90805587","wikidata":"https://www.wikidata.org/wiki/Q10944557","display_name":"Word (group theory)","level":2,"score":0.40869998931884766},{"id":"https://openalex.org/C206345919","wikidata":"https://www.wikidata.org/wiki/Q20380951","display_name":"Resource (disambiguation)","level":2,"score":0.37310001254081726},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.3637999892234802},{"id":"https://openalex.org/C58489278","wikidata":"https://www.wikidata.org/wiki/Q1172284","display_name":"Data set","level":2,"score":0.3492000102996826},{"id":"https://openalex.org/C3018824978","wikidata":"https://www.wikidata.org/wiki/Q2894891","display_name":"Error analysis","level":2,"score":0.3149000108242035},{"id":"https://openalex.org/C137584468","wikidata":"https://www.wikidata.org/wiki/Q35395","display_name":"Phonetics","level":2,"score":0.27079999446868896},{"id":"https://openalex.org/C91863865","wikidata":"https://www.wikidata.org/wiki/Q4349497","display_name":"Speech corpus","level":3,"score":0.26440000534057617},{"id":"https://openalex.org/C136197465","wikidata":"https://www.wikidata.org/wiki/Q1729295","display_name":"Variety (cybernetics)","level":2,"score":0.26170000433921814},{"id":"https://openalex.org/C155635449","wikidata":"https://www.wikidata.org/wiki/Q4674699","display_name":"Acoustic model","level":3,"score":0.25279998779296875}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2601.06802","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2601.06802","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2601.06802","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2601.06802","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.5133997797966003,"id":"https://metadata.un.org/sdg/4","display_name":"Quality Education"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Although":[0],"many":[1],"Automatic":[2],"Speech":[3],"Recognition":[4],"(ASR)":[5],"systems":[6,159],"have":[7,21],"been":[8],"developed":[9],"for":[10,27,44,54,148,156,160],"Modern":[11],"Standard":[12],"Arabic":[13,17,29,124,162,186],"(MSA)":[14],"and":[15,49,71,91,108,122,136,151,164,173],"Dialectal":[16],"(DA),":[18],"few":[19],"studies":[20],"focused":[22],"on":[23,104,110,184],"dialect-specific":[24],"implementations,":[25],"particularly":[26],"low-resource":[28,149,161,185],"dialects":[30,150,163],"such":[31],"as":[32],"Sudanese.":[33],"This":[34],"paper":[35],"presents":[36],"a":[37,97,153],"comprehensive":[38],"study":[39],"of":[40,102],"data":[41,142],"augmentation":[42,59,74,93,143],"techniques":[43],"fine-tuning":[45],"OpenAI":[46],"Whisper":[47,119],"models":[48,125],"establishes":[50],"the":[51,55,79,105],"first":[52],"benchmark":[53],"Sudanese":[56],"dialect.":[57],"Two":[58],"strategies":[60],"are":[61,177],"investigated:":[62],"(1)":[63],"self-training":[64,90],"with":[65,88],"pseudo-labels":[66],"generated":[67],"from":[68,78],"unlabeled":[69],"speech,":[70],"(2)":[72],"TTS-based":[73],"using":[75],"synthetic":[76],"speech":[77],"Klaam":[80],"TTS":[81,92],"system.":[82],"The":[83,169],"best-performing":[84],"model,":[85],"Whisper-Medium":[86],"fine-tuned":[87],"combined":[89],"(28.4":[94],"hours),":[95],"achieves":[96],"Word":[98],"Error":[99],"Rate":[100],"(WER)":[101],"57.1%":[103],"evaluation":[106,171],"set":[107,114],"51.6%":[109],"an":[111],"out-of-domain":[112],"holdout":[113],"substantially":[115],"outperforming":[116],"zero-shot":[117],"multilingual":[118],"(78.8%":[120],"WER)":[121],"MSA-specialized":[123],"(73.8-123%":[126],"WER).":[127],"All":[128],"experiments":[129],"used":[130],"low-cost":[131],"resources":[132],"(Kaggle":[133],"free":[134],"tier":[135],"Lightning.ai":[137],"trial),":[138],"demonstrating":[139],"that":[140],"strategic":[141],"can":[144],"overcome":[145],"resource":[146],"limitations":[147],"provide":[152],"practical":[154],"roadmap":[155],"developing":[157],"ASR":[158],"other":[165],"marginalized":[166],"language":[167],"varieties.":[168],"models,":[170],"benchmarks,":[172],"reproducible":[174],"training":[175],"pipelines":[176],"publicly":[178],"released":[179],"to":[180],"facilitate":[181],"future":[182],"research":[183],"ASR.":[187]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-01-14T00:00:00"}
