{"id":"https://openalex.org/W2048782995","doi":"https://doi.org/10.1142/s1793840609002147","title":"Correcting Arabic OCR Errors Using Improved Topic-Based Language Models","display_name":"Correcting Arabic OCR Errors Using Improved Topic-Based Language Models","publication_year":2009,"publication_date":"2009-12-01","ids":{"openalex":"https://openalex.org/W2048782995","doi":"https://doi.org/10.1142/s1793840609002147","mag":"2048782995"},"language":"en","primary_location":{"id":"doi:10.1142/s1793840609002147","is_oa":false,"landing_page_url":"https://doi.org/10.1142/s1793840609002147","pdf_url":null,"source":{"id":"https://openalex.org/S50006202","display_name":"International Journal of Computer Processing Of Languages","issn_l":"1793-8406","issn":["1793-8406","2010-0205"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319815","host_organization_name":"World Scientific","host_organization_lineage":["https://openalex.org/P4310319815"],"host_organization_lineage_names":["World Scientific"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"International Journal of Computer Processing of Languages","raw_type":"journal-article"},"type":"article","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5045785827","display_name":"SAFEYA MAMISH","orcid":null},"institutions":[{"id":"https://openalex.org/I9736820","display_name":"\u00c9cole de Technologie Sup\u00e9rieure","ror":"https://ror.org/0020snb74","country_code":"CA","type":"education","lineage":["https://openalex.org/I49663120","https://openalex.org/I9736820"]}],"countries":["CA"],"is_corresponding":false,"raw_author_name":"SAFEYA MAMISH","raw_affiliation_strings":["Synchromedia Laboratory, \u00c9cole de technologies sup\u00e9rieures, 1100 Notre Dame Ouest, Montreal, Quebec, Canada"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Synchromedia Laboratory, \u00c9cole de technologies sup\u00e9rieures, 1100 Notre Dame Ouest, Montreal, Quebec, Canada","institution_ids":["https://openalex.org/I9736820"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5015410834","display_name":"Mohamed Cheriet","orcid":"https://orcid.org/0000-0002-5246-7265"},"institutions":[{"id":"https://openalex.org/I9736820","display_name":"\u00c9cole de Technologie Sup\u00e9rieure","ror":"https://ror.org/0020snb74","country_code":"CA","type":"education","lineage":["https://openalex.org/I49663120","https://openalex.org/I9736820"]}],"countries":["CA"],"is_corresponding":false,"raw_author_name":"MOHAMED CHERIET","raw_affiliation_strings":["Synchromedia Laboratory, \u00c9cole de technologies sup\u00e9rieures, 1100 Notre Dame Ouest, Montreal, Quebec, Canada"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Synchromedia Laboratory, \u00c9cole de technologies sup\u00e9rieures, 1100 Notre Dame Ouest, Montreal, Quebec, Canada","institution_ids":["https://openalex.org/I9736820"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I9736820"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.10032586,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":"22","issue":"04","first_page":"321","last_page":"340"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10181","display_name":"Natural Language Processing Techniques","score":0.9997000098228455,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10181","display_name":"Natural Language Processing Techniques","score":0.9997000098228455,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.9993000030517578,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10601","display_name":"Handwritten Text Recognition Techniques","score":0.9983999729156494,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.9060561060905457},{"id":"https://openalex.org/keywords/natural-language-processing","display_name":"Natural language processing","score":0.7546792030334473},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.6766995787620544},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.6143600940704346},{"id":"https://openalex.org/keywords/word-error-rate","display_name":"Word error rate","score":0.5477792024612427},{"id":"https://openalex.org/keywords/arabic","display_name":"Arabic","score":0.4828494191169739},{"id":"https://openalex.org/keywords/word","display_name":"Word (group theory)","score":0.4758439064025879},{"id":"https://openalex.org/keywords/error-detection-and-correction","display_name":"Error detection and correction","score":0.45877277851104736},{"id":"https://openalex.org/keywords/proofreading","display_name":"Proofreading","score":0.4353160560131073},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.4156067669391632},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.3530142307281494},{"id":"https://openalex.org/keywords/linguistics","display_name":"Linguistics","score":0.18467405438423157},{"id":"https://openalex.org/keywords/algorithm","display_name":"Algorithm","score":0.15694445371627808},{"id":"https://openalex.org/keywords/programming-language","display_name":"Programming language","score":0.09357449412345886}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.9060561060905457},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.7546792030334473},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6766995787620544},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.6143600940704346},{"id":"https://openalex.org/C40969351","wikidata":"https://www.wikidata.org/wiki/Q3516228","display_name":"Word error rate","level":2,"score":0.5477792024612427},{"id":"https://openalex.org/C96455323","wikidata":"https://www.wikidata.org/wiki/Q13955","display_name":"Arabic","level":2,"score":0.4828494191169739},{"id":"https://openalex.org/C90805587","wikidata":"https://www.wikidata.org/wiki/Q10944557","display_name":"Word (group theory)","level":2,"score":0.4758439064025879},{"id":"https://openalex.org/C103088060","wikidata":"https://www.wikidata.org/wiki/Q1062839","display_name":"Error detection and correction","level":2,"score":0.45877277851104736},{"id":"https://openalex.org/C170748874","wikidata":"https://www.wikidata.org/wiki/Q21117977","display_name":"Proofreading","level":4,"score":0.4353160560131073},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.4156067669391632},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.3530142307281494},{"id":"https://openalex.org/C41895202","wikidata":"https://www.wikidata.org/wiki/Q8162","display_name":"Linguistics","level":1,"score":0.18467405438423157},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.15694445371627808},{"id":"https://openalex.org/C199360897","wikidata":"https://www.wikidata.org/wiki/Q9143","display_name":"Programming language","level":1,"score":0.09357449412345886},{"id":"https://openalex.org/C185592680","wikidata":"https://www.wikidata.org/wiki/Q2329","display_name":"Chemistry","level":0,"score":0.0},{"id":"https://openalex.org/C82381507","wikidata":"https://www.wikidata.org/wiki/Q416878","display_name":"Polymerase","level":3,"score":0.0},{"id":"https://openalex.org/C104317684","wikidata":"https://www.wikidata.org/wiki/Q7187","display_name":"Gene","level":2,"score":0.0},{"id":"https://openalex.org/C138885662","wikidata":"https://www.wikidata.org/wiki/Q5891","display_name":"Philosophy","level":0,"score":0.0},{"id":"https://openalex.org/C55493867","wikidata":"https://www.wikidata.org/wiki/Q7094","display_name":"Biochemistry","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1142/s1793840609002147","is_oa":false,"landing_page_url":"https://doi.org/10.1142/s1793840609002147","pdf_url":null,"source":{"id":"https://openalex.org/S50006202","display_name":"International Journal of Computer Processing Of Languages","issn_l":"1793-8406","issn":["1793-8406","2010-0205"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319815","host_organization_name":"World Scientific","host_organization_lineage":["https://openalex.org/P4310319815"],"host_organization_lineage_names":["World Scientific"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"International Journal of Computer Processing of Languages","raw_type":"journal-article"}],"best_oa_location":null,"sustainable_development_goals":[{"score":0.8199999928474426,"id":"https://metadata.un.org/sdg/4","display_name":"Quality Education"}],"awards":[],"funders":[{"id":"https://openalex.org/F4320323175","display_name":"Universit\u00e9 de Montr\u00e9al","ror":"https://ror.org/0161xgx34"}],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":7,"referenced_works":["https://openalex.org/W1574901103","https://openalex.org/W1990513570","https://openalex.org/W2075294717","https://openalex.org/W2081366726","https://openalex.org/W2121174708","https://openalex.org/W2125754282","https://openalex.org/W2140217726"],"related_works":["https://openalex.org/W1566315437","https://openalex.org/W2594897229","https://openalex.org/W4221142855","https://openalex.org/W2151348424","https://openalex.org/W2050138804","https://openalex.org/W2129812225","https://openalex.org/W4290708361","https://openalex.org/W2523799048","https://openalex.org/W2155620340","https://openalex.org/W1494910745"],"abstract_inverted_index":{"The":[0,96,147,176],"OCR":[1],"output":[2],"of":[3,44,186],"scanned":[4],"document":[5],"images":[6],"suffers":[7],"from":[8,90],"recognition":[9],"errors":[10,156],"especially":[11,189],"when":[12],"dealing":[13],"with":[14],"languages":[15],"that":[16,162],"are":[17,170],"characterized":[18],"by":[19,55,104,112,167],"particularities":[20],"and":[21,51,83,118,157,169],"rich":[22],"morphology":[23],"such":[24],"as":[25],"the":[26,49,73,78,85,101,109,114,154,159,183],"Arabic":[27,74,86],"language,":[28],"thus":[29],"an":[30,180],"effective":[31,151],"error":[32,52],"correction":[33,57,110,184],"model":[34,149],"is":[35,69,150],"greatly":[36],"needed.":[37],"This":[38],"paper":[39],"focuses":[40],"on":[41,60,65],"three":[42],"aspects":[43],"post-processing":[45],"correction.":[46],"First,":[47],"improving":[48,100],"alignment":[50],"n-gram":[53],"models":[54,80,103],"adding":[56,105],"rules":[58],"based":[59],"character":[61],"meta-classes":[62],"rather":[63],"than":[64],"specific":[66],"characters,":[67],"which":[68,122],"more":[70],"suitable":[71],"for":[72,142],"language.":[75],"Second,":[76],"using":[77,113],"language":[79,102],"to":[81,108,126],"understand":[82],"correct":[84],"word":[87],"fragment":[88],"resulting":[89],"agglutinated":[91],"affixes":[92],"or":[93],"isolated":[94],"letters.":[95],"last":[97],"will":[98],"concern":[99],"semantic":[106,129,160],"information":[107],"process,":[111],"bidirectional":[115],"n-grams,":[116],"stemming":[117],"removing":[119],"stop":[120],"words,":[121],"gives":[123],"higher":[124],"weights":[125],"n-grams":[127],"sharing":[128],"meanings.":[130],"In":[131],"addition,":[132],"we":[133],"use":[134],"a":[135,139,143,173],"topic":[136],"corpus,":[137],"not":[138,164],"global":[140],"one":[141],"better":[144],"probability":[145],"distribution.":[146],"proposed":[148,177],"in":[152,182,190],"correcting":[153],"lexical":[155],"covered":[158],"ones,":[161],"were":[163],"frequently":[165],"reported":[166],"OCRs":[168],"corrected":[171],"after":[172],"manual":[174],"proofreading.":[175],"method":[178],"shows":[179],"increase":[181],"rate":[185],"almost":[187],"13%":[188],"meaningful":[191],"terms.":[192]},"counts_by_year":[],"updated_date":"2025-11-06T03:46:38.306776","created_date":"2025-10-10T00:00:00"}
