{"id":"https://openalex.org/W7164882657","doi":"https://doi.org/10.48550/arxiv.2606.15307","title":"Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes","display_name":"Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes","publication_year":2026,"publication_date":"2026-06-13","ids":{"openalex":"https://openalex.org/W7164882657","doi":"https://doi.org/10.48550/arxiv.2606.15307"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.15307","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.15307","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.15307","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5109021944","display_name":"Mohamed Bayan Kmainasi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kmainasi, Mohamed Bayan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5086826049","display_name":"M\u00fccahid Kutlu","orcid":"https://orcid.org/0000-0002-5660-4992"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kutlu, Mucahid","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5109021945","display_name":"Ali Ezzat Shahroor","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shahroor, Ali Ezzat","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138745203","display_name":"Abul Hasnat","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Hasnat, Abul","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5138755547","display_name":"Firoj Alam","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Alam, Firoj","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11147","display_name":"Misinformation and Its Impacts","score":0.5171999931335449,"subfield":{"id":"https://openalex.org/subfields/3312","display_name":"Sociology and Political Science"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},"topics":[{"id":"https://openalex.org/T11147","display_name":"Misinformation and Its Impacts","score":0.5171999931335449,"subfield":{"id":"https://openalex.org/subfields/3312","display_name":"Sociology and Political Science"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T12262","display_name":"Hate Speech and Cyberbullying Detection","score":0.25999999046325684,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10664","display_name":"Sentiment Analysis and Opinion Mining","score":0.04399999976158142,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/exploit","display_name":"Exploit","score":0.7077000141143799},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5997999906539917},{"id":"https://openalex.org/keywords/quality","display_name":"Quality (philosophy)","score":0.48019999265670776},{"id":"https://openalex.org/keywords/regularization","display_name":"Regularization (linguistics)","score":0.46059998869895935},{"id":"https://openalex.org/keywords/moderation","display_name":"Moderation","score":0.349700003862381},{"id":"https://openalex.org/keywords/proposition","display_name":"Proposition","score":0.3248000144958496},{"id":"https://openalex.org/keywords/empirical-research","display_name":"Empirical research","score":0.3125}],"concepts":[{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.7077000141143799},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6743000149726868},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6251000165939331},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5997999906539917},{"id":"https://openalex.org/C2779530757","wikidata":"https://www.wikidata.org/wiki/Q1207505","display_name":"Quality (philosophy)","level":2,"score":0.48019999265670776},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.4763000011444092},{"id":"https://openalex.org/C2776135515","wikidata":"https://www.wikidata.org/wiki/Q17143721","display_name":"Regularization (linguistics)","level":2,"score":0.46059998869895935},{"id":"https://openalex.org/C93225998","wikidata":"https://www.wikidata.org/wiki/Q1941972","display_name":"Moderation","level":2,"score":0.349700003862381},{"id":"https://openalex.org/C2777152325","wikidata":"https://www.wikidata.org/wiki/Q108163","display_name":"Proposition","level":2,"score":0.3248000144958496},{"id":"https://openalex.org/C120936955","wikidata":"https://www.wikidata.org/wiki/Q2155640","display_name":"Empirical research","level":2,"score":0.3125},{"id":"https://openalex.org/C2780226545","wikidata":"https://www.wikidata.org/wiki/Q6888030","display_name":"Modality (human\u2013computer interaction)","level":2,"score":0.3125},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.31189998984336853},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.30469998717308044},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.30309998989105225},{"id":"https://openalex.org/C41895202","wikidata":"https://www.wikidata.org/wiki/Q8162","display_name":"Linguistics","level":1,"score":0.2842000126838684},{"id":"https://openalex.org/C132964779","wikidata":"https://www.wikidata.org/wiki/Q2110223","display_name":"Raw data","level":2,"score":0.2838999927043915},{"id":"https://openalex.org/C2780801425","wikidata":"https://www.wikidata.org/wiki/Q5164392","display_name":"Construct (python library)","level":2,"score":0.2809000015258789},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.2574999928474426}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.15307","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.15307","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.15307","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.15307","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16","score":0.6483066082000732}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Hateful":[0,136],"and":[1,9,50,60,79,85,101,119,122,138,160,215],"propagandistic":[2,80],"memes":[3,129],"exploit":[4],"the":[5,135,177],"interplay":[6],"between":[7],"images":[8],"text":[10],"to":[11,33,154,158,165,170,176],"convey":[12],"harmful":[13],"intent":[14],"that":[15,46,114,142],"neither":[16],"modality":[17],"reveals":[18],"alone.":[19],"Although":[20],"thinking-based":[21,55],"multimodal":[22],"large":[23],"language":[24],"models":[25],"(MLLMs)":[26],"have":[27],"advanced":[28],"vision-language":[29],"understanding,":[30],"their":[31],"application":[32],"meme":[34,81,91],"content":[35],"moderation":[36],"remains":[37],"underexplored.":[38],"We":[39,208],"propose":[40],"a":[41,70,108],"reinforcement":[42],"learning-based":[43],"post-training":[44],"method":[45],"improves":[47,145],"classification":[48,117],"performance":[49,204],"reference-based":[51],"explanation":[52,120],"quality":[53],"in":[54,192],"MLLMs":[56,76],"via":[57,99],"task-specific":[58],"rewards":[59],"Group":[61],"Relative":[62],"Policy":[63],"Optimization":[64],"(GRPO).":[65],"Concretely,":[66],"we":[67],"(i)":[68],"conduct":[69],"systematic":[71],"empirical":[72],"study":[73],"of":[74,194],"off-the-shelf":[75],"for":[77],"hateful":[78],"understanding":[82],"across":[83],"English":[84],"Arabic":[86],"benchmarks,":[87],"(ii)":[88],"extend":[89],"existing":[90],"datasets":[92],"with":[93,111,172,206],"weakly":[94],"supervised":[95],"chain-of-thought":[96],"(CoT)":[97],"rationales":[98],"distillation":[100],"multi-LLM":[102],"fine-grained":[103],"propaganda":[104],"annotations,":[105],"(iii)":[106],"introduce":[107],"GRPO-based":[109],"objective":[110],"thinking-length":[112],"regularization":[113],"jointly":[115],"optimizes":[116],"accuracy":[118,152],"quality,":[121],"(iv)":[123],"investigate":[124],"self-supervised":[125],"GRPO":[126],"on":[127,134,150,161],"unlabeled":[128],"using":[130],"consensus-based":[131],"pseudo-labels.":[132],"Experiments":[133],"Memes":[137],"ArMeme":[139,162,179],"benchmarks":[140],"show":[141],"our":[143,198,211],"approach":[144,199],"over":[146],"previously":[147],"reported":[148],"results":[149],"FHM":[151],"(up":[153,164],"+2.1%,":[155],"from":[156,168],"79.9%":[157],"82.0%)":[159],"macro-F1":[163],"+7.6":[166],"points,":[167],"0.536":[169],"0.612":[171],"explanations;":[173],"+6.1":[174],"compared":[175],"original":[178],"benchmark),":[180],"while":[181],"also":[182],"generating":[183],"natural-language":[184],"explanations.":[185,207],"On":[186],"ArMeme,":[187],"sequence-classification":[188],"baselines":[189],"remain":[190],"stronger":[191],"terms":[193],"raw":[195],"accuracy,":[196],"whereas":[197],"provides":[200],"more":[201],"balanced":[202],"per-class":[203],"along":[205],"publicly":[209],"release":[210],"code,":[212],"data":[213],"extensions,":[214],"evaluation":[216],"resources.":[217]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-06-17T00:00:00"}
