{"id":"https://openalex.org/W4415316327","doi":"https://doi.org/10.48550/arxiv.2509.12672","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","display_name":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","publication_year":2025,"publication_date":"2025-09-16","ids":{"openalex":"https://openalex.org/W4415316327","doi":"https://doi.org/10.48550/arxiv.2509.12672"},"language":"en","primary_location":{"id":"pmh:oai:arXiv.org:2509.12672","is_oa":true,"landing_page_url":"https://arxiv.org/abs/2509.12672","pdf_url":"https://arxiv.org/pdf/2509.12672","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},"type":"preprint","indexed_in":["arxiv","datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://arxiv.org/pdf/2509.12672","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5011833635","display_name":"Shaz Furniturewala","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Furniturewala, Shaz","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5071220716","display_name":"Arkaitz Zubiaga","orcid":"https://orcid.org/0000-0003-4583-3623"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zubiaga, Arkaitz","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.9819999933242798,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.9819999933242798,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11241","display_name":"Advanced Malware Detection Techniques","score":0.9359999895095825,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/adversarial-system","display_name":"Adversarial system","score":0.9307000041007996},{"id":"https://openalex.org/keywords/interpretability","display_name":"Interpretability","score":0.8442000150680542},{"id":"https://openalex.org/keywords/variety","display_name":"Variety (cybernetics)","score":0.5443000197410583},{"id":"https://openalex.org/keywords/vulnerability","display_name":"Vulnerability (computing)","score":0.5394999980926514},{"id":"https://openalex.org/keywords/robustness","display_name":"Robustness (evolution)","score":0.5062999725341797},{"id":"https://openalex.org/keywords/moderation","display_name":"Moderation","score":0.3982999920845032},{"id":"https://openalex.org/keywords/training-set","display_name":"Training set","score":0.30489999055862427}],"concepts":[{"id":"https://openalex.org/C37736160","wikidata":"https://www.wikidata.org/wiki/Q1801315","display_name":"Adversarial system","level":2,"score":0.9307000041007996},{"id":"https://openalex.org/C2781067378","wikidata":"https://www.wikidata.org/wiki/Q17027399","display_name":"Interpretability","level":2,"score":0.8442000150680542},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6559000015258789},{"id":"https://openalex.org/C136197465","wikidata":"https://www.wikidata.org/wiki/Q1729295","display_name":"Variety (cybernetics)","level":2,"score":0.5443000197410583},{"id":"https://openalex.org/C95713431","wikidata":"https://www.wikidata.org/wiki/Q631425","display_name":"Vulnerability (computing)","level":2,"score":0.5394999980926514},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.5062999725341797},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.44699999690055847},{"id":"https://openalex.org/C38652104","wikidata":"https://www.wikidata.org/wiki/Q3510521","display_name":"Computer security","level":1,"score":0.421099990606308},{"id":"https://openalex.org/C93225998","wikidata":"https://www.wikidata.org/wiki/Q1941972","display_name":"Moderation","level":2,"score":0.3982999920845032},{"id":"https://openalex.org/C108827166","wikidata":"https://www.wikidata.org/wiki/Q175975","display_name":"Internet privacy","level":1,"score":0.3407000005245209},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.33329999446868896},{"id":"https://openalex.org/C2522767166","wikidata":"https://www.wikidata.org/wiki/Q2374463","display_name":"Data science","level":1,"score":0.3310000002384186},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.30489999055862427},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.28290000557899475},{"id":"https://openalex.org/C167063184","wikidata":"https://www.wikidata.org/wiki/Q1400839","display_name":"Vulnerability assessment","level":3,"score":0.2784000039100647},{"id":"https://openalex.org/C83860907","wikidata":"https://www.wikidata.org/wiki/Q135005","display_name":"Phishing","level":3,"score":0.2741999924182892},{"id":"https://openalex.org/C162446236","wikidata":"https://www.wikidata.org/wiki/Q653137","display_name":"Content analysis","level":2,"score":0.2721000015735626},{"id":"https://openalex.org/C2778152352","wikidata":"https://www.wikidata.org/wiki/Q5165061","display_name":"Content (measure theory)","level":2,"score":0.2721000015735626},{"id":"https://openalex.org/C112930515","wikidata":"https://www.wikidata.org/wiki/Q4389547","display_name":"Risk analysis (engineering)","level":1,"score":0.2540999948978424},{"id":"https://openalex.org/C101293273","wikidata":"https://www.wikidata.org/wiki/Q579716","display_name":"User-generated content","level":3,"score":0.2540000081062317},{"id":"https://openalex.org/C41065033","wikidata":"https://www.wikidata.org/wiki/Q2825412","display_name":"Adversary","level":2,"score":0.25110000371932983}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:oai:arXiv.org:2509.12672","is_oa":true,"landing_page_url":"https://arxiv.org/abs/2509.12672","pdf_url":"https://arxiv.org/pdf/2509.12672","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},{"id":"doi:10.48550/arxiv.2509.12672","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2509.12672","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:oai:arXiv.org:2509.12672","is_oa":true,"landing_page_url":"https://arxiv.org/abs/2509.12672","pdf_url":"https://arxiv.org/pdf/2509.12672","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"The":[0],"volume":[1],"of":[2,14,91,123,210],"machine-generated":[3],"content":[4,24,28],"online":[5],"has":[6],"grown":[7],"dramatically":[8],"due":[9,43],"to":[10,20,44,57,78,86,96,131,178],"the":[11,88,182],"widespread":[12],"use":[13,127],"Large":[15],"Language":[16],"Models":[17],"(LLMs),":[18],"leading":[19],"new":[21],"challenges":[22],"for":[23,174,198],"moderation":[25,29],"systems.":[26],"Conventional":[27],"classifiers,":[30,115],"which":[31,204],"are":[32,63,171,196],"usually":[33],"trained":[34],"on":[35,71,103,110,117,187],"text":[36,46],"produced":[37],"by":[38],"humans,":[39],"suffer":[40],"from":[41,48],"misclassifications":[42],"LLM-generated":[45],"deviating":[47],"their":[49],"training":[50,73],"data":[51],"and":[52,113,157,180],"adversarial":[53,72,128,144,188],"attacks":[54],"that":[55,94,165,170,193],"aim":[56,85],"avoid":[58],"detection.":[59],"Present-day":[60],"defence":[61],"tactics":[62],"reactive":[64],"rather":[65],"than":[66],"proactive,":[67],"since":[68],"they":[69],"rely":[70],"or":[74,176],"external":[75],"detection":[76,212],"models":[77,166],"identify":[79,87,132],"attacks.":[80,145],"In":[81],"this":[82],"work,":[83],"we":[84,136],"vulnerable":[89,133,139,153,177,183],"components":[90],"toxicity":[92,211],"classifiers":[93],"contribute":[95],"misclassification,":[97],"proposing":[98],"a":[99,121],"novel":[100],"strategy":[101],"based":[102],"mechanistic":[104],"interpretability":[105],"techniques.":[106],"Our":[107],"study":[108],"focuses":[109],"fine-tuned":[111],"BERT":[112],"RoBERTa":[114],"testing":[116],"diverse":[118],"datasets":[119],"spanning":[120],"variety":[122],"minority":[124],"groups.":[125],"We":[126,146,163,190],"attacking":[129],"techniques":[130],"circuits.":[134],"Finally,":[135],"suppress":[137],"these":[138,152],"circuits,":[140,154],"improving":[141],"performance":[142,175,186],"against":[143],"also":[147,191],"provide":[148],"demographic-level":[149],"insights":[150],"into":[151],"exposing":[155],"fairness":[156],"robustness":[158],"gaps":[159],"in":[160],"model":[161],"training.":[162],"find":[164,192],"have":[167],"distinct":[168],"heads":[169,184,195],"either":[172],"crucial":[173],"attack":[179],"suppressing":[181],"improves":[185],"input.":[189],"different":[194,201],"responsible":[197],"vulnerability":[199],"across":[200],"demographic":[202],"groups,":[203],"can":[205],"inform":[206],"more":[207],"inclusive":[208],"development":[209],"models.":[213]},"counts_by_year":[],"updated_date":"2026-08-05T07:39:15.569665","created_date":"2025-10-18T00:00:00"}
