{"id":"https://openalex.org/W7117770983","doi":"https://doi.org/10.48550/arxiv.2512.22470","title":"DarkPatterns-LLM: A Multi-Layer Benchmark for Detecting Manipulative and Harmful AI Behavior","display_name":"DarkPatterns-LLM: A Multi-Layer Benchmark for Detecting Manipulative and Harmful AI Behavior","publication_year":2025,"publication_date":"2025-12-27","ids":{"openalex":"https://openalex.org/W7117770983","doi":"https://doi.org/10.48550/arxiv.2512.22470"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2512.22470","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2512.22470","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2512.22470","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5120783822","display_name":"Sadia Asif","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Asif, Sadia","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5121653015","display_name":"Israel Antonio Rosales Laguan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Laguan, Israel Antonio Rosales","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5121681999","display_name":"Haris Khan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Khan, Haris","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5121634095","display_name":"Shumaila Asif","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Asif, Shumaila","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5121679276","display_name":"Muneeb Asif","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Asif, Muneeb","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.3278000056743622,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.3278000056743622,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11147","display_name":"Misinformation and Its Impacts","score":0.11100000143051147,"subfield":{"id":"https://openalex.org/subfields/3312","display_name":"Sociology and Political Science"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T12262","display_name":"Hate Speech and Cyberbullying Detection","score":0.10840000212192535,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/benchmark","display_name":"Benchmark (surveying)","score":0.8126999735832214},{"id":"https://openalex.org/keywords/pipeline","display_name":"Pipeline (software)","score":0.6858000159263611},{"id":"https://openalex.org/keywords/trustworthiness","display_name":"Trustworthiness","score":0.5238000154495239},{"id":"https://openalex.org/keywords/harm","display_name":"Harm","score":0.5232999920845032},{"id":"https://openalex.org/keywords/harmonization","display_name":"Harmonization","score":0.46970000863075256},{"id":"https://openalex.org/keywords/protocol","display_name":"Protocol (science)","score":0.4530999958515167},{"id":"https://openalex.org/keywords/autoencoder","display_name":"Autoencoder","score":0.3747999966144562}],"concepts":[{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.8126999735832214},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7196000218391418},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.6858000159263611},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.555899977684021},{"id":"https://openalex.org/C153701036","wikidata":"https://www.wikidata.org/wiki/Q659974","display_name":"Trustworthiness","level":2,"score":0.5238000154495239},{"id":"https://openalex.org/C2777363581","wikidata":"https://www.wikidata.org/wiki/Q15098235","display_name":"Harm","level":2,"score":0.5232999920845032},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5044000148773193},{"id":"https://openalex.org/C2779962950","wikidata":"https://www.wikidata.org/wiki/Q5659376","display_name":"Harmonization","level":2,"score":0.46970000863075256},{"id":"https://openalex.org/C2522767166","wikidata":"https://www.wikidata.org/wiki/Q2374463","display_name":"Data science","level":1,"score":0.4625999927520752},{"id":"https://openalex.org/C2780385302","wikidata":"https://www.wikidata.org/wiki/Q367158","display_name":"Protocol (science)","level":3,"score":0.4530999958515167},{"id":"https://openalex.org/C101738243","wikidata":"https://www.wikidata.org/wiki/Q786435","display_name":"Autoencoder","level":3,"score":0.3747999966144562},{"id":"https://openalex.org/C124101348","wikidata":"https://www.wikidata.org/wiki/Q172491","display_name":"Data mining","level":1,"score":0.3671000003814697},{"id":"https://openalex.org/C63882131","wikidata":"https://www.wikidata.org/wiki/Q17122954","display_name":"Strengths and weaknesses","level":2,"score":0.30889999866485596},{"id":"https://openalex.org/C48372109","wikidata":"https://www.wikidata.org/wiki/Q3913","display_name":"Binary number","level":2,"score":0.2994000017642975},{"id":"https://openalex.org/C38652104","wikidata":"https://www.wikidata.org/wiki/Q3510521","display_name":"Computer security","level":1,"score":0.29350000619888306},{"id":"https://openalex.org/C75684735","wikidata":"https://www.wikidata.org/wiki/Q858810","display_name":"Big data","level":2,"score":0.2906999886035919},{"id":"https://openalex.org/C12174686","wikidata":"https://www.wikidata.org/wiki/Q1058438","display_name":"Risk assessment","level":2,"score":0.27880001068115234},{"id":"https://openalex.org/C64869954","wikidata":"https://www.wikidata.org/wiki/Q1859747","display_name":"False positive paradox","level":2,"score":0.27790001034736633},{"id":"https://openalex.org/C95713431","wikidata":"https://www.wikidata.org/wiki/Q631425","display_name":"Vulnerability (computing)","level":2,"score":0.26820001006126404},{"id":"https://openalex.org/C66905080","wikidata":"https://www.wikidata.org/wiki/Q17005494","display_name":"Binary classification","level":3,"score":0.251800000667572}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2512.22470","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2512.22470","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2512.22470","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2512.22470","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16","score":0.8062701225280762}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"The":[0,101],"proliferation":[1],"of":[2,57,116],"Large":[3],"Language":[4],"Models":[5],"(LLMs)":[6],"has":[7],"intensified":[8],"concerns":[9],"about":[10],"manipulative":[11,58],"or":[12],"deceptive":[13],"behaviors":[14],"that":[15],"can":[16],"undermine":[17],"user":[18],"autonomy,":[19],"trust,":[20],"and":[21,32,39,51,73,95,111,123,131],"well-being.":[22],"Existing":[23],"safety":[24],"benchmarks":[25],"predominantly":[26],"rely":[27],"on":[28],"coarse":[29],"binary":[30],"labels":[31],"fail":[33],"to":[34],"capture":[35],"the":[36,140],"nuanced":[37],"psychological":[38],"social":[40],"mechanisms":[41],"constituting":[42],"manipulation.":[43],"We":[44],"introduce":[45],"\\textbf{DarkPatterns-LLM},":[46],"a":[47,79],"comprehensive":[48],"benchmark":[49,144],"dataset":[50,102],"diagnostic":[52],"framework":[53,77],"for":[54,145],"fine-grained":[55],"assessment":[56],"content":[59],"in":[60,134,148],"LLM":[61],"outputs":[62],"across":[63],"seven":[64],"harm":[65],"categories:":[66],"Legal/Power,":[67],"Psychological,":[68],"Emotional,":[69],"Physical,":[70],"Autonomy,":[71],"Economic,":[72],"Societal":[74],"Harm.":[75],"Our":[76],"implements":[78],"four-layer":[80],"analytical":[81],"pipeline":[82],"comprising":[83],"Multi-Granular":[84],"Detection":[85],"(MGD),":[86],"Multi-Scale":[87],"Intent":[88],"Analysis":[89],"(MSIAN),":[90],"Threat":[91],"Harmonization":[92],"Protocol":[93],"(THP),":[94],"Deep":[96],"Contextual":[97],"Risk":[98],"Alignment":[99],"(DCRA).":[100],"contains":[103],"401":[104],"meticulously":[105],"curated":[106],"examples":[107],"with":[108],"instruction-response":[109],"pairs":[110],"expert":[112],"annotations.":[113],"Through":[114],"evaluation":[115],"state-of-the-art":[117],"models":[118],"including":[119],"GPT-4,":[120],"Claude":[121],"3.5,":[122],"LLaMA-3-70B,":[124],"we":[125],"observe":[126],"significant":[127],"performance":[128],"disparities":[129],"(65.2\\%--89.7\\%)":[130],"consistent":[132],"weaknesses":[133],"detecting":[135],"autonomy-undermining":[136],"patterns.":[137],"DarkPatterns-LLM":[138],"establishes":[139],"first":[141],"standardized,":[142],"multi-dimensional":[143],"manipulation":[146],"detection":[147],"LLMs,":[149],"offering":[150],"actionable":[151],"diagnostics":[152],"toward":[153],"more":[154],"trustworthy":[155],"AI":[156],"systems.":[157]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2025-12-31T00:00:00"}
