{"id":"https://openalex.org/W7138229936","doi":"https://doi.org/10.1609/aaai.v40i5.37389","title":"Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security","display_name":"Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security","publication_year":2026,"publication_date":"2026-03-14","ids":{"openalex":"https://openalex.org/W7138229936","doi":"https://doi.org/10.1609/aaai.v40i5.37389"},"language":"en","primary_location":{"id":"doi:10.1609/aaai.v40i5.37389","is_oa":true,"landing_page_url":"https://doi.org/10.1609/aaai.v40i5.37389","pdf_url":null,"source":{"id":"https://openalex.org/S4210191458","display_name":"Proceedings of the AAAI Conference on Artificial Intelligence","issn_l":"2159-5399","issn":["2159-5399","2374-3468"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/P4310320058","host_organization_name":"Association for the Advancement of Artificial Intelligence","host_organization_lineage":["https://openalex.org/P4310320058"],"host_organization_lineage_names":["Association for the Advancement of Artificial Intelligence"],"type":"conference"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the AAAI Conference on Artificial Intelligence","raw_type":"journal-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"diamond","oa_url":"https://doi.org/10.1609/aaai.v40i5.37389","any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5129649664","display_name":"Xiang Fang","orcid":null},"institutions":[{"id":"https://openalex.org/I47720641","display_name":"Huazhong University of Science and Technology","ror":"https://ror.org/00p991c53","country_code":"CN","type":"education","lineage":["https://openalex.org/I47720641"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Xiang Fang","raw_affiliation_strings":["School of Software Engineering, Huazhong University of Science and Technology"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"School of Software Engineering, Huazhong University of Science and Technology","institution_ids":["https://openalex.org/I47720641"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5113067511","display_name":"Wanlong Fang","orcid":"https://orcid.org/0000-0003-4480-3107"},"institutions":[{"id":"https://openalex.org/I172675005","display_name":"Nanyang Technological University","ror":"https://ror.org/02e7b5302","country_code":"SG","type":"education","lineage":["https://openalex.org/I172675005"]}],"countries":["SG"],"is_corresponding":false,"raw_author_name":"Wanlong Fang","raw_affiliation_strings":["Nanyang Technological University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Nanyang Technological University","institution_ids":["https://openalex.org/I172675005"]}]}],"institutions":[],"countries_distinct_count":2,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":1,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":"40","issue":"5","first_page":"3876","last_page":"3884"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.9391000270843506,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.9391000270843506,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.010400000028312206,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.009100000374019146,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/adversarial-system","display_name":"Adversarial system","score":0.9611999988555908},{"id":"https://openalex.org/keywords/exploit","display_name":"Exploit","score":0.8120999932289124},{"id":"https://openalex.org/keywords/adversarial-machine-learning","display_name":"Adversarial machine learning","score":0.5644999742507935},{"id":"https://openalex.org/keywords/classifier","display_name":"Classifier (UML)","score":0.5530999898910522},{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.5299999713897705},{"id":"https://openalex.org/keywords/false-accusation","display_name":"False accusation","score":0.3303999900817871}],"concepts":[{"id":"https://openalex.org/C37736160","wikidata":"https://www.wikidata.org/wiki/Q1801315","display_name":"Adversarial system","level":2,"score":0.9611999988555908},{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.8120999932289124},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7742999792098999},{"id":"https://openalex.org/C38652104","wikidata":"https://www.wikidata.org/wiki/Q3510521","display_name":"Computer security","level":1,"score":0.5985999703407288},{"id":"https://openalex.org/C2778403875","wikidata":"https://www.wikidata.org/wiki/Q20312394","display_name":"Adversarial machine learning","level":3,"score":0.5644999742507935},{"id":"https://openalex.org/C95623464","wikidata":"https://www.wikidata.org/wiki/Q1096149","display_name":"Classifier (UML)","level":2,"score":0.5530999898910522},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.5299999713897705},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4345000088214874},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3537999987602234},{"id":"https://openalex.org/C59577422","wikidata":"https://www.wikidata.org/wiki/Q10265143","display_name":"False accusation","level":2,"score":0.3303999900817871},{"id":"https://openalex.org/C112930515","wikidata":"https://www.wikidata.org/wiki/Q4389547","display_name":"Risk analysis (engineering)","level":1,"score":0.3278000056743622},{"id":"https://openalex.org/C140547941","wikidata":"https://www.wikidata.org/wiki/Q7797194","display_name":"Threat model","level":2,"score":0.29490000009536743},{"id":"https://openalex.org/C184337299","wikidata":"https://www.wikidata.org/wiki/Q1437428","display_name":"Semantics (computer science)","level":2,"score":0.265500009059906},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.2502000033855438}],"mesh":[],"locations_count":2,"locations":[{"id":"doi:10.1609/aaai.v40i5.37389","is_oa":true,"landing_page_url":"https://doi.org/10.1609/aaai.v40i5.37389","pdf_url":null,"source":{"id":"https://openalex.org/S4210191458","display_name":"Proceedings of the AAAI Conference on Artificial Intelligence","issn_l":"2159-5399","issn":["2159-5399","2374-3468"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/P4310320058","host_organization_name":"Association for the Advancement of Artificial Intelligence","host_organization_lineage":["https://openalex.org/P4310320058"],"host_organization_lineage_names":["Association for the Advancement of Artificial Intelligence"],"type":"conference"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the AAAI Conference on Artificial Intelligence","raw_type":"journal-article"},{"id":"pmh:oai:ojs.aaai.org:article/37389","is_oa":false,"landing_page_url":"https://ojs.aaai.org/index.php/AAAI/article/view/37389","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"2159-5399","raw_type":"info:eu-repo/semantics/article"}],"best_oa_location":{"id":"doi:10.1609/aaai.v40i5.37389","is_oa":true,"landing_page_url":"https://doi.org/10.1609/aaai.v40i5.37389","pdf_url":null,"source":{"id":"https://openalex.org/S4210191458","display_name":"Proceedings of the AAAI Conference on Artificial Intelligence","issn_l":"2159-5399","issn":["2159-5399","2374-3468"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/P4310320058","host_organization_name":"Association for the Advancement of Artificial Intelligence","host_organization_lineage":["https://openalex.org/P4310320058"],"host_organization_lineage_names":["Association for the Advancement of Artificial Intelligence"],"type":"conference"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the AAAI Conference on Artificial Intelligence","raw_type":"journal-article"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16","score":0.7332866787910461}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Large":[0],"Language":[1],"Models":[2],"(LLMs)":[3],"are":[4,69],"increasingly":[5],"vulnerable":[6],"to":[7,14,34,89,110],"adversarial":[8,91,136,144,207],"prompts":[9,66],"that":[10,57,106],"exploit":[11],"semantic":[12,86],"ambiguities":[13],"bypass":[15],"safety":[16],"mechanisms,":[17],"resulting":[18],"in":[19,41,64,114,185],"harmful":[20,151],"or":[21],"inappropriate":[22],"outputs.":[23],"Such":[24],"attacks,":[25],"including":[26],"jailbreaking":[27,130],"and":[28,37,60,92,117,129,134,192,198],"prompt":[29,94,115],"injection,":[30],"pose":[31],"significant":[32],"risks":[33],"the":[35,47,72],"integrity":[36,193],"availability":[38],"of":[39,127],"LLMs":[40],"security-critical":[42],"applications.":[43],"This":[44],"paper":[45],"proposes":[46],"Adversarial":[48],"Prompt":[49],"Disentanglement":[50],"(APD)":[51],"framework,":[52],"a":[53,82,101,119,174,200],"novel":[54,190],"defense":[55,204],"mechanism":[56],"proactively":[58],"identifies":[59],"neutralizes":[61],"malicious":[62,112],"components":[63],"input":[65],"before":[67],"they":[68],"processed":[70],"by":[71,154],"LLM.":[73],"The":[74,164],"APD":[75,146],"framework":[76],"integrates":[77],"three":[78],"key":[79],"innovations:":[80],"(1)":[81],"mutual":[83],"information-":[84],"based":[85],"decomposition":[87],"method":[88],"isolate":[90],"benign":[93],"components,":[95],"ensuring":[96],"statistical":[97],"in-":[98],"dependence;":[99],"(2)":[100],"graph-based":[102],"intent":[103,137],"classification":[104],"approach":[105],"leverages":[107],"spectral":[108],"analysis":[109],"detect":[111],"patterns":[113],"semantics;":[116],"(3)":[118],"lightweight":[120],"transformer-based":[121],"classifier":[122],"trained":[123],"on":[124,140,161,189],"real-world":[125],"datasets":[126,142],"toxic":[128],"prompts,":[131,145],"enabling":[132],"efficient":[133],"accurate":[135],"detection.":[138],"Evaluated":[139],"diverse":[141],"containing":[143],"demonstrates":[147],"superior":[148],"robustness,":[149],"reducing":[150],"output":[152],"generation":[153],"over":[155],"85%":[156],"while":[157],"maintaining":[158],"negligible":[159],"impact":[160],"model":[162],"performance.":[163],"framework\u2019s":[165],"computational":[166],"efficiency":[167],"supports":[168],"real-time":[169],"deploy-":[170],"ment,":[171],"making":[172],"it":[173],"practical":[175],"solution":[176],"for":[177,195],"securing":[178],"LLMs.":[179],"Our":[180],"work":[181],"addresses":[182],"critical":[183],"challenges":[184],"machine":[186],"learning":[187],"security":[188],"attacks":[191],"methods":[194],"ML":[196],"systems,":[197],"offers":[199],"scalable,":[201],"ethically":[202],"grounded":[203],"against":[205],"prompt-based":[206],"threats.":[208]},"counts_by_year":[{"year":2026,"cited_by_count":1}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2026-03-18T00:00:00"}
