{"id":"https://openalex.org/W4416017517","doi":"https://doi.org/10.1145/3746252.3760946","title":"Pruning Strategies for Backdoor Defense in LLMs","display_name":"Pruning Strategies for Backdoor Defense in LLMs","publication_year":2025,"publication_date":"2025-11-08","ids":{"openalex":"https://openalex.org/W4416017517","doi":"https://doi.org/10.1145/3746252.3760946"},"language":"en","primary_location":{"id":"doi:10.1145/3746252.3760946","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3746252.3760946","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 34th ACM International Conference on Information and Knowledge Management","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["arxiv","crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://doi.org/10.1145/3746252.3760946","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5093760512","display_name":"Santosh Chapagain","orcid":"https://orcid.org/0009-0008-1590-5917"},"institutions":[{"id":"https://openalex.org/I121980950","display_name":"Utah State University","ror":"https://ror.org/00h6set76","country_code":"US","type":"education","lineage":["https://openalex.org/I121980950"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Santosh Chapagain","raw_affiliation_strings":["Department of Computer Science, Utah State University, Logan, UT, USA"],"raw_orcid":"https://orcid.org/0009-0008-1590-5917","affiliations":[{"raw_affiliation_string":"Department of Computer Science, Utah State University, Logan, UT, USA","institution_ids":["https://openalex.org/I121980950"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5050715780","display_name":"Shah Muhammad Hamdi","orcid":"https://orcid.org/0000-0002-9303-7835"},"institutions":[{"id":"https://openalex.org/I121980950","display_name":"Utah State University","ror":"https://ror.org/00h6set76","country_code":"US","type":"education","lineage":["https://openalex.org/I121980950"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Shah Muhammad Hamdi","raw_affiliation_strings":["Department of Computer Science, Utah State University, Logan, UT, USA"],"raw_orcid":"https://orcid.org/0000-0002-9303-7835","affiliations":[{"raw_affiliation_string":"Department of Computer Science, Utah State University, Logan, UT, USA","institution_ids":["https://openalex.org/I121980950"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5010973892","display_name":"Souka\u00efna Filali Boubrahimi","orcid":"https://orcid.org/0000-0001-5693-6383"},"institutions":[{"id":"https://openalex.org/I121980950","display_name":"Utah State University","ror":"https://ror.org/00h6set76","country_code":"US","type":"education","lineage":["https://openalex.org/I121980950"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Soukaina Filali Boubrahimi","raw_affiliation_strings":["Department of Computer Science, Utah State University, Logan, UT, USA"],"raw_orcid":"https://orcid.org/0000-0001-5693-6383","affiliations":[{"raw_affiliation_string":"Department of Computer Science, Utah State University, Logan, UT, USA","institution_ids":["https://openalex.org/I121980950"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I121980950"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":2,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"4633","last_page":"4638"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.7286999821662903,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.7286999821662903,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.15929999947547913,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11273","display_name":"Advanced Graph Neural Networks","score":0.01209999993443489,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/backdoor","display_name":"Backdoor","score":0.9682000279426575},{"id":"https://openalex.org/keywords/pruning","display_name":"Pruning","score":0.8650000095367432},{"id":"https://openalex.org/keywords/bayesian-probability","display_name":"Bayesian probability","score":0.5371000170707703},{"id":"https://openalex.org/keywords/variance","display_name":"Variance (accounting)","score":0.4814000129699707},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.29030001163482666}],"concepts":[{"id":"https://openalex.org/C2781045450","wikidata":"https://www.wikidata.org/wiki/Q254569","display_name":"Backdoor","level":2,"score":0.9682000279426575},{"id":"https://openalex.org/C108010975","wikidata":"https://www.wikidata.org/wiki/Q500094","display_name":"Pruning","level":2,"score":0.8650000095367432},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6495000123977661},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5486000180244446},{"id":"https://openalex.org/C107673813","wikidata":"https://www.wikidata.org/wiki/Q812534","display_name":"Bayesian probability","level":2,"score":0.5371000170707703},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5318999886512756},{"id":"https://openalex.org/C196083921","wikidata":"https://www.wikidata.org/wiki/Q7915758","display_name":"Variance (accounting)","level":2,"score":0.4814000129699707},{"id":"https://openalex.org/C38652104","wikidata":"https://www.wikidata.org/wiki/Q3510521","display_name":"Computer security","level":1,"score":0.36039999127388},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.29030001163482666},{"id":"https://openalex.org/C160234255","wikidata":"https://www.wikidata.org/wiki/Q812535","display_name":"Bayesian inference","level":3,"score":0.29019999504089355},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.28769999742507935},{"id":"https://openalex.org/C189430467","wikidata":"https://www.wikidata.org/wiki/Q7293293","display_name":"Ranking (information retrieval)","level":2,"score":0.2874999940395355},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.26739999651908875}],"mesh":[],"locations_count":2,"locations":[{"id":"doi:10.1145/3746252.3760946","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3746252.3760946","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 34th ACM International Conference on Information and Knowledge Management","raw_type":"proceedings-article"},{"id":"pmh:oai:arXiv.org:2508.20032","is_oa":true,"landing_page_url":"http://arxiv.org/abs/2508.20032","pdf_url":"https://arxiv.org/pdf/2508.20032","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"}],"best_oa_location":{"id":"doi:10.1145/3746252.3760946","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3746252.3760946","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 34th ACM International Conference on Information and Knowledge Management","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":31,"referenced_works":["https://openalex.org/W2251939518","https://openalex.org/W2753783305","https://openalex.org/W2807363941","https://openalex.org/W2934843808","https://openalex.org/W2963126845","https://openalex.org/W3035367371","https://openalex.org/W3100727892","https://openalex.org/W3109409894","https://openalex.org/W3128663834","https://openalex.org/W3167002899","https://openalex.org/W3173784240","https://openalex.org/W3175052694","https://openalex.org/W3176270593","https://openalex.org/W3196832521","https://openalex.org/W3205696278","https://openalex.org/W3207360435","https://openalex.org/W3213508244","https://openalex.org/W3215670835","https://openalex.org/W4280510162","https://openalex.org/W4385570110","https://openalex.org/W4385570794","https://openalex.org/W4385571902","https://openalex.org/W4385572332","https://openalex.org/W4385573287","https://openalex.org/W4388650545","https://openalex.org/W4391094990","https://openalex.org/W4396736209","https://openalex.org/W4399205826","https://openalex.org/W4401043416","https://openalex.org/W4403776755","https://openalex.org/W4413947764"],"related_works":[],"abstract_inverted_index":{"Backdoor":[0],"attacks":[1,33,39,55],"are":[2,18,40],"a":[3,103],"significant":[4],"threat":[5],"to":[6,31,42,102,155],"the":[7,51,76,98,147,168],"performance":[8],"and":[9,73,112,138,174],"integrity":[10],"of":[11,50,57,97],"pre-trained":[12],"language":[13],"models.":[14],"Although":[15],"such":[16],"models":[17],"routinely":[19],"fine-tuned":[20],"for":[21],"downstream":[22],"NLP":[23],"tasks,":[24],"recent":[25],"work":[26],"shows":[27,160],"they":[28],"remain":[29,74],"vulnerable":[30],"backdoor":[32],"that":[34,161],"survive":[35],"vanilla":[36],"fine-tuning.":[37],"These":[38],"difficult":[41],"defend":[43],"because":[44],"end":[45],"users":[46],"typically":[47],"lack":[48],"knowledge":[49,96],"attack":[52],"triggers.":[53],"Such":[54],"consist":[56],"stealthy":[58],"malicious":[59],"triggers":[60],"introduced":[61],"through":[62],"subtle":[63],"syntactic":[64,169],"or":[65,100],"stylistic":[66,179],"manipulations,":[67],"which":[68],"can":[69,90],"bypass":[70],"traditional":[71],"detection":[72],"in":[75],"model,":[77],"making":[78],"post-hoc":[79],"purification":[80],"essential.":[81],"In":[82],"this":[83,108],"study,":[84],"we":[85,110],"explore":[86],"whether":[87],"attention-head":[88],"pruning":[89,126,163,176],"mitigate":[91],"these":[92],"threats":[93],"without":[94],"any":[95],"trigger":[99],"access":[101],"clean":[104],"reference":[105],"model.":[106],"To":[107],"end,":[109],"design":[111],"implement":[113],"six":[114],"pruning-based":[115],"strategies:":[116],"(i)":[117],"gradient-based":[118,125,162],"pruning,":[119,123,134,137],"(ii)":[120],"layer-wise":[121],"variance":[122],"(iii)":[124],"with":[127],"structured":[128],"L1/L2":[129],"sparsification,":[130],"(iv)":[131],"randomized":[132],"ensemble":[133],"(v)":[135],"reinforcement-learning-guided":[136],"(vi)":[139],"Bayesian":[140,175],"uncertainty":[141],"pruning.":[142],"Each":[143],"method":[144],"iteratively":[145],"removes":[146],"least":[148],"informative":[149],"heads":[150],"while":[151,166],"monitoring":[152],"validation":[153],"accuracy":[154],"avoid":[156],"over-pruning.":[157],"Experimental":[158],"evaluation":[159],"performs":[164],"best":[165],"defending":[167],"triggers,":[170],"whereas":[171],"reinforcement":[172],"learning":[173],"better":[177],"withstand":[178],"attacks.":[180]},"counts_by_year":[{"year":2026,"cited_by_count":1},{"year":2025,"cited_by_count":1}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
