{"id":"https://openalex.org/W7166814103","doi":"https://doi.org/10.18653/v1/2026.acl-long.143","title":"CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization","display_name":"CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166814103","doi":"https://doi.org/10.18653/v1/2026.acl-long.143"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.acl-long.143","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.143","pdf_url":"https://aclanthology.org/2026.acl-long.143.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.acl-long.143.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139849722","display_name":"Junyi Jessy Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Junyi Li","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139835261","display_name":"Yongqiang Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yongqiang Chen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139838949","display_name":"Ningning Ding","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ningning Ding","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.8453873,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"3152","last_page":"3170"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11596","display_name":"Constraint Satisfaction and Optimization","score":0.36309999227523804,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11596","display_name":"Constraint Satisfaction and Optimization","score":0.36309999227523804,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.15539999306201935,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11303","display_name":"Bayesian Modeling and Causal Inference","score":0.06159999966621399,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/counterfactual-thinking","display_name":"Counterfactual thinking","score":0.76419997215271},{"id":"https://openalex.org/keywords/preference","display_name":"Preference","score":0.49320000410079956},{"id":"https://openalex.org/keywords/iterative-method","display_name":"Iterative method","score":0.2757999897003174},{"id":"https://openalex.org/keywords/non-monotonic-logic","display_name":"Non-monotonic logic","score":0.26969999074935913},{"id":"https://openalex.org/keywords/preference-theory","display_name":"Preference theory","score":0.2662000060081482},{"id":"https://openalex.org/keywords/probabilistic-logic","display_name":"Probabilistic logic","score":0.2635999917984009}],"concepts":[{"id":"https://openalex.org/C108650721","wikidata":"https://www.wikidata.org/wiki/Q1783253","display_name":"Counterfactual thinking","level":2,"score":0.76419997215271},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5128999948501587},{"id":"https://openalex.org/C2781249084","wikidata":"https://www.wikidata.org/wiki/Q908656","display_name":"Preference","level":2,"score":0.49320000410079956},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.43560001254081726},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.3237000107765198},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.30140000581741333},{"id":"https://openalex.org/C159694833","wikidata":"https://www.wikidata.org/wiki/Q2321565","display_name":"Iterative method","level":2,"score":0.2757999897003174},{"id":"https://openalex.org/C159032336","wikidata":"https://www.wikidata.org/wiki/Q2488768","display_name":"Non-monotonic logic","level":2,"score":0.26969999074935913},{"id":"https://openalex.org/C2781043087","wikidata":"https://www.wikidata.org/wiki/Q939761","display_name":"Preference theory","level":3,"score":0.2662000060081482},{"id":"https://openalex.org/C49937458","wikidata":"https://www.wikidata.org/wiki/Q2599292","display_name":"Probabilistic logic","level":2,"score":0.2635999917984009},{"id":"https://openalex.org/C143587482","wikidata":"https://www.wikidata.org/wiki/Q1543216","display_name":"Iterative and incremental development","level":2,"score":0.26269999146461487},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.26080000400543213},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.257999986410141},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.25119999051094055}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.acl-long.143","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.143","pdf_url":"https://aclanthology.org/2026.acl-long.143.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.acl-long.143","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.143","pdf_url":"https://aclanthology.org/2026.acl-long.143.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320321001","display_name":"National Natural Science Foundation of China","ror":"https://ror.org/01h0zpd94"},{"id":"https://openalex.org/F4320323537","display_name":"Hong Kong University of Science and Technology","ror":"https://ror.org/00q4vv597"}],"has_content":{"grobid_xml":true,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166814103.pdf","grobid_xml":"https://content.openalex.org/works/W7166814103.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Machine":[0],"unlearning":[1,99,114,158],"has":[2],"gained":[3],"increasing":[4],"attention":[5],"in":[6,108],"recent":[7],"years,":[8],"as":[9,100],"a":[10,29,53,94,112,122],"promising":[11],"technique":[12],"to":[13,48,55,61,76,120,134,145],"selectively":[14],"remove":[15],"unwanted":[16],"privacy":[17],"or":[18,70],"copyrighted":[19],"information":[20],"from":[21,66,149,178],"Large":[22,38],"Language":[23],"Models":[24,40],"that":[25,97,170],"are":[26],"trained":[27],"on":[28,166],"massive":[30],"scale":[31],"of":[32,37,104,193],"human":[33],"data.However,":[34],"the":[35,67,72,77,80,101,105,131,135,141,147,150,164,180,185,190],"emergence":[36],"Reasoning":[39],"(LRMs),":[41],"which":[42],"emphasize":[43],"long":[44],"chain-of-thought":[45],"(CoT)":[46],"reasoning":[47,73,81,107,126,191],"address":[49],"complex":[50],"questions,":[51],"presents":[52],"dilemma":[54],"unlearning:":[56],"existing":[57],"methods":[58],"either":[59],"struggle":[60],"completely":[62,175],"eliminate":[63],"undesired":[64],"knowledge":[65,177],"CoT":[68,106,182],"traces":[69],"degrade":[71],"performances":[74],"due":[75],"interference":[78],"with":[79],"process.To":[82],"this":[83],"end,":[84],"we":[85],"introduce":[86],"Counterfactual":[87],"Unlearning":[88],"through":[89],"iterative":[90,153],"Preference":[91],"Optimization":[92],"(CiPO),":[93],"novel":[95],"framework":[96],"redefines":[98],"targeted":[102],"intervention":[103],"LRMs.More":[109],"specifically,":[110],"given":[111],"desired":[113],"target":[115],"answer,":[116,187],"CiPO":[117,138,171],"instructs":[118],"LRMs":[119],"generate":[121],"logically":[123],"valid":[124],"counterfactual":[125,136],"trace":[127],"for":[128],"preference":[129,142],"tuning.As":[130],"LRM":[132],"adjusts":[133],"trace,":[137],"iteratively":[139],"updates":[140],"learning":[143],"data":[144],"increase":[146],"discrepancy":[148],"original":[151],"model.This":[152],"loop":[154],"ensures":[155],"both":[156,179],"desirable":[157],"and":[159,184],"smooth":[160],"optimization,":[161],"effectively":[162],"mitigating":[163],"dilemma.Experiments":[165],"challenging":[167],"benchmarks":[168],"demonstrate":[169],"excels":[172],"at":[173],"unlearning,":[174],"removing":[176],"intermediate":[181],"steps":[183],"final":[186],"while":[188],"preserving":[189],"abilities":[192],"LRMs.":[194]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-07-02T00:00:00"}
