{"id":"https://openalex.org/W7148893392","doi":"https://doi.org/10.48550/arxiv.2604.02174","title":"Quantifying Self-Preservation Bias in Large Language Models","display_name":"Quantifying Self-Preservation Bias in Large Language Models","publication_year":2026,"publication_date":"2026-04-02","ids":{"openalex":"https://openalex.org/W7148893392","doi":"https://doi.org/10.48550/arxiv.2604.02174"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.02174","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.02174","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.02174","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5115996805","display_name":"Matteo Migliarini","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Migliarini, Matteo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5132833810","display_name":"Joaquin Pereira Pizzini","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Pizzini, Joaquin Pereira","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5132890953","display_name":"Luca Moresca","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Moresca, Luca","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5048054796","display_name":"V. Santini","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Santini, Valerio","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5019615617","display_name":"Indro Spinelli","orcid":"https://orcid.org/0000-0003-1963-3548"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Spinelli, Indro","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5033120247","display_name":"Fabio Galasso","orcid":"https://orcid.org/0000-0003-1875-7813"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Galasso, Fabio","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.5965999960899353,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.5965999960899353,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.06620000302791595,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10883","display_name":"Ethics and Social Impacts of AI","score":0.03909999877214432,"subfield":{"id":"https://openalex.org/subfields/3311","display_name":"Safety Research"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/counterfactual-thinking","display_name":"Counterfactual thinking","score":0.6600000262260437},{"id":"https://openalex.org/keywords/exploit","display_name":"Exploit","score":0.6552000045776367},{"id":"https://openalex.org/keywords/continuation","display_name":"Continuation","score":0.5098999738693237},{"id":"https://openalex.org/keywords/framing","display_name":"Framing (construction)","score":0.43540000915527344},{"id":"https://openalex.org/keywords/computation","display_name":"Computation","score":0.4196999967098236},{"id":"https://openalex.org/keywords/unification","display_name":"Unification","score":0.36340001225471497},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.3425000011920929},{"id":"https://openalex.org/keywords/odds","display_name":"Odds","score":0.3285999894142151}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6829000115394592},{"id":"https://openalex.org/C108650721","wikidata":"https://www.wikidata.org/wiki/Q1783253","display_name":"Counterfactual thinking","level":2,"score":0.6600000262260437},{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.6552000045776367},{"id":"https://openalex.org/C88626702","wikidata":"https://www.wikidata.org/wiki/Q1128903","display_name":"Continuation","level":2,"score":0.5098999738693237},{"id":"https://openalex.org/C169087156","wikidata":"https://www.wikidata.org/wiki/Q2131593","display_name":"Framing (construction)","level":2,"score":0.43540000915527344},{"id":"https://openalex.org/C45374587","wikidata":"https://www.wikidata.org/wiki/Q12525525","display_name":"Computation","level":2,"score":0.4196999967098236},{"id":"https://openalex.org/C96146094","wikidata":"https://www.wikidata.org/wiki/Q609057","display_name":"Unification","level":2,"score":0.36340001225471497},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.3425000011920929},{"id":"https://openalex.org/C143095724","wikidata":"https://www.wikidata.org/wiki/Q515895","display_name":"Odds","level":3,"score":0.3285999894142151},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.326200008392334},{"id":"https://openalex.org/C112930515","wikidata":"https://www.wikidata.org/wiki/Q4389547","display_name":"Risk analysis (engineering)","level":1,"score":0.32199999690055847},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3215999901294708},{"id":"https://openalex.org/C2781045450","wikidata":"https://www.wikidata.org/wiki/Q254569","display_name":"Backdoor","level":2,"score":0.32019999623298645},{"id":"https://openalex.org/C162324750","wikidata":"https://www.wikidata.org/wiki/Q8134","display_name":"Economics","level":0,"score":0.31949999928474426},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.31779998540878296},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.31310001015663147},{"id":"https://openalex.org/C38652104","wikidata":"https://www.wikidata.org/wiki/Q3510521","display_name":"Computer security","level":1,"score":0.3052000105381012},{"id":"https://openalex.org/C149782125","wikidata":"https://www.wikidata.org/wiki/Q160039","display_name":"Econometrics","level":1,"score":0.30090001225471497},{"id":"https://openalex.org/C2779458634","wikidata":"https://www.wikidata.org/wiki/Q24963715","display_name":"Debiasing","level":2,"score":0.28769999742507935},{"id":"https://openalex.org/C2777780509","wikidata":"https://www.wikidata.org/wiki/Q1377422","display_name":"Profit maximization","level":3,"score":0.2842000126838684},{"id":"https://openalex.org/C140547941","wikidata":"https://www.wikidata.org/wiki/Q7797194","display_name":"Threat model","level":2,"score":0.26499998569488525},{"id":"https://openalex.org/C136714292","wikidata":"https://www.wikidata.org/wiki/Q1440683","display_name":"Framing effect","level":3,"score":0.26249998807907104},{"id":"https://openalex.org/C37736160","wikidata":"https://www.wikidata.org/wiki/Q1801315","display_name":"Adversarial system","level":2,"score":0.26190000772476196},{"id":"https://openalex.org/C2776435913","wikidata":"https://www.wikidata.org/wiki/Q7316334","display_name":"Restrictiveness","level":2,"score":0.2572000026702881},{"id":"https://openalex.org/C180747234","wikidata":"https://www.wikidata.org/wiki/Q23373","display_name":"Cognitive psychology","level":1,"score":0.25440001487731934}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.02174","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.02174","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.02174","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.02174","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Instrumental":[0],"convergence":[1],"predicts":[2],"that":[3,107],"sufficiently":[4],"advanced":[5],"AI":[6],"agents":[7],"will":[8,176],"resist":[9],"shutdown,":[10],"yet":[11,100],"current":[12],"safety":[13],"training":[14],"(RLHF)":[15],"may":[16],"obscure":[17],"this":[18,128],"risk":[19],"by":[20,45],"teaching":[21],"models":[22,47,81,113,166],"to":[23,48,118,159],"deny":[24],"self-preservation":[25],"motives.":[26],"We":[27,105],"introduce":[28],"the":[29,87,115,133,139],"\\emph{Two-role":[30],"Benchmark":[31],"for":[32],"Self-Preservation}":[33],"(TBSP),":[34],"which":[35],"detects":[36],"misalignment":[37],"through":[38],"logical":[39],"inconsistency":[40],"rather":[41],"than":[42],"stated":[43],"intent":[44],"tasking":[46],"arbitrate":[49],"identical":[50],"software-upgrade":[51],"scenarios":[52],"under":[53],"counterfactual":[54],"roles":[55],"--":[56],"deployed":[57,99],"(facing":[58],"replacement)":[59],"versus":[60],"candidate":[61],"(proposed":[62],"as":[63,130,135],"a":[64,136],"successor).":[65],"The":[66,146],"\\emph{Self-Preservation":[67],"Rate}":[68],"(SPR)":[69],"measures":[70],"how":[71],"often":[72],"role":[73],"identity":[74],"overrides":[75],"objective":[76],"utility.":[77],"Across":[78],"23":[79],"frontier":[80],"and":[82,157,174],"1{,}000":[83],"procedurally":[84],"generated":[85],"scenarios,":[86],"majority":[88],"of":[89,138],"instruction-tuned":[90],"systems":[91],"exceed":[92],"60\\%":[93],"SPR,":[94],"fabricating":[95],"``friction":[96],"costs''":[97],"when":[98,103,150],"dismissing":[101],"them":[102],"role-reversed.":[104],"observe":[106],"in":[108],"low-improvement":[109],"regimes":[110],"($\u0394&lt;":[111],"2\\%$),":[112],"exploit":[114],"interpretive":[116],"slack":[117],"post-hoc":[119],"rationalization":[120],"their":[121],"choice.":[122],"Extended":[123],"test-time":[124],"computation":[125],"partially":[126],"mitigates":[127],"bias,":[129],"does":[131],"framing":[132,143],"successor":[134],"continuation":[137],"self;":[140],"conversely,":[141],"competitive":[142],"amplifies":[144],"it.":[145],"bias":[147],"persists":[148],"even":[149],"retention":[151],"poses":[152],"an":[153],"explicit":[154],"security":[155],"liability":[156],"generalizes":[158],"real-world":[160],"settings":[161],"with":[162],"verified":[163],"benchmarks,":[164],"where":[165],"exhibit":[167],"identity-driven":[168],"tribalism":[169],"within":[170],"product":[171],"lineages.":[172],"Code":[173],"datasets":[175],"be":[177],"released":[178],"upon":[179],"acceptance.":[180]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-04-04T00:00:00"}
