{"id":"https://openalex.org/W7166886059","doi":"https://doi.org/10.18653/v1/2026.acl-long.2163","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","display_name":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166886059","doi":"https://doi.org/10.18653/v1/2026.acl-long.2163"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.acl-long.2163","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.2163","pdf_url":"https://aclanthology.org/2026.acl-long.2163.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.acl-long.2163.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5049823792","display_name":"Lillian Sun","orcid":"https://orcid.org/0000-0002-7917-2942"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lillian Sun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5044448837","display_name":"Martin Pawelczyk","orcid":"https://orcid.org/0000-0002-6191-4434"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Martin Pawelczyk","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139822854","display_name":"Zhenting Qi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhenting Qi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5045546662","display_name":"Aounon Kumar","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Aounon Kumar","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139836981","display_name":"Himabindu Lakkaraju","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Himabindu Lakkaraju","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.85814186,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"46625","last_page":"46647"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10883","display_name":"Ethics and Social Impacts of AI","score":0.19179999828338623,"subfield":{"id":"https://openalex.org/subfields/3311","display_name":"Safety Research"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},"topics":[{"id":"https://openalex.org/T10883","display_name":"Ethics and Social Impacts of AI","score":0.19179999828338623,"subfield":{"id":"https://openalex.org/subfields/3311","display_name":"Safety Research"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T10927","display_name":"Access Control and Trust","score":0.13830000162124634,"subfield":{"id":"https://openalex.org/subfields/3312","display_name":"Sociology and Political Science"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.0934000015258789,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/trustworthiness","display_name":"Trustworthiness","score":0.3662000000476837},{"id":"https://openalex.org/keywords/feature","display_name":"Feature (linguistics)","score":0.3160000145435333},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.30309998989105225},{"id":"https://openalex.org/keywords/interpretation","display_name":"Interpretation (philosophy)","score":0.30219998955726624},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.2827000021934509},{"id":"https://openalex.org/keywords/measure","display_name":"Measure (data warehouse)","score":0.27390000224113464}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.546500027179718},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.40459999442100525},{"id":"https://openalex.org/C153701036","wikidata":"https://www.wikidata.org/wiki/Q659974","display_name":"Trustworthiness","level":2,"score":0.3662000000476837},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.3490999937057495},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.3160000145435333},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.30309998989105225},{"id":"https://openalex.org/C527412718","wikidata":"https://www.wikidata.org/wiki/Q855395","display_name":"Interpretation (philosophy)","level":2,"score":0.30219998955726624},{"id":"https://openalex.org/C41895202","wikidata":"https://www.wikidata.org/wiki/Q8162","display_name":"Linguistics","level":1,"score":0.2937000095844269},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.2827000021934509},{"id":"https://openalex.org/C2780009758","wikidata":"https://www.wikidata.org/wiki/Q6804172","display_name":"Measure (data warehouse)","level":2,"score":0.27390000224113464},{"id":"https://openalex.org/C167729594","wikidata":"https://www.wikidata.org/wiki/Q17736","display_name":"Axiom","level":2,"score":0.27160000801086426},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.2563000023365021},{"id":"https://openalex.org/C195324797","wikidata":"https://www.wikidata.org/wiki/Q33742","display_name":"Natural language","level":2,"score":0.25540000200271606}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.acl-long.2163","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.2163","pdf_url":"https://aclanthology.org/2026.acl-long.2163.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.acl-long.2163","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.2163","pdf_url":"https://aclanthology.org/2026.acl-long.2163.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":true,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166886059.pdf","grobid_xml":"https://content.openalex.org/works/W7166886059.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"As":[0],"large":[1],"language":[2],"models":[3,144],"continue":[4],"to":[5,68],"advance,":[6],"ensuring":[7],"their":[8],"trustworthiness":[9,49,80,104,126,140,163,171],"is":[10,64],"critical.However,":[11],"inaccessible":[12],"real-world":[13,120,180],"ground":[14],"truth":[15],"labels":[16,39],"pose":[17],"a":[18,30,36,75,84,88,165],"significant":[19,137],"challenge":[20],"in":[21,44,139],"high-stakes":[22],"domains.Recent":[23],"studies":[24],"have":[25],"highlighted":[26],"weak-to-strong":[27,115,155],"generalization,":[28],"where":[29],"strong":[31],"model":[32,43,77,112],"trained":[33],"only":[34],"on":[35,83,119],"weak":[37,42,111],"model's":[38,86],"surpasses":[40],"the":[41,65,107,110,114,159,170],"task":[45],"performance.Yet,":[46],"whether":[47],"critical":[48],"properties":[50],"such":[51,128],"as":[52,129,164],"robustness,":[53,132,135],"fairness,":[54,130],"and":[55,113,133],"privacy":[56],"can":[57,78],"generalize":[58],"similarly":[59],"remains":[60],"an":[61],"open":[62],"question.This":[63],"first":[66],"work":[67],"study":[69],"this":[70],"question":[71],"by":[72],"examining":[73],"if":[74],"stronger":[76],"enhance":[79],"when":[81,142],"fine-tuned":[82],"weaker":[85],"labels,":[87],"paradigm":[89],"we":[90,96],"term":[91],"weak-tostrong":[92,162],"trustworthiness.To":[93],"address":[94],"this,":[95],"introduce":[97],"two":[98],"fundamental":[99],"fine-tuning":[100,108],"strategies":[101],"that":[102,123],"leverage":[103],"regularization":[105],"during":[106],"of":[109,154,161,172],"transfer.Our":[116],"experimental":[117],"evaluation":[118],"datasets":[121],"reveals":[122],"while":[124],"some":[125],"properties,":[127],"adversarial":[131],"OOD":[134],"show":[136],"improvement":[138],"generalization":[141],"both":[143],"were":[145],"regularized,":[146],"others,":[147],"like":[148],"privacy,":[149],"do":[150],"not":[151],"exhibit":[152],"signs":[153],"trustworthiness.Our":[156],"results":[157],"highlight":[158],"potential":[160],"practical":[166],"pathway":[167],"for":[168],"enhancing":[169],"increasingly":[173],"capable":[174],"AI":[175],"systems,":[176],"even":[177],"under":[178],"imperfect":[179],"conditions.":[181]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-07-02T00:00:00"}
