{"id":"https://openalex.org/W7161142203","doi":"https://doi.org/10.48550/arxiv.2605.13429","title":"TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment","display_name":"TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment","publication_year":2026,"publication_date":"2026-05-13","ids":{"openalex":"https://openalex.org/W7161142203","doi":"https://doi.org/10.48550/arxiv.2605.13429"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.13429","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.13429","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.13429","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5136138867","display_name":"Chong Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Chong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136184001","display_name":"Yingzhuo Deng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Deng, Yingzhuo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136182611","display_name":"Wen Yang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yang, Wen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136135264","display_name":"Jiajun Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Jiajun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5136133325","display_name":"Chengqing Zong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zong, Chengqing","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.36970001459121704,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.36970001459121704,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10181","display_name":"Natural Language Processing Techniques","score":0.2240000069141388,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T13702","display_name":"Machine Learning in Healthcare","score":0.07249999791383743,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/security-token","display_name":"Security token","score":0.8263000249862671},{"id":"https://openalex.org/keywords/lexical-analysis","display_name":"Lexical analysis","score":0.6381999850273132},{"id":"https://openalex.org/keywords/lexicon","display_name":"Lexicon","score":0.6169999837875366},{"id":"https://openalex.org/keywords/vocabulary","display_name":"Vocabulary","score":0.5257999897003174},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.5016999840736389},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.48080000281333923},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.46320000290870667},{"id":"https://openalex.org/keywords/adaptation","display_name":"Adaptation (eye)","score":0.44449999928474426}],"concepts":[{"id":"https://openalex.org/C48145219","wikidata":"https://www.wikidata.org/wiki/Q1335365","display_name":"Security token","level":2,"score":0.8263000249862671},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8191999793052673},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.6590999960899353},{"id":"https://openalex.org/C176982825","wikidata":"https://www.wikidata.org/wiki/Q835922","display_name":"Lexical analysis","level":2,"score":0.6381999850273132},{"id":"https://openalex.org/C2778121359","wikidata":"https://www.wikidata.org/wiki/Q8096","display_name":"Lexicon","level":2,"score":0.6169999837875366},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5922999978065491},{"id":"https://openalex.org/C2777601683","wikidata":"https://www.wikidata.org/wiki/Q6499736","display_name":"Vocabulary","level":2,"score":0.5257999897003174},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.5016999840736389},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.48080000281333923},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.46320000290870667},{"id":"https://openalex.org/C139807058","wikidata":"https://www.wikidata.org/wiki/Q352374","display_name":"Adaptation (eye)","level":2,"score":0.44449999928474426},{"id":"https://openalex.org/C77618280","wikidata":"https://www.wikidata.org/wiki/Q1155772","display_name":"Scheme (mathematics)","level":2,"score":0.37049999833106995},{"id":"https://openalex.org/C126706616","wikidata":"https://www.wikidata.org/wiki/Q2944660","display_name":"Lexical item","level":2,"score":0.3571000099182129},{"id":"https://openalex.org/C60048249","wikidata":"https://www.wikidata.org/wiki/Q37437","display_name":"Syntax","level":2,"score":0.3165000081062317},{"id":"https://openalex.org/C184337299","wikidata":"https://www.wikidata.org/wiki/Q1437428","display_name":"Semantics (computer science)","level":2,"score":0.3140999972820282},{"id":"https://openalex.org/C42058472","wikidata":"https://www.wikidata.org/wiki/Q810214","display_name":"Base (topology)","level":2,"score":0.30480000376701355},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.2971999943256378},{"id":"https://openalex.org/C90805587","wikidata":"https://www.wikidata.org/wiki/Q10944557","display_name":"Word (group theory)","level":2,"score":0.2727999985218048},{"id":"https://openalex.org/C117884012","wikidata":"https://www.wikidata.org/wiki/Q94489","display_name":"n-gram","level":3,"score":0.27230000495910645},{"id":"https://openalex.org/C122783720","wikidata":"https://www.wikidata.org/wiki/Q183065","display_name":"Interpreter","level":2,"score":0.2703000009059906},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.25850000977516174}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.13429","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.13429","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.13429","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.13429","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.8121169805526733,"display_name":"Quality Education","id":"https://metadata.un.org/sdg/4"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Tokenization":[0],"is":[1,54,100],"a":[2,68],"foundational":[3],"step":[4],"in":[5,31,60],"the":[6,39,58,95,132,141,156,159,172],"text":[7,134],"process":[8],"of":[9,43,140,144,158],"Large":[10],"Language":[11],"Models":[12],"(LLMs).":[13],"Texts":[14],"must":[15],"be":[16],"first":[17],"tokenized":[18],"into":[19],"token":[20,80,97,104],"IDs,":[21],"which":[22],"are":[23,88,108],"then":[24],"input":[25],"to":[26,72,154],"LLMs.":[27,44],"Inefficient":[28],"tokenization":[29],"results":[30,123],"long":[32],"token-ID":[33],"sequences":[34],"and":[35,41,85,94,117,137],"will":[36],"slow":[37],"down":[38],"training":[40],"inference":[42],"The":[45,83],"fine-grained":[46],"knowledge":[47],"transfer":[48],"between":[49,165],"LLMs,":[50],"like":[51],"token-level":[52,168],"distillation,":[53],"also":[55],"impeded":[56],"by":[57,77],"mismatch":[59],"vocabulary.":[61],"To":[62],"bridge":[63],"this":[64,111],"gap,":[65],"we":[66],"introduce":[67],"method":[69,130],"named":[70],"TokAlign++":[71],"improve":[73],"vocabulary":[74],"adaptation":[75],"performance":[76,157],"learning":[78],"better":[79],"alignment":[81,98],"lexicon.":[82],"source":[84],"target":[86],"vocabularies":[87,164],"taken":[89],"as":[90,149,151],"two":[91],"different":[92],"languages,":[93],"bilingual":[96,112],"lexicon":[99,113],"learned":[101],"from":[102],"monolingual":[103],"representations.":[105],"Model":[106],"parameters":[107],"rearranged":[109],"following":[110],"for":[114,120],"new":[115],"vocabulary,":[116],"progressively":[118],"fine-tuned":[119],"adaptation.":[121],"Experimental":[122],"on":[124],"15":[125],"languages":[126],"show":[127],"that":[128],"our":[129],"boosts":[131],"multilingual":[133,142],"compression":[135],"rates":[136],"preserves":[138],"most":[139],"ability":[143],"vanilla":[145,160,166],"models.":[146],"It":[147],"costs":[148],"few":[150],"1k":[152],"steps":[153],"restore":[155],"model.":[161],"After":[162],"unifying":[163],"models,":[167],"distillation":[169],"remarkably":[170],"improves":[171],"base":[173],"model":[174],"with":[175],"only":[176],"235M":[177],"tokens.":[178]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-05-15T00:00:00"}
