{"id":"https://openalex.org/W7135053277","doi":"https://doi.org/10.48550/arxiv.2603.10619","title":"Disentangling Similarity and Relatedness in Topic Models","display_name":"Disentangling Similarity and Relatedness in Topic Models","publication_year":2026,"publication_date":"2026-03-11","ids":{"openalex":"https://openalex.org/W7135053277","doi":"https://doi.org/10.48550/arxiv.2603.10619"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.10619","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.10619","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.10619","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5128913463","display_name":"Hanlin Xiao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xiao, Hanlin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Wang, Yang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Yang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128915174","display_name":"Mauricio A. \u00c1lvarez","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"\u00c1lvarez, Mauricio A.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":null,"display_name":"Breitling, Rainer","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Breitling, Rainer","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T13910","display_name":"Computational and Text Analysis Methods","score":0.34610000252723694,"subfield":{"id":"https://openalex.org/subfields/3300","display_name":"General Social Sciences"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},"topics":[{"id":"https://openalex.org/T13910","display_name":"Computational and Text Analysis Methods","score":0.34610000252723694,"subfield":{"id":"https://openalex.org/subfields/3300","display_name":"General Social Sciences"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.3127000033855438,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10664","display_name":"Sentiment Analysis and Opinion Mining","score":0.057999998331069946,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/topic-model","display_name":"Topic model","score":0.7527999877929688},{"id":"https://openalex.org/keywords/latent-dirichlet-allocation","display_name":"Latent Dirichlet allocation","score":0.7253999710083008},{"id":"https://openalex.org/keywords/similarity","display_name":"Similarity (geometry)","score":0.65420001745224},{"id":"https://openalex.org/keywords/semantic-similarity","display_name":"Semantic similarity","score":0.5525000095367432},{"id":"https://openalex.org/keywords/word","display_name":"Word (group theory)","score":0.5504999756813049},{"id":"https://openalex.org/keywords/cluster-analysis","display_name":"Cluster analysis","score":0.5450000166893005},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.4986000061035156},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.4237000048160553},{"id":"https://openalex.org/keywords/pipeline","display_name":"Pipeline (software)","score":0.4219000041484833},{"id":"https://openalex.org/keywords/construct","display_name":"Construct (python library)","score":0.37279999256134033}],"concepts":[{"id":"https://openalex.org/C171686336","wikidata":"https://www.wikidata.org/wiki/Q3532085","display_name":"Topic model","level":2,"score":0.7527999877929688},{"id":"https://openalex.org/C500882744","wikidata":"https://www.wikidata.org/wiki/Q269236","display_name":"Latent Dirichlet allocation","level":3,"score":0.7253999710083008},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7156999707221985},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.6747999787330627},{"id":"https://openalex.org/C103278499","wikidata":"https://www.wikidata.org/wiki/Q254465","display_name":"Similarity (geometry)","level":3,"score":0.65420001745224},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6431999802589417},{"id":"https://openalex.org/C130318100","wikidata":"https://www.wikidata.org/wiki/Q2268914","display_name":"Semantic similarity","level":2,"score":0.5525000095367432},{"id":"https://openalex.org/C90805587","wikidata":"https://www.wikidata.org/wiki/Q10944557","display_name":"Word (group theory)","level":2,"score":0.5504999756813049},{"id":"https://openalex.org/C73555534","wikidata":"https://www.wikidata.org/wiki/Q622825","display_name":"Cluster analysis","level":2,"score":0.5450000166893005},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.4986000061035156},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.4237000048160553},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.4219000041484833},{"id":"https://openalex.org/C2780801425","wikidata":"https://www.wikidata.org/wiki/Q5164392","display_name":"Construct (python library)","level":2,"score":0.37279999256134033},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.36629998683929443},{"id":"https://openalex.org/C2777462759","wikidata":"https://www.wikidata.org/wiki/Q18395344","display_name":"Word embedding","level":3,"score":0.36309999227523804},{"id":"https://openalex.org/C28076734","wikidata":"https://www.wikidata.org/wiki/Q63087","display_name":"Coreference","level":3,"score":0.3352000117301941},{"id":"https://openalex.org/C170133592","wikidata":"https://www.wikidata.org/wiki/Q1806883","display_name":"Latent semantic analysis","level":2,"score":0.334199994802475},{"id":"https://openalex.org/C155092808","wikidata":"https://www.wikidata.org/wiki/Q182557","display_name":"Computational linguistics","level":2,"score":0.328000009059906},{"id":"https://openalex.org/C114289077","wikidata":"https://www.wikidata.org/wiki/Q3284399","display_name":"Statistical model","level":2,"score":0.32190001010894775},{"id":"https://openalex.org/C2780719617","wikidata":"https://www.wikidata.org/wiki/Q1030752","display_name":"Salient","level":2,"score":0.3125999867916107},{"id":"https://openalex.org/C184337299","wikidata":"https://www.wikidata.org/wiki/Q1437428","display_name":"Semantics (computer science)","level":2,"score":0.3012000024318695},{"id":"https://openalex.org/C2778109090","wikidata":"https://www.wikidata.org/wiki/Q7781195","display_name":"Thematic structure","level":2,"score":0.299699991941452},{"id":"https://openalex.org/C169214877","wikidata":"https://www.wikidata.org/wiki/Q981016","display_name":"Dirichlet distribution","level":3,"score":0.29589998722076416},{"id":"https://openalex.org/C112933361","wikidata":"https://www.wikidata.org/wiki/Q2845258","display_name":"Probabilistic latent semantic analysis","level":2,"score":0.29420000314712524},{"id":"https://openalex.org/C2776321320","wikidata":"https://www.wikidata.org/wiki/Q857525","display_name":"Annotation","level":2,"score":0.2921000123023987},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.2904999852180481},{"id":"https://openalex.org/C93692415","wikidata":"https://www.wikidata.org/wiki/Q1502030","display_name":"Thematic map","level":2,"score":0.2858000099658966},{"id":"https://openalex.org/C2777601683","wikidata":"https://www.wikidata.org/wiki/Q6499736","display_name":"Vocabulary","level":2,"score":0.27160000801086426},{"id":"https://openalex.org/C2779135771","wikidata":"https://www.wikidata.org/wiki/Q403574","display_name":"Named-entity recognition","level":3,"score":0.26089999079704285},{"id":"https://openalex.org/C2780366209","wikidata":"https://www.wikidata.org/wiki/Q5170200","display_name":"Core model","level":2,"score":0.25929999351501465},{"id":"https://openalex.org/C23123220","wikidata":"https://www.wikidata.org/wiki/Q816826","display_name":"Information retrieval","level":1,"score":0.25609999895095825},{"id":"https://openalex.org/C2776461190","wikidata":"https://www.wikidata.org/wiki/Q22673982","display_name":"Word2vec","level":3,"score":0.2558000087738037},{"id":"https://openalex.org/C207390915","wikidata":"https://www.wikidata.org/wiki/Q1230525","display_name":"Divergence (linguistics)","level":2,"score":0.25189998745918274}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.10619","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.10619","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.10619","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.10619","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.7243236303329468,"display_name":"Quality Education","id":"https://metadata.un.org/sdg/4"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"The":[0,106],"recent":[1],"success":[2],"of":[3,40,73],"large":[4,70],"pre-trained":[5],"language":[6],"models":[7,19,24],"(PLMs)":[8],"has":[9],"motivated":[10],"their":[11],"integration":[12],"into":[13],"topic":[14,18,65,165],"modeling.":[15],"However,":[16],"PLM-augmented":[17],"differ":[20],"from":[21,118,126],"classical":[22],"co-occurrence":[23],"such":[25],"as":[26],"Latent":[27],"Dirichlet":[28],"Allocation":[29],"(LDA)":[30],"not":[31],"only":[32],"in":[33,37],"performance,":[34],"but":[35],"also":[36],"the":[38,92,102,127,141,160],"type":[39],"semantic":[41,143,161],"structure":[42,162],"they":[43],"capture.":[44],"We":[45],"formalize":[46],"this":[47],"distinction":[48],"along":[49],"two":[50,107],"psycholinguistic":[51],"axes:":[52],"thematic":[53],"relatedness":[54,124],"(dog/bone)":[55],"and":[56,79,89,129],"taxonomic":[57],"similarity":[58,116],"(dog/wolf).":[59],"To":[60],"measure":[61],"both":[62,151],"axes":[63],"over":[64],"words,":[66],"we":[67],"construct":[68],"a":[69,81,154],"synthetic":[71],"benchmark":[72],"word":[74],"pairs":[75],"using":[76],"LLM-based":[77],"annotation":[78],"train":[80],"neural":[82],"scorer":[83,93],"on":[84,132,137],"it.":[85],"Across":[86],"multiple":[87],"corpora":[88],"model":[90],"families,":[91],"places":[94],"different":[95],"topic-model":[96],"families":[97],"at":[98],"distinct":[99],"positions":[100],"within":[101],"joint":[103],"similarity-relatedness":[104],"space.":[105],"scores":[108],"further":[109],"predict":[110],"downstream":[111],"task":[112],"performance:":[113],"tasks":[114,122,138],"requiring":[115,123],"benefit":[117,125],"similarity-rich":[119],"topics,":[120],"whereas":[121],"converse,":[128],"excessive":[130],"emphasis":[131],"either":[133],"axis":[134,146],"degrades":[135],"performance":[136],"aligned":[139],"with":[140],"opposing":[142],"structure.":[144],"Neither":[145],"is":[147],"uniformly":[148],"beneficial.":[149],"Measuring":[150],"therefore":[152],"provides":[153],"practical,":[155],"model-agnostic":[156],"diagnostic":[157],"for":[158],"evaluating":[159],"captured":[163],"by":[164],"models.":[166]},"counts_by_year":[],"updated_date":"2026-07-21T08:15:58.654021","created_date":"2026-03-13T00:00:00"}
