{"id":"https://openalex.org/W7154445653","doi":"https://doi.org/10.48550/arxiv.2604.12049","title":"Leveraging Weighted Syntactic and Semantic Context Assessment Summary (wSSAS) Towards Text Categorization Using LLMs","display_name":"Leveraging Weighted Syntactic and Semantic Context Assessment Summary (wSSAS) Towards Text Categorization Using LLMs","publication_year":2026,"publication_date":"2026-04-13","ids":{"openalex":"https://openalex.org/W7154445653","doi":"https://doi.org/10.48550/arxiv.2604.12049"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.12049","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.12049","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.12049","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5133653346","display_name":"Shreeya Verma Kathuria","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kathuria, Shreeya Verma","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5025620423","display_name":"Nitin Mayande","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Mayande, Nitin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5083805238","display_name":"Sharookh Daruwalla","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Daruwalla, Sharookh","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5133641487","display_name":"Nitin Joglekar","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Joglekar, Nitin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5133649582","display_name":"Charles Weber","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Weber, Charles","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11550","display_name":"Text and Document Classification Technologies","score":0.47909998893737793,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11550","display_name":"Text and Document Classification Technologies","score":0.47909998893737793,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.13120000064373016,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10664","display_name":"Sentiment Analysis and Opinion Mining","score":0.047200001776218414,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/categorization","display_name":"Categorization","score":0.7436000108718872},{"id":"https://openalex.org/keywords/context","display_name":"Context (archaeology)","score":0.4968999922275543},{"id":"https://openalex.org/keywords/cluster-analysis","display_name":"Cluster analysis","score":0.4575999975204468},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.39089998602867126},{"id":"https://openalex.org/keywords/entropy","display_name":"Entropy (arrow of time)","score":0.3682999908924103},{"id":"https://openalex.org/keywords/raw-data","display_name":"Raw data","score":0.33219999074935913},{"id":"https://openalex.org/keywords/sensitivity","display_name":"Sensitivity (control systems)","score":0.33180001378059387}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7983999848365784},{"id":"https://openalex.org/C94124525","wikidata":"https://www.wikidata.org/wiki/Q912550","display_name":"Categorization","level":2,"score":0.7436000108718872},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.5242000222206116},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5037999749183655},{"id":"https://openalex.org/C2779343474","wikidata":"https://www.wikidata.org/wiki/Q3109175","display_name":"Context (archaeology)","level":2,"score":0.4968999922275543},{"id":"https://openalex.org/C73555534","wikidata":"https://www.wikidata.org/wiki/Q622825","display_name":"Cluster analysis","level":2,"score":0.4575999975204468},{"id":"https://openalex.org/C23123220","wikidata":"https://www.wikidata.org/wiki/Q816826","display_name":"Information retrieval","level":1,"score":0.41290000081062317},{"id":"https://openalex.org/C124101348","wikidata":"https://www.wikidata.org/wiki/Q172491","display_name":"Data mining","level":1,"score":0.4018000066280365},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.39089998602867126},{"id":"https://openalex.org/C106301342","wikidata":"https://www.wikidata.org/wiki/Q4117933","display_name":"Entropy (arrow of time)","level":2,"score":0.3682999908924103},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.36309999227523804},{"id":"https://openalex.org/C132964779","wikidata":"https://www.wikidata.org/wiki/Q2110223","display_name":"Raw data","level":2,"score":0.33219999074935913},{"id":"https://openalex.org/C21200559","wikidata":"https://www.wikidata.org/wiki/Q7451068","display_name":"Sensitivity (control systems)","level":2,"score":0.33180001378059387},{"id":"https://openalex.org/C2522767166","wikidata":"https://www.wikidata.org/wiki/Q2374463","display_name":"Data science","level":1,"score":0.33090001344680786},{"id":"https://openalex.org/C9679016","wikidata":"https://www.wikidata.org/wiki/Q1417473","display_name":"Principle of maximum entropy","level":2,"score":0.32739999890327454},{"id":"https://openalex.org/C184337299","wikidata":"https://www.wikidata.org/wiki/Q1437428","display_name":"Semantics (computer science)","level":2,"score":0.3172999918460846},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.30000001192092896},{"id":"https://openalex.org/C2777946921","wikidata":"https://www.wikidata.org/wiki/Q7449044","display_name":"Semantic analysis (machine learning)","level":2,"score":0.2793999910354614},{"id":"https://openalex.org/C90805587","wikidata":"https://www.wikidata.org/wiki/Q10944557","display_name":"Word (group theory)","level":2,"score":0.2703000009059906},{"id":"https://openalex.org/C66402592","wikidata":"https://www.wikidata.org/wiki/Q2271421","display_name":"Sentiment analysis","level":2,"score":0.2644999921321869},{"id":"https://openalex.org/C92835128","wikidata":"https://www.wikidata.org/wiki/Q1277447","display_name":"Hierarchical clustering","level":3,"score":0.2637999951839447},{"id":"https://openalex.org/C130318100","wikidata":"https://www.wikidata.org/wiki/Q2268914","display_name":"Semantic similarity","level":2,"score":0.25}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.12049","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.12049","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.12049","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.12049","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"The":[0],"use":[1],"of":[2,22],"Large":[3],"Language":[4],"Models":[5],"(LLMs)":[6],"for":[7,179,190],"reliable,":[8],"enterprise-grade":[9],"analytics":[10],"such":[11],"as":[12],"text":[13,75,192],"categorization":[14,164,172],"is":[15],"often":[16],"hindered":[17],"by":[18],"the":[19,44,99,105,120],"stochastic":[20],"nature":[21],"attention":[23,101],"mechanisms":[24],"and":[25,34,47,84,126,151,163,174],"sensitivity":[26],"to":[27,57,93],"noise":[28,129],"that":[29,71,157,169],"compromise":[30],"their":[31],"analytical":[32],"precision":[33],"reproducibility.":[35],"To":[36],"address":[37],"these":[38],"technical":[39],"frictions,":[40],"this":[41,112],"paper":[42],"introduces":[43],"Weighted":[45],"Syntactic":[46],"Semantic":[48],"Context":[49],"Assessment":[50],"Summary":[51],"(wSSAS),":[52],"a":[53,67,77,89,116,176,186],"deterministic":[54,188],"framework":[55,70,121],"designed":[56],"enforce":[58],"data":[59,108,131],"integrity":[60,162],"on":[61,104,185],"large-scale,":[62],"chaotic":[63],"datasets.":[64],"We":[65],"propose":[66],"two-phased":[68],"validation":[69],"first":[72],"organizes":[73],"raw":[74],"into":[76,115],"hierarchical":[78],"classification":[79],"structure":[80],"containing":[81],"Themes,":[82],"Stories,":[83],"Clusters.":[85],"It":[86],"then":[87],"leverages":[88],"Signal-to-Noise":[90],"Ratio":[91],"(SNR)":[92],"prioritize":[94],"high-value":[95],"semantic":[96],"features,":[97],"ensuring":[98],"model's":[100],"remains":[102],"focused":[103],"most":[106],"representative":[107],"points.":[109],"By":[110],"incorporating":[111],"scoring":[113],"mechanism":[114],"Summary-of-Summaries":[117],"(SoS)":[118],"architecture,":[119],"effectively":[122],"isolates":[123],"essential":[124],"information":[125],"mitigates":[127],"background":[128],"during":[130],"aggregation.":[132],"Experimental":[133],"results":[134],"using":[135],"Gemini":[136],"2.0":[137],"Flash":[138],"Lite":[139],"across":[140],"diverse":[141],"datasets":[142],"-":[143,155],"including":[144],"Google":[145],"Business":[146],"reviews,":[147,150],"Amazon":[148],"Product":[149],"Goodreads":[152],"Book":[153],"reviews":[154],"demonstrate":[156],"wSSAS":[158,170],"significantly":[159],"improves":[160],"clustering":[161],"accuracy.":[165],"Our":[166],"findings":[167],"indicate":[168],"reduces":[171],"entropy":[173],"provides":[175],"reproducible":[177],"pathway":[178],"improving":[180],"LLM":[181],"based":[182,184],"summaries":[183],"high-precision,":[187],"process":[189],"large-scale":[191],"categorization.":[193]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-04-16T00:00:00"}
