{"id":"https://openalex.org/W4408151434","doi":"https://doi.org/10.1145/3658617.3697668","title":"Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores","display_name":"Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores","publication_year":2025,"publication_date":"2025-01-20","ids":{"openalex":"https://openalex.org/W4408151434","doi":"https://doi.org/10.1145/3658617.3697668"},"language":"en","primary_location":{"id":"doi:10.1145/3658617.3697668","is_oa":false,"landing_page_url":"https://doi.org/10.1145/3658617.3697668","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 30th Asia and South Pacific Design Automation Conference","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5026653305","display_name":"Shaobo Ma","orcid":null},"institutions":[{"id":"https://openalex.org/I881766915","display_name":"Nanjing University","ror":"https://ror.org/01rxvg760","country_code":"CN","type":"education","lineage":["https://openalex.org/I881766915"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Shaobo Ma","raw_affiliation_strings":["Nanjing Univ., Nanjing, China"],"raw_orcid":"https://orcid.org/0009-0001-6173-3983","affiliations":[{"raw_affiliation_string":"Nanjing Univ., Nanjing, China","institution_ids":["https://openalex.org/I881766915"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5066888122","display_name":"Chao Fang","orcid":"https://orcid.org/0000-0003-3430-1189"},"institutions":[{"id":"https://openalex.org/I881766915","display_name":"Nanjing University","ror":"https://ror.org/01rxvg760","country_code":"CN","type":"education","lineage":["https://openalex.org/I881766915"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Chao Fang","raw_affiliation_strings":["Nanjing Univ., Nanjing, China"],"raw_orcid":"https://orcid.org/0000-0003-3430-1189","affiliations":[{"raw_affiliation_string":"Nanjing Univ., Nanjing, China","institution_ids":["https://openalex.org/I881766915"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5090170161","display_name":"Haikuo Shao","orcid":"https://orcid.org/0009-0008-6965-3436"},"institutions":[{"id":"https://openalex.org/I881766915","display_name":"Nanjing University","ror":"https://ror.org/01rxvg760","country_code":"CN","type":"education","lineage":["https://openalex.org/I881766915"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Haikuo Shao","raw_affiliation_strings":["Nanjing Univ., Nanjing, China"],"raw_orcid":"https://orcid.org/0009-0008-6965-3436","affiliations":[{"raw_affiliation_string":"Nanjing Univ., Nanjing, China","institution_ids":["https://openalex.org/I881766915"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5100696999","display_name":"Zhongfeng Wang","orcid":"https://orcid.org/0000-0002-7227-4786"},"institutions":[{"id":"https://openalex.org/I881766915","display_name":"Nanjing University","ror":"https://ror.org/01rxvg760","country_code":"CN","type":"education","lineage":["https://openalex.org/I881766915"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Zhongfeng Wang","raw_affiliation_strings":["Nanjing Univ., Nanjing, China"],"raw_orcid":"https://orcid.org/0000-0002-7227-4786","affiliations":[{"raw_affiliation_string":"Nanjing Univ., Nanjing, China","institution_ids":["https://openalex.org/I881766915"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I881766915"],"apc_list":null,"apc_paid":null,"fwci":4.5452,"has_fulltext":false,"cited_by_count":3,"citation_normalized_percentile":{"value":0.93422099,"is_in_top_1_percent":false,"is_in_top_10_percent":true},"cited_by_percentile_year":{"min":94,"max":97},"biblio":{"volume":null,"issue":null,"first_page":"1181","last_page":"1187"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.9941999912261963,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.9941999912261963,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12303","display_name":"Tensor decomposition and applications","score":0.9829999804496765,"subfield":{"id":"https://openalex.org/subfields/2605","display_name":"Computational Mathematics"},"field":{"id":"https://openalex.org/fields/26","display_name":"Mathematics"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.9807000160217285,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/acceleration","display_name":"Acceleration","score":0.7823091149330139},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7475394606590271},{"id":"https://openalex.org/keywords/parallel-computing","display_name":"Parallel computing","score":0.6258963942527771},{"id":"https://openalex.org/keywords/tensor","display_name":"Tensor (intrinsic definition)","score":0.5550197958946228},{"id":"https://openalex.org/keywords/computational-science","display_name":"Computational science","score":0.5293394327163696},{"id":"https://openalex.org/keywords/cuda","display_name":"CUDA","score":0.47980812191963196},{"id":"https://openalex.org/keywords/general-purpose-computing-on-graphics-processing-units","display_name":"General-purpose computing on graphics processing units","score":0.46085044741630554},{"id":"https://openalex.org/keywords/graphics-processing-unit","display_name":"Graphics processing unit","score":0.4242829382419586},{"id":"https://openalex.org/keywords/computer-graphics","display_name":"Computer graphics (images)","score":0.3364664614200592},{"id":"https://openalex.org/keywords/graphics","display_name":"Graphics","score":0.20378410816192627},{"id":"https://openalex.org/keywords/physics","display_name":"Physics","score":0.1529948115348816},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.12176141142845154},{"id":"https://openalex.org/keywords/geometry","display_name":"Geometry","score":0.10105851292610168}],"concepts":[{"id":"https://openalex.org/C117896860","wikidata":"https://www.wikidata.org/wiki/Q11376","display_name":"Acceleration","level":2,"score":0.7823091149330139},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7475394606590271},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.6258963942527771},{"id":"https://openalex.org/C155281189","wikidata":"https://www.wikidata.org/wiki/Q3518150","display_name":"Tensor (intrinsic definition)","level":2,"score":0.5550197958946228},{"id":"https://openalex.org/C459310","wikidata":"https://www.wikidata.org/wiki/Q117801","display_name":"Computational science","level":1,"score":0.5293394327163696},{"id":"https://openalex.org/C2778119891","wikidata":"https://www.wikidata.org/wiki/Q477690","display_name":"CUDA","level":2,"score":0.47980812191963196},{"id":"https://openalex.org/C50630238","wikidata":"https://www.wikidata.org/wiki/Q971505","display_name":"General-purpose computing on graphics processing units","level":3,"score":0.46085044741630554},{"id":"https://openalex.org/C2779851693","wikidata":"https://www.wikidata.org/wiki/Q183484","display_name":"Graphics processing unit","level":2,"score":0.4242829382419586},{"id":"https://openalex.org/C121684516","wikidata":"https://www.wikidata.org/wiki/Q7600677","display_name":"Computer graphics (images)","level":1,"score":0.3364664614200592},{"id":"https://openalex.org/C21442007","wikidata":"https://www.wikidata.org/wiki/Q1027879","display_name":"Graphics","level":2,"score":0.20378410816192627},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.1529948115348816},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.12176141142845154},{"id":"https://openalex.org/C2524010","wikidata":"https://www.wikidata.org/wiki/Q8087","display_name":"Geometry","level":1,"score":0.10105851292610168},{"id":"https://openalex.org/C74650414","wikidata":"https://www.wikidata.org/wiki/Q11397","display_name":"Classical mechanics","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1145/3658617.3697668","is_oa":false,"landing_page_url":"https://doi.org/10.1145/3658617.3697668","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 30th Asia and South Pacific Design Automation Conference","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":15,"referenced_works":["https://openalex.org/W2163687928","https://openalex.org/W2163932369","https://openalex.org/W2734941459","https://openalex.org/W2883920103","https://openalex.org/W2884150179","https://openalex.org/W2982479999","https://openalex.org/W2984035546","https://openalex.org/W3040035712","https://openalex.org/W3047345547","https://openalex.org/W3117765988","https://openalex.org/W3205226039","https://openalex.org/W4308090436","https://openalex.org/W4319917399","https://openalex.org/W4388116617","https://openalex.org/W4406650295"],"related_works":["https://openalex.org/W1963859303","https://openalex.org/W2364044215","https://openalex.org/W2389600408","https://openalex.org/W240129890","https://openalex.org/W3048701459","https://openalex.org/W2149078538","https://openalex.org/W2370314112","https://openalex.org/W1912958759","https://openalex.org/W1656096860","https://openalex.org/W1984739956"],"abstract_inverted_index":{"Large":[0],"language":[1],"models":[2],"(LLMs)":[3],"have":[4],"been":[5],"widely":[6],"applied":[7],"but":[8],"face":[9],"challenges":[10],"in":[11,158],"efficient":[12,111],"inference.":[13],"While":[14],"quantization":[15,22],"methods":[16],"reduce":[17],"computational":[18],"demands,":[19],"ultra-low":[20],"bit":[21,96],"with":[23,153],"arbitrary":[24,53,84],"precision":[25,54,85,100],"is":[26],"hindered":[27],"by":[28],"limited":[29],"GPU":[30,103],"Tensor":[31,104],"Core":[32,105],"support":[33],"and":[34,70,91,142,185],"inefficient":[35],"memory":[36,128,144],"management,":[37],"leading":[38],"to":[39,155,162,172],"suboptimal":[40],"acceleration.":[41,175],"To":[42],"address":[43],"these":[44],"challenges,":[45],"we":[46,59,81,108,123,169],"propose":[47],"a":[48,61,125],"comprehensive":[49],"acceleration":[50],"scheme":[51,88],"for":[52,119],"LLMs.":[55,190],"At":[56],"its":[57],"core,":[58],"introduce":[60],"novel":[62],"bipolar-INT":[63],"data":[64,76,117,126],"format":[65],"that":[66,89,115,131],"facilitates":[67],"parallel":[68],"computing":[69],"supports":[71],"symmetric":[72],"quantization,":[73],"effectively":[74],"reducing":[75],"redundancy.":[77],"Building":[78],"on":[79],"this,":[80],"implement":[82],"an":[83,110],"matrix":[86,112,159],"multiplication":[87,160],"decomposes":[90],"recovers":[92],"matrices":[93],"at":[94],"the":[95],"level,":[97],"enabling":[98,183],"flexible":[99],"while":[101],"maximizing":[102],"utilization.":[106],"Furthermore,":[107],"develop":[109],"preprocessing":[113],"method":[114],"optimizes":[116],"layout":[118],"subsequent":[120],"computations.":[121],"Finally,":[122],"design":[124],"recovery-oriented":[127],"management":[129],"system":[130],"strategically":[132],"utilizes":[133],"fast":[134],"shared":[135],"memory,":[136],"significantly":[137,178],"enhancing":[138],"kernel":[139],"execution":[140],"speed":[141],"minimizing":[143],"access":[145],"latency.":[146],"Experimental":[147],"results":[148],"demonstrate":[149],"our":[150],"approach's":[151],"effectiveness,":[152],"up":[154,171],"2.4\u00d7":[156],"speedup":[157],"compared":[161],"NVIDIA's":[163],"CUTLASS.":[164],"When":[165],"integrated":[166],"into":[167],"LLMs,":[168],"achieve":[170],"6.7\u00d7":[173],"inference":[174,181],"These":[176],"improvements":[177],"enhance":[179],"LLM":[180],"efficiency,":[182],"broader":[184],"more":[186],"responsive":[187],"applications":[188],"of":[189]},"counts_by_year":[{"year":2026,"cited_by_count":1},{"year":2025,"cited_by_count":2}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
