{"id":"https://openalex.org/W7160642382","doi":"https://doi.org/10.48550/arxiv.2605.06052","title":"XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA","display_name":"XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA","publication_year":2026,"publication_date":"2026-05-07","ids":{"openalex":"https://openalex.org/W7160642382","doi":"https://doi.org/10.48550/arxiv.2605.06052"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.06052","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.06052","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.06052","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5135684939","display_name":"Feng Yu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yu, Feng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5028775026","display_name":"Hongshi Tan","orcid":"https://orcid.org/0000-0002-3243-6875"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tan, Hongshi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135691436","display_name":"Yao Chen","orcid":"https://orcid.org/0000-0002-1429-5247"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Yao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135717738","display_name":"Weng-Fai Wong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wong, Weng-Fai","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5135677324","display_name":"Bingsheng He","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"He, Bingsheng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10904","display_name":"Embedded Systems Design Techniques","score":0.5023000240325928,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10904","display_name":"Embedded Systems Design Techniques","score":0.5023000240325928,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.15800000727176666,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12326","display_name":"Network Packet Processing and Optimization","score":0.06689999997615814,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/operand","display_name":"Operand","score":0.6554999947547913},{"id":"https://openalex.org/keywords/speedup","display_name":"Speedup","score":0.5824999809265137},{"id":"https://openalex.org/keywords/field-programmable-gate-array","display_name":"Field-programmable gate array","score":0.5670999884605408},{"id":"https://openalex.org/keywords/latency","display_name":"Latency (audio)","score":0.5544999837875366},{"id":"https://openalex.org/keywords/digital-signal-processing","display_name":"Digital signal processing","score":0.45969998836517334},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.4189999997615814},{"id":"https://openalex.org/keywords/limiting","display_name":"Limiting","score":0.4147999882698059},{"id":"https://openalex.org/keywords/architecture","display_name":"Architecture","score":0.385699987411499},{"id":"https://openalex.org/keywords/quantization","display_name":"Quantization (signal processing)","score":0.37439998984336853}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.792900025844574},{"id":"https://openalex.org/C55526617","wikidata":"https://www.wikidata.org/wiki/Q719375","display_name":"Operand","level":2,"score":0.6554999947547913},{"id":"https://openalex.org/C68339613","wikidata":"https://www.wikidata.org/wiki/Q1549489","display_name":"Speedup","level":2,"score":0.5824999809265137},{"id":"https://openalex.org/C42935608","wikidata":"https://www.wikidata.org/wiki/Q190411","display_name":"Field-programmable gate array","level":2,"score":0.5670999884605408},{"id":"https://openalex.org/C82876162","wikidata":"https://www.wikidata.org/wiki/Q17096504","display_name":"Latency (audio)","level":2,"score":0.5544999837875366},{"id":"https://openalex.org/C84462506","wikidata":"https://www.wikidata.org/wiki/Q173142","display_name":"Digital signal processing","level":2,"score":0.45969998836517334},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.45320001244544983},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.4189999997615814},{"id":"https://openalex.org/C188198153","wikidata":"https://www.wikidata.org/wiki/Q1613840","display_name":"Limiting","level":2,"score":0.4147999882698059},{"id":"https://openalex.org/C123657996","wikidata":"https://www.wikidata.org/wiki/Q12271","display_name":"Architecture","level":2,"score":0.385699987411499},{"id":"https://openalex.org/C28855332","wikidata":"https://www.wikidata.org/wiki/Q198099","display_name":"Quantization (signal processing)","level":2,"score":0.37439998984336853},{"id":"https://openalex.org/C149635348","wikidata":"https://www.wikidata.org/wiki/Q193040","display_name":"Embedded system","level":1,"score":0.373199999332428},{"id":"https://openalex.org/C51332947","wikidata":"https://www.wikidata.org/wiki/Q1172305","display_name":"Shared resource","level":2,"score":0.3441999852657318},{"id":"https://openalex.org/C118524514","wikidata":"https://www.wikidata.org/wiki/Q173212","display_name":"Computer architecture","level":1,"score":0.32589998841285706},{"id":"https://openalex.org/C206729178","wikidata":"https://www.wikidata.org/wiki/Q2271896","display_name":"Scheduling (production processes)","level":2,"score":0.3257000148296356},{"id":"https://openalex.org/C9390403","wikidata":"https://www.wikidata.org/wiki/Q3966","display_name":"Computer hardware","level":1,"score":0.31209999322891235},{"id":"https://openalex.org/C97137487","wikidata":"https://www.wikidata.org/wiki/Q729138","display_name":"Integer (computer science)","level":2,"score":0.3111000061035156},{"id":"https://openalex.org/C2742236","wikidata":"https://www.wikidata.org/wiki/Q924713","display_name":"Efficient energy use","level":2,"score":0.304500013589859},{"id":"https://openalex.org/C2780165032","wikidata":"https://www.wikidata.org/wiki/Q16869822","display_name":"Energy consumption","level":2,"score":0.3025999963283539},{"id":"https://openalex.org/C157764524","wikidata":"https://www.wikidata.org/wiki/Q1383412","display_name":"Throughput","level":3,"score":0.2953000068664551},{"id":"https://openalex.org/C58013763","wikidata":"https://www.wikidata.org/wiki/Q5754574","display_name":"High-level synthesis","level":3,"score":0.28360000252723694},{"id":"https://openalex.org/C138101251","wikidata":"https://www.wikidata.org/wiki/Q213092","display_name":"Thread (computing)","level":2,"score":0.2833000123500824},{"id":"https://openalex.org/C120314980","wikidata":"https://www.wikidata.org/wiki/Q180634","display_name":"Distributed computing","level":1,"score":0.2759999930858612},{"id":"https://openalex.org/C156972235","wikidata":"https://www.wikidata.org/wiki/Q1443434","display_name":"Instructions per cycle","level":3,"score":0.27379998564720154},{"id":"https://openalex.org/C178693496","wikidata":"https://www.wikidata.org/wiki/Q911691","display_name":"Clock rate","level":3,"score":0.2709999978542328},{"id":"https://openalex.org/C206345919","wikidata":"https://www.wikidata.org/wiki/Q20380951","display_name":"Resource (disambiguation)","level":2,"score":0.27079999446868896},{"id":"https://openalex.org/C86111242","wikidata":"https://www.wikidata.org/wiki/Q859595","display_name":"Coprocessor","level":2,"score":0.2667999863624573},{"id":"https://openalex.org/C78766204","wikidata":"https://www.wikidata.org/wiki/Q555032","display_name":"Multi-core processor","level":2,"score":0.2660999894142151},{"id":"https://openalex.org/C28420585","wikidata":"https://www.wikidata.org/wiki/Q2665075","display_name":"Timing attack","level":4,"score":0.2621999979019165},{"id":"https://openalex.org/C46637626","wikidata":"https://www.wikidata.org/wiki/Q6693015","display_name":"Low latency (capital markets)","level":2,"score":0.26179999113082886},{"id":"https://openalex.org/C61483411","wikidata":"https://www.wikidata.org/wiki/Q3124522","display_name":"Data parallelism","level":3,"score":0.2563999891281128},{"id":"https://openalex.org/C74193536","wikidata":"https://www.wikidata.org/wiki/Q574844","display_name":"Kernel (algebra)","level":2,"score":0.2524000108242035}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.06052","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.06052","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.06052","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.06052","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"The":[0,167],"widespread":[1],"adoption":[2],"of":[3,61,124,169],"mixed-precision":[4,53,84,164],"quantization":[5],"in":[6,40],"large":[7],"language":[8],"models":[9],"(LLMs)":[10],"has":[11],"created":[12],"demand":[13],"for":[14,52],"hardware":[15],"that":[16,79],"can":[17],"efficiently":[18],"perform":[19],"multiply-accumulate":[20],"(MAC)":[21],"operations":[22,85],"across":[23,126],"mixed":[24],"datatypes":[25,28],"and":[26,49,67,83,106,113,121,146,151,159],"switch":[27],"at":[29,173],"runtime.":[30],"Existing":[31],"FPGA-based":[32],"MAC":[33,77,95],"solutions":[34],"fall":[35],"short":[36],"due":[37],"to":[38,59,154],"limitations":[39,56],"fixed-datatype":[41],"design,":[42],"inefficient":[43],"spatial":[44],"or":[45],"temporal":[46],"resource":[47,116],"sharing,":[48],"poor":[50],"support":[51],"execution.":[54],"These":[55],"collectively":[57],"lead":[58],"under-utilization":[60],"DSP":[62,115,147],"resources,":[63],"limiting":[64],"achievable":[65],"parallelism":[66],"throughput.":[68],"In":[69],"this":[70],"work,":[71],"we":[72],"present":[73],"XtraMAC,":[74],"a":[75,87,98],"novel":[76],"architecture":[78],"unifies":[80],"integer,":[81],"floating-point,":[82],"within":[86],"single,":[88],"datatype-adaptive":[89],"microarchitecture.":[90],"XtraMAC":[91,136,170],"decomposes":[92],"all":[93,127],"supported":[94],"formats":[96],"into":[97],"shared":[99],"integer":[100],"mantissa":[101],"product":[102],"with":[103,118],"lightweight":[104],"sign":[105],"exponent":[107],"handling,":[108],"enabling":[109],"dynamic":[110],"operand":[111],"packing":[112],"efficient":[114],"sharing":[117],"constant":[119],"latency":[120],"initiation":[122],"interval":[123],"one":[125],"datatypes.":[128],"Evaluated":[129],"on":[130,162],"an":[131],"AMD":[132],"Xilinx":[133],"U55c":[134],"FPGA,":[135],"achieves":[137],"1.4-2.0x":[138],"higher":[139],"compute":[140],"density,":[141],"reduces":[142],"per-operation":[143],"LUT,":[144],"FF,":[145],"consumption":[148],"by":[149],"27-51%,":[150],"delivers":[152],"up":[153],"1.9x":[155],"greater":[156],"energy":[157],"efficiency":[158],"1.2x":[160],"speedup":[161],"representative":[163],"LLM":[165],"workloads.":[166],"implementation":[168],"is":[171],"open-sourced":[172],"https://github.com/Xtra-Computing/XtraMAC.":[174]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-05-09T00:00:00"}
