{"id":"https://openalex.org/W7160827235","doi":"https://doi.org/10.48550/arxiv.2605.07245","title":"TransDot: An Area-efficient Reconfigurable Floating-Point Unit for Trans-Precision Dot-Product Accumulation for FPGA AI Engines","display_name":"TransDot: An Area-efficient Reconfigurable Floating-Point Unit for Trans-Precision Dot-Product Accumulation for FPGA AI Engines","publication_year":2026,"publication_date":"2026-05-08","ids":{"openalex":"https://openalex.org/W7160827235","doi":"https://doi.org/10.48550/arxiv.2605.07245"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.07245","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.07245","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.07245","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5135877542","display_name":"Jiayi Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Jiayi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5026647054","display_name":"Maohua Nie","orcid":"https://orcid.org/0000-0003-3515-7764"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Nie, Maohua","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5101375769","display_name":"Sin-Chen Lin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lin, Sin-Chen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135869740","display_name":"C. -J. Richard Shi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shi, C. -J. Richard","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5135888373","display_name":"Ang Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Ang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11697","display_name":"Numerical Methods and Algorithms","score":0.961899995803833,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11697","display_name":"Numerical Methods and Algorithms","score":0.961899995803833,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10904","display_name":"Embedded Systems Design Techniques","score":0.007199999876320362,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11034","display_name":"Digital Filter Design and Implementation","score":0.00430000014603138,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/scalability","display_name":"Scalability","score":0.729200005531311},{"id":"https://openalex.org/keywords/pipeline","display_name":"Pipeline (software)","score":0.6650000214576721},{"id":"https://openalex.org/keywords/simd","display_name":"SIMD","score":0.6395999789237976},{"id":"https://openalex.org/keywords/field-programmable-gate-array","display_name":"Field-programmable gate array","score":0.6373000144958496},{"id":"https://openalex.org/keywords/throughput","display_name":"Throughput","score":0.597100019454956},{"id":"https://openalex.org/keywords/reduction","display_name":"Reduction (mathematics)","score":0.45179998874664307},{"id":"https://openalex.org/keywords/bandwidth","display_name":"Bandwidth (computing)","score":0.4253999888896942},{"id":"https://openalex.org/keywords/exploit","display_name":"Exploit","score":0.4088999927043915}],"concepts":[{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.729200005531311},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7275000214576721},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.6650000214576721},{"id":"https://openalex.org/C150552126","wikidata":"https://www.wikidata.org/wiki/Q339387","display_name":"SIMD","level":2,"score":0.6395999789237976},{"id":"https://openalex.org/C42935608","wikidata":"https://www.wikidata.org/wiki/Q190411","display_name":"Field-programmable gate array","level":2,"score":0.6373000144958496},{"id":"https://openalex.org/C157764524","wikidata":"https://www.wikidata.org/wiki/Q1383412","display_name":"Throughput","level":3,"score":0.597100019454956},{"id":"https://openalex.org/C149635348","wikidata":"https://www.wikidata.org/wiki/Q193040","display_name":"Embedded system","level":1,"score":0.5213000178337097},{"id":"https://openalex.org/C9390403","wikidata":"https://www.wikidata.org/wiki/Q3966","display_name":"Computer hardware","level":1,"score":0.4537000060081482},{"id":"https://openalex.org/C111335779","wikidata":"https://www.wikidata.org/wiki/Q3454686","display_name":"Reduction (mathematics)","level":2,"score":0.45179998874664307},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.4433000087738037},{"id":"https://openalex.org/C2776257435","wikidata":"https://www.wikidata.org/wiki/Q1576430","display_name":"Bandwidth (computing)","level":2,"score":0.4253999888896942},{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.4088999927043915},{"id":"https://openalex.org/C118524514","wikidata":"https://www.wikidata.org/wiki/Q173212","display_name":"Computer architecture","level":1,"score":0.38609999418258667},{"id":"https://openalex.org/C142962650","wikidata":"https://www.wikidata.org/wiki/Q240838","display_name":"Reconfigurable computing","level":3,"score":0.37070000171661377},{"id":"https://openalex.org/C188198153","wikidata":"https://www.wikidata.org/wiki/Q1613840","display_name":"Limiting","level":2,"score":0.357699990272522},{"id":"https://openalex.org/C77390884","wikidata":"https://www.wikidata.org/wiki/Q217302","display_name":"Application-specific integrated circuit","level":2,"score":0.34040001034736633},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.3343000113964081},{"id":"https://openalex.org/C105339364","wikidata":"https://www.wikidata.org/wiki/Q2297740","display_name":"Software deployment","level":2,"score":0.3264999985694885},{"id":"https://openalex.org/C175309249","wikidata":"https://www.wikidata.org/wiki/Q725864","display_name":"Pipeline transport","level":2,"score":0.32260000705718994},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.2809999883174896},{"id":"https://openalex.org/C165005293","wikidata":"https://www.wikidata.org/wiki/Q1074500","display_name":"Chip","level":2,"score":0.2809000015258789},{"id":"https://openalex.org/C48677424","wikidata":"https://www.wikidata.org/wiki/Q6888088","display_name":"Mode (computer interface)","level":2,"score":0.27090001106262207}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.07245","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.07245","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.07245","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.07245","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Commercial":[0],"FPGAs,":[1],"such":[2,88],"as":[3,89],"AMD":[4,227],"Versal":[5,228],"devices,":[6],"increasingly":[7],"incorporate":[8],"AI":[9,229],"engines":[10],"that":[11,128,163,218],"exploit":[12],"low-precision":[13,100],"packed-SIMD":[14],"fused":[15],"multiply-accumulate":[16],"(FMA)":[17],"to":[18,35,71,211],"achieve":[19],"proportional":[20],"throughput":[21,173],"gains.":[22],"However,":[23],"trans-precision":[24,134],"FMA":[25,98,105,132],"(e.g.,":[26,58],"multiplying":[27],"two":[28,63],"FP16":[29,184],"numbers":[30],"and":[31,67,81,95,114,133,151,170,179,186,202],"adding":[32,68],"their":[33],"result":[34,70],"an":[36,72,203],"FP32":[37,73,157,177],"accumulator),":[38],"which":[39,107],"preserves":[40],"numerical":[41],"stability":[42],"by":[43,50,102],"accumulating":[44],"in":[45,183,190,207,225],"higher":[46],"precision,":[47],"remains":[48],"bottlenecked":[49],"the":[51,78,116,143,194,212],"highest-precision,":[52],"lowest-throughput":[53],"operation.":[54],"Dot-product":[55],"accumulation":[56,155],"(DPA)":[57],"performing":[59],"a":[60,125,137],"dot-product":[61,154,208],"on":[62,99,200],"4-element":[64],"FP8":[65,191],"vectors":[66],"its":[69],"accumulator)":[74],"can":[75],"fully":[76],"utilize":[77],"input/output":[79],"bandwidth":[80],"computational":[82],"resources.":[83],"Existing":[84],"flexible":[85],"open-source":[86],"FPUs,":[87],"FPnew,":[90],"do":[91],"not":[92],"support":[93],"DPA":[94,119,135,175,185],"implement":[96],"SIMD":[97,131],"formats":[101],"replicating":[103],"independent":[104],"lanes,":[106],"increases":[108],"area,":[109],"underutilizes":[110],"shared":[111],"arithmetic":[112],"resources,":[113],"complicates":[115],"integration":[117],"of":[118,196],"operations.":[120],"This":[121],"paper":[122],"presents":[123],"TransDot,":[124],"reconfigurable":[126,139,159],"FPU":[127],"unifies":[129],"multi-precision":[130],"within":[136],"shared,":[138],"datapath.":[140],"TransDot":[141,164],"extends":[142],"baseline":[144],"design":[145,221],"with":[146,176],"2-term":[147],"FP16,":[148,167],"4-term":[149],"FP8,":[150,169],"8-term":[152],"FP4":[153,172],"into":[156],"using":[158],"subcomponents.":[160],"Evaluation":[161],"shows":[162],"delivers":[165],"2$\\times$":[166],"4$\\times$":[168],"8$\\times$":[171],"via":[174],"accumulation,":[178],"1.46$\\times$":[180],"area":[181,188,199],"efficiency":[182,189],"2.92$\\times$":[187],"DPA,":[192],"at":[193],"cost":[195],"37.3%":[197],"larger":[198],"average":[201],"additional":[204],"pipeline":[205],"stage":[206],"mode":[209],"compared":[210],"FPnew":[213],"baseline.":[214],"These":[215],"results":[216],"demonstrate":[217],"TransDot's":[219],"area-efficient":[220],"enables":[222],"scalable":[223],"deployment":[224],"next-generation":[226],"engines.":[230]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-05-12T00:00:00"}
