{"id":"https://openalex.org/W4415256943","doi":"https://doi.org/10.1109/les.2025.3601057","title":"Fused Tensor Core: A Hardware\u2013Software Co-Design for Efficient Execution of Attentions on GPUs","display_name":"Fused Tensor Core: A Hardware\u2013Software Co-Design for Efficient Execution of Attentions on GPUs","publication_year":2025,"publication_date":"2025-10-01","ids":{"openalex":"https://openalex.org/W4415256943","doi":"https://doi.org/10.1109/les.2025.3601057"},"language":null,"primary_location":{"id":"doi:10.1109/les.2025.3601057","is_oa":false,"landing_page_url":"https://doi.org/10.1109/les.2025.3601057","pdf_url":null,"source":{"id":"https://openalex.org/S22443479","display_name":"IEEE Embedded Systems Letters","issn_l":"1943-0663","issn":["1943-0663","1943-0671"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319808","host_organization_name":"Institute of Electrical and Electronics Engineers","host_organization_lineage":["https://openalex.org/P4310319808"],"host_organization_lineage_names":["Institute of Electrical and Electronics Engineers"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Embedded Systems Letters","raw_type":"journal-article"},"type":"article","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5106712712","display_name":"Reza Jahadi","orcid":null},"institutions":[{"id":"https://openalex.org/I72541430","display_name":"Lakehead University","ror":"https://ror.org/023p7mg82","country_code":"CA","type":"education","lineage":["https://openalex.org/I72541430"]}],"countries":["CA"],"is_corresponding":false,"raw_author_name":"Reza Jahadi","raw_affiliation_strings":["Electrical and Computer Engineering Department, Lakehead University, Thunder Bay, ON, Canada"],"raw_orcid":"https://orcid.org/0009-0006-3555-9957","affiliations":[{"raw_affiliation_string":"Electrical and Computer Engineering Department, Lakehead University, Thunder Bay, ON, Canada","institution_ids":["https://openalex.org/I72541430"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5011866354","display_name":"Phil Munz","orcid":"https://orcid.org/0009-0008-1219-2480"},"institutions":[{"id":"https://openalex.org/I2800296662","display_name":"Saint John Regional Hospital","ror":"https://ror.org/05k4mr860","country_code":"CA","type":"healthcare","lineage":["https://openalex.org/I2800296662"]}],"countries":["CA"],"is_corresponding":false,"raw_author_name":"Phil Munz","raw_affiliation_strings":["TrojAI, Saint John, NB, Canada"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"TrojAI, Saint John, NB, Canada","institution_ids":["https://openalex.org/I2800296662"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5012159659","display_name":"Ehsan Atoofian","orcid":"https://orcid.org/0000-0002-1662-5334"},"institutions":[{"id":"https://openalex.org/I72541430","display_name":"Lakehead University","ror":"https://ror.org/023p7mg82","country_code":"CA","type":"education","lineage":["https://openalex.org/I72541430"]}],"countries":["CA"],"is_corresponding":false,"raw_author_name":"Ehsan Atoofian","raw_affiliation_strings":["Electrical and Computer Engineering Department, Lakehead University, Thunder Bay, ON, Canada"],"raw_orcid":"https://orcid.org/0000-0002-1662-5334","affiliations":[{"raw_affiliation_string":"Electrical and Computer Engineering Department, Lakehead University, Thunder Bay, ON, Canada","institution_ids":["https://openalex.org/I72541430"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":{"value":2645,"currency":"USD","value_usd":2645},"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.21373569,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":"17","issue":"5","first_page":"317","last_page":"320"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.995199978351593,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.995199978351593,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12303","display_name":"Tensor decomposition and applications","score":0.9771999716758728,"subfield":{"id":"https://openalex.org/subfields/2605","display_name":"Computational Mathematics"},"field":{"id":"https://openalex.org/fields/26","display_name":"Mathematics"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10904","display_name":"Embedded Systems Design Techniques","score":0.9580000042915344,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/memory-footprint","display_name":"Memory footprint","score":0.6891000270843506},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.5224999785423279},{"id":"https://openalex.org/keywords/cuda","display_name":"CUDA","score":0.5209000110626221},{"id":"https://openalex.org/keywords/software","display_name":"Software","score":0.5105999708175659},{"id":"https://openalex.org/keywords/reduction","display_name":"Reduction (mathematics)","score":0.5058000087738037},{"id":"https://openalex.org/keywords/energy-consumption","display_name":"Energy consumption","score":0.492000013589859},{"id":"https://openalex.org/keywords/layer","display_name":"Layer (electronics)","score":0.4916999936103821},{"id":"https://openalex.org/keywords/multi-core-processor","display_name":"Multi-core processor","score":0.4325999915599823},{"id":"https://openalex.org/keywords/tensor","display_name":"Tensor (intrinsic definition)","score":0.43160000443458557}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.902899980545044},{"id":"https://openalex.org/C74912251","wikidata":"https://www.wikidata.org/wiki/Q6815727","display_name":"Memory footprint","level":2,"score":0.6891000270843506},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.5927000045776367},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.5224999785423279},{"id":"https://openalex.org/C2778119891","wikidata":"https://www.wikidata.org/wiki/Q477690","display_name":"CUDA","level":2,"score":0.5209000110626221},{"id":"https://openalex.org/C2777904410","wikidata":"https://www.wikidata.org/wiki/Q7397","display_name":"Software","level":2,"score":0.5105999708175659},{"id":"https://openalex.org/C111335779","wikidata":"https://www.wikidata.org/wiki/Q3454686","display_name":"Reduction (mathematics)","level":2,"score":0.5058000087738037},{"id":"https://openalex.org/C2780165032","wikidata":"https://www.wikidata.org/wiki/Q16869822","display_name":"Energy consumption","level":2,"score":0.492000013589859},{"id":"https://openalex.org/C2779227376","wikidata":"https://www.wikidata.org/wiki/Q6505497","display_name":"Layer (electronics)","level":2,"score":0.4916999936103821},{"id":"https://openalex.org/C78766204","wikidata":"https://www.wikidata.org/wiki/Q555032","display_name":"Multi-core processor","level":2,"score":0.4325999915599823},{"id":"https://openalex.org/C155281189","wikidata":"https://www.wikidata.org/wiki/Q3518150","display_name":"Tensor (intrinsic definition)","level":2,"score":0.43160000443458557},{"id":"https://openalex.org/C202491316","wikidata":"https://www.wikidata.org/wiki/Q272683","display_name":"Instruction set","level":2,"score":0.4147000014781952},{"id":"https://openalex.org/C2742236","wikidata":"https://www.wikidata.org/wiki/Q924713","display_name":"Efficient energy use","level":2,"score":0.4000000059604645},{"id":"https://openalex.org/C132943942","wikidata":"https://www.wikidata.org/wiki/Q2562511","display_name":"Footprint","level":2,"score":0.37709999084472656},{"id":"https://openalex.org/C149635348","wikidata":"https://www.wikidata.org/wiki/Q193040","display_name":"Embedded system","level":1,"score":0.3580999970436096},{"id":"https://openalex.org/C2779851693","wikidata":"https://www.wikidata.org/wiki/Q183484","display_name":"Graphics processing unit","level":2,"score":0.34619998931884766},{"id":"https://openalex.org/C2989134064","wikidata":"https://www.wikidata.org/wiki/Q288510","display_name":"Execution time","level":2,"score":0.33640000224113464},{"id":"https://openalex.org/C113775141","wikidata":"https://www.wikidata.org/wiki/Q428691","display_name":"Computer engineering","level":1,"score":0.335099995136261},{"id":"https://openalex.org/C89611455","wikidata":"https://www.wikidata.org/wiki/Q6804646","display_name":"Mechanism (biology)","level":2,"score":0.32269999384880066},{"id":"https://openalex.org/C49154492","wikidata":"https://www.wikidata.org/wiki/Q5300","display_name":"Central processing unit","level":2,"score":0.3124000132083893},{"id":"https://openalex.org/C120314980","wikidata":"https://www.wikidata.org/wiki/Q180634","display_name":"Distributed computing","level":1,"score":0.3091000020503998},{"id":"https://openalex.org/C176649486","wikidata":"https://www.wikidata.org/wiki/Q2308807","display_name":"Memory management","level":3,"score":0.30059999227523804},{"id":"https://openalex.org/C118524514","wikidata":"https://www.wikidata.org/wiki/Q173212","display_name":"Computer architecture","level":1,"score":0.29760000109672546},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.28790000081062317},{"id":"https://openalex.org/C459310","wikidata":"https://www.wikidata.org/wiki/Q117801","display_name":"Computational science","level":1,"score":0.2727999985218048},{"id":"https://openalex.org/C173414695","wikidata":"https://www.wikidata.org/wiki/Q5510276","display_name":"Fusion mechanism","level":4,"score":0.2651999890804291},{"id":"https://openalex.org/C2778915421","wikidata":"https://www.wikidata.org/wiki/Q3643177","display_name":"Performance improvement","level":2,"score":0.2596000134944916},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.2578999996185303}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/les.2025.3601057","is_oa":false,"landing_page_url":"https://doi.org/10.1109/les.2025.3601057","pdf_url":null,"source":{"id":"https://openalex.org/S22443479","display_name":"IEEE Embedded Systems Letters","issn_l":"1943-0663","issn":["1943-0663","1943-0671"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319808","host_organization_name":"Institute of Electrical and Electronics Engineers","host_organization_lineage":["https://openalex.org/P4310319808"],"host_organization_lineage_names":["Institute of Electrical and Electronics Engineers"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Embedded Systems Letters","raw_type":"journal-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320334593","display_name":"Natural Sciences and Engineering Research Council of Canada","ror":"https://ror.org/01h531d29"}],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":3,"referenced_works":["https://openalex.org/W2963989532","https://openalex.org/W4388214800","https://openalex.org/W4389162698"],"related_works":[],"abstract_inverted_index":{"Attention":[0],"mechanism":[1,91],"has":[2],"become":[3],"the":[4,45,76,103,112,122,133],"backbone":[5],"of":[6,62,78,106,114,136],"machine":[7],"learning":[8],"applications,":[9],"expanding":[10],"beyond":[11],"natural":[12],"language":[13],"processing":[14],"into":[15],"domains,":[16],"such":[17],"as":[18,44],"computer":[19],"vision":[20],"and":[21,38,53,81,116,152,163],"recommendation":[22],"systems.":[23],"We":[24,131],"observe":[25],"that":[26,148],"implementing":[27],"attention":[28,46,79,95,107,123,155],"layers":[29,80,156],"on":[30,85,143,169],"GPUs":[31,86,137],"with":[32,58,87],"tensor":[33],"cores":[34,128],"(TCs)":[35],"using":[36],"matrix-multiply":[37],"accumulate":[39],"(MMA)":[40],"operations":[41,96,120,141],"is":[42],"suboptimal":[43],"layer":[47,124],"incurs":[48],"an":[49,164],"excessively":[50],"large-memory":[51],"footprint":[52],"significant":[54],"computational":[55],"complexity,":[56],"especially":[57],"a":[59,70,98,159,173],"higher":[60],"number":[61],"input":[63],"elements.":[64],"In":[65],"this":[66],"work,":[67],"we":[68,110],"propose":[69],"hardware-software":[71],"co-design":[72],"approach":[73],"to":[74,129,138,172],"accelerate":[75],"execution":[77],"reduce":[82],"energy":[83],"consumption":[84],"TCs.":[88,130,144],"Our":[89,145],"proposed":[90],"efficiently":[92],"processes":[93],"costly":[94],"through":[97],"unique":[99],"fusion":[100],"mechanism,":[101],"reducing":[102],"memory":[104],"requirements":[105],"layers.":[108],"Additionally,":[109],"revisit":[111],"design":[113],"TCs":[115],"offload":[117],"certain":[118],"non-MMA":[119],"within":[121],"from":[125],"standard":[126],"CUDA":[127],"extend":[132],"instruction":[134],"set":[135],"support":[139],"new":[140],"performed":[142],"evaluations":[146],"reveal":[147],"optimizing":[149],"both":[150],"hardware":[151],"software":[153],"for":[154],"results":[157],"in":[158,167],"13.4%":[160],"performance":[161],"improvement":[162],"18.3%":[165],"reduction":[166],"energy-delay":[168],"average,":[170],"compared":[171],"software-only":[174],"optimization":[175],"approach.":[176]},"counts_by_year":[],"updated_date":"2026-08-21T09:56:20.448147","created_date":"2025-10-17T00:00:00"}
