{"id":"https://openalex.org/W7119519483","doi":"https://doi.org/10.1145/3773656.3773660","title":"Optimization of a GEMM Implementation using Intel AMX","display_name":"Optimization of a GEMM Implementation using Intel AMX","publication_year":2026,"publication_date":"2026-01-09","ids":{"openalex":"https://openalex.org/W7119519483","doi":"https://doi.org/10.1145/3773656.3773660"},"language":null,"primary_location":{"id":"doi:10.1145/3773656.3773660","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3773656.3773660","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the Supercomputing Asia and International Conference on High Performance Computing in Asia Pacific Region","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://doi.org/10.1145/3773656.3773660","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":null,"display_name":"Yusuke Endo","orcid":"https://orcid.org/0009-0007-5363-345X"},"institutions":[{"id":"https://openalex.org/I135598925","display_name":"Kyushu University","ror":"https://ror.org/00p4k0j84","country_code":"JP","type":"education","lineage":["https://openalex.org/I135598925"]}],"countries":["JP"],"is_corresponding":false,"raw_author_name":"Yusuke Endo","raw_affiliation_strings":["Kyushu university, Fukuoka, Japan"],"raw_orcid":"https://orcid.org/0009-0007-5363-345X","affiliations":[{"raw_affiliation_string":"Kyushu university, Fukuoka, Japan","institution_ids":["https://openalex.org/I135598925"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5080142917","display_name":"Satoshi Ohshima","orcid":"https://orcid.org/0000-0003-4073-5688"},"institutions":[{"id":"https://openalex.org/I135598925","display_name":"Kyushu University","ror":"https://ror.org/00p4k0j84","country_code":"JP","type":"education","lineage":["https://openalex.org/I135598925"]}],"countries":["JP"],"is_corresponding":false,"raw_author_name":"Satoshi Ohshima","raw_affiliation_strings":["Research Institute for Information Technology, Kyushu University, Fukuoka, Japan"],"raw_orcid":"https://orcid.org/0000-0003-4073-5688","affiliations":[{"raw_affiliation_string":"Research Institute for Information Technology, Kyushu University, Fukuoka, Japan","institution_ids":["https://openalex.org/I135598925"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5015306862","display_name":"Takeshi Nanri","orcid":null},"institutions":[{"id":"https://openalex.org/I135598925","display_name":"Kyushu University","ror":"https://ror.org/00p4k0j84","country_code":"JP","type":"education","lineage":["https://openalex.org/I135598925"]}],"countries":["JP"],"is_corresponding":false,"raw_author_name":"Takeshi Nanri","raw_affiliation_strings":["Research Institute for Information Technology, Kyushu University, Fukuoka, Japan"],"raw_orcid":"https://orcid.org/0000-0002-4111-9425","affiliations":[{"raw_affiliation_string":"Research Institute for Information Technology, Kyushu University, Fukuoka, Japan","institution_ids":["https://openalex.org/I135598925"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I135598925"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.03566591,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"81","last_page":"90"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.7752000093460083,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.7752000093460083,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11697","display_name":"Numerical Methods and Algorithms","score":0.0820000022649765,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11693","display_name":"Cryptography and Residue Arithmetic","score":0.026000000536441803,"subfield":{"id":"https://openalex.org/subfields/1710","display_name":"Information Systems"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/matrix-multiplication","display_name":"Matrix multiplication","score":0.6226999759674072},{"id":"https://openalex.org/keywords/matrix","display_name":"Matrix (chemical analysis)","score":0.5008000135421753},{"id":"https://openalex.org/keywords/computation","display_name":"Computation","score":0.41780000925064087},{"id":"https://openalex.org/keywords/range","display_name":"Range (aeronautics)","score":0.384799987077713},{"id":"https://openalex.org/keywords/blocking","display_name":"Blocking (statistics)","score":0.35569998621940613},{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.3411000072956085},{"id":"https://openalex.org/keywords/implementation","display_name":"Implementation","score":0.34040001034736633},{"id":"https://openalex.org/keywords/sparse-matrix","display_name":"Sparse matrix","score":0.33629998564720154},{"id":"https://openalex.org/keywords/multi-core-processor","display_name":"Multi-core processor","score":0.3328999876976013}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8177000284194946},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.6686999797821045},{"id":"https://openalex.org/C17349429","wikidata":"https://www.wikidata.org/wiki/Q1049914","display_name":"Matrix multiplication","level":3,"score":0.6226999759674072},{"id":"https://openalex.org/C106487976","wikidata":"https://www.wikidata.org/wiki/Q685816","display_name":"Matrix (chemical analysis)","level":2,"score":0.5008000135421753},{"id":"https://openalex.org/C118524514","wikidata":"https://www.wikidata.org/wiki/Q173212","display_name":"Computer architecture","level":1,"score":0.4269999861717224},{"id":"https://openalex.org/C45374587","wikidata":"https://www.wikidata.org/wiki/Q12525525","display_name":"Computation","level":2,"score":0.41780000925064087},{"id":"https://openalex.org/C204323151","wikidata":"https://www.wikidata.org/wiki/Q905424","display_name":"Range (aeronautics)","level":2,"score":0.384799987077713},{"id":"https://openalex.org/C144745244","wikidata":"https://www.wikidata.org/wiki/Q4927286","display_name":"Blocking (statistics)","level":2,"score":0.35569998621940613},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.3411000072956085},{"id":"https://openalex.org/C26713055","wikidata":"https://www.wikidata.org/wiki/Q245962","display_name":"Implementation","level":2,"score":0.34040001034736633},{"id":"https://openalex.org/C56372850","wikidata":"https://www.wikidata.org/wiki/Q1050404","display_name":"Sparse matrix","level":3,"score":0.33629998564720154},{"id":"https://openalex.org/C78766204","wikidata":"https://www.wikidata.org/wiki/Q555032","display_name":"Multi-core processor","level":2,"score":0.3328999876976013},{"id":"https://openalex.org/C9390403","wikidata":"https://www.wikidata.org/wiki/Q3966","display_name":"Computer hardware","level":1,"score":0.328900009393692},{"id":"https://openalex.org/C3826847","wikidata":"https://www.wikidata.org/wiki/Q188768","display_name":"FLOPS","level":2,"score":0.32330000400543213},{"id":"https://openalex.org/C163258240","wikidata":"https://www.wikidata.org/wiki/Q25342","display_name":"Power (physics)","level":2,"score":0.31349998712539673},{"id":"https://openalex.org/C111335779","wikidata":"https://www.wikidata.org/wiki/Q3454686","display_name":"Reduction (mathematics)","level":2,"score":0.3050999939441681},{"id":"https://openalex.org/C459310","wikidata":"https://www.wikidata.org/wiki/Q117801","display_name":"Computational science","level":1,"score":0.2994999885559082},{"id":"https://openalex.org/C35390924","wikidata":"https://www.wikidata.org/wiki/Q661075","display_name":"Metaprogramming","level":2,"score":0.29580000042915344},{"id":"https://openalex.org/C2778100165","wikidata":"https://www.wikidata.org/wiki/Q1589327","display_name":"Memory hierarchy","level":3,"score":0.29100000858306885},{"id":"https://openalex.org/C139571649","wikidata":"https://www.wikidata.org/wiki/Q1156793","display_name":"Program optimization","level":3,"score":0.28790000081062317},{"id":"https://openalex.org/C106515295","wikidata":"https://www.wikidata.org/wiki/Q26806595","display_name":"Parallel processing","level":2,"score":0.2712000012397766},{"id":"https://openalex.org/C113775141","wikidata":"https://www.wikidata.org/wiki/Q428691","display_name":"Computer engineering","level":1,"score":0.26829999685287476},{"id":"https://openalex.org/C199360897","wikidata":"https://www.wikidata.org/wiki/Q9143","display_name":"Programming language","level":1,"score":0.26499998569488525},{"id":"https://openalex.org/C149635348","wikidata":"https://www.wikidata.org/wiki/Q193040","display_name":"Embedded system","level":1,"score":0.2639999985694885},{"id":"https://openalex.org/C22174128","wikidata":"https://www.wikidata.org/wiki/Q175869","display_name":"Microcode","level":2,"score":0.2639000117778778},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.2567000091075897},{"id":"https://openalex.org/C202491316","wikidata":"https://www.wikidata.org/wiki/Q272683","display_name":"Instruction set","level":2,"score":0.2556000053882599},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.2535000145435333},{"id":"https://openalex.org/C2778029271","wikidata":"https://www.wikidata.org/wiki/Q5421931","display_name":"Extension (predicate logic)","level":2,"score":0.25290000438690186},{"id":"https://openalex.org/C2780595030","wikidata":"https://www.wikidata.org/wiki/Q3860309","display_name":"Multiplication (music)","level":2,"score":0.2513999938964844},{"id":"https://openalex.org/C13164978","wikidata":"https://www.wikidata.org/wiki/Q600158","display_name":"Hardware acceleration","level":3,"score":0.2500999867916107}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1145/3773656.3773660","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3773656.3773660","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the Supercomputing Asia and International Conference on High Performance Computing in Asia Pacific Region","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.1145/3773656.3773660","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3773656.3773660","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the Supercomputing Asia and International Conference on High Performance Computing in Asia Pacific Region","raw_type":"proceedings-article"},"sustainable_development_goals":[{"display_name":"Affordable and clean energy","id":"https://metadata.un.org/sdg/7","score":0.7402198910713196}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":9,"referenced_works":["https://openalex.org/W2606722458","https://openalex.org/W2791673912","https://openalex.org/W2907701003","https://openalex.org/W2963137752","https://openalex.org/W3037775421","https://openalex.org/W3043704866","https://openalex.org/W3182339906","https://openalex.org/W4388556627","https://openalex.org/W4392884779"],"related_works":[],"abstract_inverted_index":{"In":[0,88],"high-performance":[1],"computing,":[2],"general":[3],"matrix":[4,18,56,86,95],"multiplication":[5],"(xGEMM)":[6],"routines":[7],"form":[8],"the":[9,22,61,118,126],"core":[10],"of":[11,120,125],"Level-3":[12],"BLAS":[13],"kernels,":[14],"which":[15],"enables":[16],"efficient":[17],"operations.":[19,87],"Among":[20],"these,":[21],"low-precision":[23,85],"GEMM":[24,128],"such":[25,79],"as":[26],"BFloat16":[27,127],"has":[28],"become":[29],"indispensable":[30],"in":[31,117],"machine":[32],"learning":[33,36],"and":[34,42,63,93,102,107,133],"deep":[35],"because":[37],"it":[38],"reduces":[39],"memory":[40],"usage":[41],"power":[43],"consumption.":[44],"To":[45],"meet":[46],"this":[47,89],"demand,":[48],"recent":[49],"hardware":[50,80],"platforms":[51],"are":[52],"equipped":[53],"with":[54],"dedicated":[55],"computation":[57],"units":[58],"separate":[59],"from":[60],"CPU,":[62],"research":[64],"efforts":[65],"have":[66],"focused":[67],"on":[68],"maximizing":[69],"their":[70],"performance.":[71,110],"Intel\u2019s":[72],"Advanced":[73],"Matrix":[74],"Extension":[75],"(AMX)":[76],"is":[77],"one":[78],"accelerator":[81],"designed":[82],"specifically":[83],"for":[84],"study,":[90],"we":[91],"implement":[92],"optimize":[94],"multiplication-accumulation":[96],"using":[97],"AMX":[98],"by":[99,131],"applying":[100],"blocking":[101],"tile":[103],"register":[104],"level":[105],"optimizations":[106],"evaluate":[108],"its":[109],"Our":[111],"results":[112],"demonstrate":[113],"a":[114],"performance":[115],"improvement":[116],"range":[119],"7.27\u201320.40%":[121],"compared":[122],"to":[123],"that":[124],"implementations":[129],"provided":[130],"MKL":[132],"OpenBLAS.":[134]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-01-09T00:00:00"}
