{"id":"https://openalex.org/W7131123588","doi":"https://doi.org/10.1109/cgo68049.2026.11395214","title":"Pushing Tensor Accelerators beyond MatMul in a User-Schedulable Language","display_name":"Pushing Tensor Accelerators beyond MatMul in a User-Schedulable Language","publication_year":2026,"publication_date":"2026-01-31","ids":{"openalex":"https://openalex.org/W7131123588","doi":"https://doi.org/10.1109/cgo68049.2026.11395214"},"language":null,"primary_location":{"id":"doi:10.1109/cgo68049.2026.11395214","is_oa":false,"landing_page_url":"https://doi.org/10.1109/cgo68049.2026.11395214","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2026 IEEE/ACM International Symposium on Code Generation and Optimization (CGO)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5101953741","display_name":"Yihong Zhang","orcid":"https://orcid.org/0000-0003-1261-1661"},"institutions":[{"id":"https://openalex.org/I201448701","display_name":"University of Washington","ror":"https://ror.org/00cvxb145","country_code":"US","type":"education","lineage":["https://openalex.org/I201448701"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Yihong Zhang","raw_affiliation_strings":["University of Washington,USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Washington,USA","institution_ids":["https://openalex.org/I201448701"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5073187401","display_name":"Derek K. Gerstmann","orcid":null},"institutions":[{"id":"https://openalex.org/I1306409833","display_name":"Adobe Systems (United States)","ror":"https://ror.org/059tvcg64","country_code":"US","type":"company","lineage":["https://openalex.org/I1306409833"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Derek Gerstmann","raw_affiliation_strings":["Adobe,USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Adobe,USA","institution_ids":["https://openalex.org/I1306409833"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5082293572","display_name":"Andrew Adams","orcid":"https://orcid.org/0000-0001-8925-9956"},"institutions":[{"id":"https://openalex.org/I1306409833","display_name":"Adobe Systems (United States)","ror":"https://ror.org/059tvcg64","country_code":"US","type":"company","lineage":["https://openalex.org/I1306409833"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Andrew Adams","raw_affiliation_strings":["Adobe,USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Adobe,USA","institution_ids":["https://openalex.org/I1306409833"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5041364880","display_name":"M Ahmad","orcid":"https://orcid.org/0000-0002-8113-7580"},"institutions":[{"id":"https://openalex.org/I1306409833","display_name":"Adobe Systems (United States)","ror":"https://ror.org/059tvcg64","country_code":"US","type":"company","lineage":["https://openalex.org/I1306409833"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Maaz Bin Safeer Ahmad","raw_affiliation_strings":["Adobe,USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Adobe,USA","institution_ids":["https://openalex.org/I1306409833"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"242","last_page":"254"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.29670000076293945,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.29670000076293945,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12303","display_name":"Tensor decomposition and applications","score":0.054099999368190765,"subfield":{"id":"https://openalex.org/subfields/2605","display_name":"Computational Mathematics"},"field":{"id":"https://openalex.org/fields/26","display_name":"Mathematics"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T13650","display_name":"Computational Physics and Python Applications","score":0.04399999976158142,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/tensor","display_name":"Tensor (intrinsic definition)","score":0.6865000128746033},{"id":"https://openalex.org/keywords/tensor-calculus","display_name":"Tensor calculus","score":0.3677999973297119},{"id":"https://openalex.org/keywords/kernel","display_name":"Kernel (algebra)","score":0.3671000003814697},{"id":"https://openalex.org/keywords/scheduling","display_name":"Scheduling (production processes)","score":0.32010000944137573},{"id":"https://openalex.org/keywords/pipeline-transport","display_name":"Pipeline transport","score":0.30979999899864197},{"id":"https://openalex.org/keywords/einstein-tensor","display_name":"Einstein tensor","score":0.30649998784065247}],"concepts":[{"id":"https://openalex.org/C155281189","wikidata":"https://www.wikidata.org/wiki/Q3518150","display_name":"Tensor (intrinsic definition)","level":2,"score":0.6865000128746033},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6601999998092651},{"id":"https://openalex.org/C459310","wikidata":"https://www.wikidata.org/wiki/Q117801","display_name":"Computational science","level":1,"score":0.39250001311302185},{"id":"https://openalex.org/C199360897","wikidata":"https://www.wikidata.org/wiki/Q9143","display_name":"Programming language","level":1,"score":0.38370001316070557},{"id":"https://openalex.org/C90952326","wikidata":"https://www.wikidata.org/wiki/Q3650511","display_name":"Tensor calculus","level":4,"score":0.3677999973297119},{"id":"https://openalex.org/C74193536","wikidata":"https://www.wikidata.org/wiki/Q574844","display_name":"Kernel (algebra)","level":2,"score":0.3671000003814697},{"id":"https://openalex.org/C80444323","wikidata":"https://www.wikidata.org/wiki/Q2878974","display_name":"Theoretical computer science","level":1,"score":0.35530000925064087},{"id":"https://openalex.org/C206729178","wikidata":"https://www.wikidata.org/wiki/Q2271896","display_name":"Scheduling (production processes)","level":2,"score":0.32010000944137573},{"id":"https://openalex.org/C175309249","wikidata":"https://www.wikidata.org/wiki/Q725864","display_name":"Pipeline transport","level":2,"score":0.30979999899864197},{"id":"https://openalex.org/C14440778","wikidata":"https://www.wikidata.org/wiki/Q550929","display_name":"Einstein tensor","level":4,"score":0.30649998784065247},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.30169999599456787},{"id":"https://openalex.org/C2982832238","wikidata":"https://www.wikidata.org/wiki/Q5531640","display_name":"General purpose","level":2,"score":0.2976999878883362},{"id":"https://openalex.org/C166077713","wikidata":"https://www.wikidata.org/wiki/Q1758924","display_name":"Tensor field","level":3,"score":0.28220000863075256},{"id":"https://openalex.org/C9417928","wikidata":"https://www.wikidata.org/wiki/Q1070689","display_name":"Image processing","level":3,"score":0.2791000008583069},{"id":"https://openalex.org/C124007464","wikidata":"https://www.wikidata.org/wiki/Q428091","display_name":"Tensor contraction","level":3,"score":0.2728999853134155},{"id":"https://openalex.org/C1680195","wikidata":"https://www.wikidata.org/wiki/Q2296021","display_name":"Tensor algebra","level":5,"score":0.2515000104904175},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.25130000710487366}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/cgo68049.2026.11395214","is_oa":false,"landing_page_url":"https://doi.org/10.1109/cgo68049.2026.11395214","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2026 IEEE/ACM International Symposium on Code Generation and Optimization (CGO)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/4","display_name":"Quality Education","score":0.40122190117836}],"awards":[],"funders":[{"id":"https://openalex.org/F4320306076","display_name":"National Science Foundation","ror":"https://ror.org/021nxhr62"}],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":24,"referenced_works":["https://openalex.org/W1513879401","https://openalex.org/W1996819670","https://openalex.org/W2040903332","https://openalex.org/W2116031583","https://openalex.org/W2152397470","https://openalex.org/W2780077279","https://openalex.org/W2804032941","https://openalex.org/W2954698171","https://openalex.org/W3028780355","https://openalex.org/W3099525000","https://openalex.org/W3153044352","https://openalex.org/W3163649573","https://openalex.org/W4214613759","https://openalex.org/W4221005464","https://openalex.org/W4236695385","https://openalex.org/W4280495398","https://openalex.org/W4318541538","https://openalex.org/W4379536906","https://openalex.org/W4386763491","https://openalex.org/W4390393298","https://openalex.org/W4391623920","https://openalex.org/W4392266008","https://openalex.org/W4407857939","https://openalex.org/W4407857946"],"related_works":[],"abstract_inverted_index":{"Tensor":[0,226],"accelerators":[1,39,61,148,180],"now":[2],"represent":[3],"a":[4,33,129,168,216],"growing":[5],"share":[6],"of":[7,37,66,71,178],"compute":[8],"resources":[9],"in":[10,84,100,167,196],"modern":[11],"CPUs":[12],"and":[13,51,86,117,145,149,194,199],"GPUs.":[14],"However,":[15],"they":[16],"are":[17,79],"hard":[18],"to":[19,23,42,162],"program,":[20],"leading":[21],"developers":[22,161],"use":[24,112],"vendor-provided":[25],"kernel":[26],"libraries":[27],"that":[28,59,207],"support":[29],"tensor":[30,38,60,102,131,139,147,179],"accelerators.":[31,103],"As":[32],"result,":[34],"the":[35,43,64,98,113,176],"usage":[36],"is":[40,94,219],"limited":[41],"provided":[44],"interface,":[45],"mainly":[46],"designed":[47],"for":[48],"traditional":[49,183],"ML":[50],"scientific":[52],"computing":[53],"workloads.In":[54],"this":[55,106,125,159],"paper,":[56],"we":[57,127,174],"show":[58,206],"can":[62,87,210],"improve":[63],"performance":[65],"applications":[67,166],"beyond":[68,181],"simple":[69],"variants":[70],"MatMul.":[72],"For":[73,214],"example,":[74,215],"many":[75],"image":[76,188],"processing":[77,189],"pipelines":[78,190,209],"linear":[80],"transformations":[81],"over":[82],"matrices":[83],"disguise":[85],"therefore":[88],"utilize":[89],"such":[90],"specialized":[91],"hardware.":[92],"This":[93],"nonetheless":[95],"hindered":[96],"by":[97,222,224],"difficulties":[99],"programming":[101],"We":[104,111,185,205],"tackle":[105],"problem":[107],"with":[108,151],"compiler-based":[109],"techniques.":[110],"Halide":[114,121],"user-schedulable":[115],"language":[116],"express":[118],"operations":[119,154],"as":[120],"algorithms":[122],"succinctly.":[123],"To":[124],"end,":[126],"implement":[128,186],"flexible":[130],"instruction":[132,140],"selector":[133,141],"based":[134],"on":[135,228],"equality":[136],"saturation.":[137],"The":[138],"supports":[142],"both":[143],"CPU-":[144],"GPU-attached":[146],"works":[150],"existing":[152],"scheduling":[153],"(e.g.,":[155,191],"producer-consumer":[156],"fusion).":[157],"Together,":[158],"enables":[160],"write":[163],"diverse":[164],"accelerator-leveraging":[165],"few":[169],"dozen":[170],"lines.Using":[171],"our":[172,197],"system,":[173],"demonstrate":[175],"potential":[177],"their":[182],"domains.":[184],"several":[187],"filtering,":[192],"resampling,":[193],"denoising)":[195],"system":[198],"evaluate":[200],"them":[201],"against":[202],"non-accelerator-leveraging":[203],"baselines.":[204],"these":[208],"achieve":[211],"significant":[212],"speedups.":[213],"downsampling":[217],"routine":[218],"sped":[220],"up":[221],"6.1\u00d7":[223],"utilizing":[225],"Cores":[227],"an":[229],"Nvidia":[230],"RTX":[231],"4070":[232],"GPU.":[233]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2026-02-14T00:00:00"}
