{"id":"https://openalex.org/W7167039920","doi":"https://doi.org/10.1145/3797905.3807857","title":"Cheetah: Optimizing Execution Pipelines for Matrix-Free Finite Element Operators on GPUs","display_name":"Cheetah: Optimizing Execution Pipelines for Matrix-Free Finite Element Operators on GPUs","publication_year":2026,"publication_date":"2026-07-02","ids":{"openalex":"https://openalex.org/W7167039920","doi":"https://doi.org/10.1145/3797905.3807857"},"language":null,"primary_location":{"id":"doi:10.1145/3797905.3807857","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3797905.3807857","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 40th ACM International Conference on Supercomputing","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://doi.org/10.1145/3797905.3807857","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5077292051","display_name":"Jie Ren","orcid":"https://orcid.org/0000-0003-3332-2092"},"institutions":[{"id":"https://openalex.org/I71920554","display_name":"King Abdullah University of Science and Technology","ror":"https://ror.org/01q3tbs38","country_code":"SA","type":"education","lineage":["https://openalex.org/I71920554"]}],"countries":["SA"],"is_corresponding":false,"raw_author_name":"Jie Ren","raw_affiliation_strings":["Computer, Electrical and Mathematical Sciences and Engineering, King Abdullah University of Science and Technology, Thuwal, Western Province, Saudi Arabia"],"raw_orcid":"https://orcid.org/0000-0003-3332-2092","affiliations":[{"raw_affiliation_string":"Computer, Electrical and Mathematical Sciences and Engineering, King Abdullah University of Science and Technology, Thuwal, Western Province, Saudi Arabia","institution_ids":["https://openalex.org/I71920554"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5017526753","display_name":"Hatem Ltaief","orcid":"https://orcid.org/0000-0002-6897-1095"},"institutions":[{"id":"https://openalex.org/I71920554","display_name":"King Abdullah University of Science and Technology","ror":"https://ror.org/01q3tbs38","country_code":"SA","type":"education","lineage":["https://openalex.org/I71920554"]}],"countries":["SA"],"is_corresponding":false,"raw_author_name":"Hatem Ltaief","raw_affiliation_strings":["Computer, Electrical and Mathematical Sciences and Engineering, King Abdullah University of Science and Technology, Thuwal, Western Province, Saudi Arabia"],"raw_orcid":"https://orcid.org/0000-0002-6897-1095","affiliations":[{"raw_affiliation_string":"Computer, Electrical and Mathematical Sciences and Engineering, King Abdullah University of Science and Technology, Thuwal, Western Province, Saudi Arabia","institution_ids":["https://openalex.org/I71920554"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5024375169","display_name":"Stefano Zampini","orcid":"https://orcid.org/0000-0002-0435-0433"},"institutions":[{"id":"https://openalex.org/I71920554","display_name":"King Abdullah University of Science and Technology","ror":"https://ror.org/01q3tbs38","country_code":"SA","type":"education","lineage":["https://openalex.org/I71920554"]}],"countries":["SA"],"is_corresponding":false,"raw_author_name":"Stefano Zampini","raw_affiliation_strings":["Computer, Electrical and Mathematical Sciences and Engineering, King Abdullah University of Science and Technology, Thuwal, Western Province, Saudi Arabia"],"raw_orcid":"https://orcid.org/0000-0002-0435-0433","affiliations":[{"raw_affiliation_string":"Computer, Electrical and Mathematical Sciences and Engineering, King Abdullah University of Science and Technology, Thuwal, Western Province, Saudi Arabia","institution_ids":["https://openalex.org/I71920554"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5021283893","display_name":"David E. Keyes","orcid":"https://orcid.org/0000-0002-4052-7224"},"institutions":[{"id":"https://openalex.org/I71920554","display_name":"King Abdullah University of Science and Technology","ror":"https://ror.org/01q3tbs38","country_code":"SA","type":"education","lineage":["https://openalex.org/I71920554"]}],"countries":["SA"],"is_corresponding":false,"raw_author_name":"David E. Keyes","raw_affiliation_strings":["Computer, Electrical and Mathematical Sciences and Engineering, King Abdullah University of Science and Technology, Thuwal, Western Province, Saudi Arabia"],"raw_orcid":"https://orcid.org/0000-0002-4052-7224","affiliations":[{"raw_affiliation_string":"Computer, Electrical and Mathematical Sciences and Engineering, King Abdullah University of Science and Technology, Thuwal, Western Province, Saudi Arabia","institution_ids":["https://openalex.org/I71920554"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I71920554"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1245","last_page":"1258"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.8586000204086304,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.8586000204086304,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10792","display_name":"Matrix Theory and Algorithms","score":0.04800000041723251,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.012900000438094139,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/pipeline-transport","display_name":"Pipeline transport","score":0.4408000111579895},{"id":"https://openalex.org/keywords/memory-footprint","display_name":"Memory footprint","score":0.4302000105381012},{"id":"https://openalex.org/keywords/exploit","display_name":"Exploit","score":0.42829999327659607},{"id":"https://openalex.org/keywords/pipeline","display_name":"Pipeline (software)","score":0.42329999804496765},{"id":"https://openalex.org/keywords/computation","display_name":"Computation","score":0.3977000117301941},{"id":"https://openalex.org/keywords/operator","display_name":"Operator (biology)","score":0.353300005197525},{"id":"https://openalex.org/keywords/execution-model","display_name":"Execution model","score":0.35199999809265137},{"id":"https://openalex.org/keywords/concurrency","display_name":"Concurrency","score":0.34139999747276306}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8009999990463257},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.6355000138282776},{"id":"https://openalex.org/C175309249","wikidata":"https://www.wikidata.org/wiki/Q725864","display_name":"Pipeline transport","level":2,"score":0.4408000111579895},{"id":"https://openalex.org/C74912251","wikidata":"https://www.wikidata.org/wiki/Q6815727","display_name":"Memory footprint","level":2,"score":0.4302000105381012},{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.42829999327659607},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.42329999804496765},{"id":"https://openalex.org/C45374587","wikidata":"https://www.wikidata.org/wiki/Q12525525","display_name":"Computation","level":2,"score":0.3977000117301941},{"id":"https://openalex.org/C17020691","wikidata":"https://www.wikidata.org/wiki/Q139677","display_name":"Operator (biology)","level":5,"score":0.353300005197525},{"id":"https://openalex.org/C2776834041","wikidata":"https://www.wikidata.org/wiki/Q25346349","display_name":"Execution model","level":2,"score":0.35199999809265137},{"id":"https://openalex.org/C193702766","wikidata":"https://www.wikidata.org/wiki/Q1414548","display_name":"Concurrency","level":2,"score":0.34139999747276306},{"id":"https://openalex.org/C74193536","wikidata":"https://www.wikidata.org/wiki/Q574844","display_name":"Kernel (algebra)","level":2,"score":0.3361000120639801},{"id":"https://openalex.org/C459310","wikidata":"https://www.wikidata.org/wiki/Q117801","display_name":"Computational science","level":1,"score":0.3273000121116638},{"id":"https://openalex.org/C138101251","wikidata":"https://www.wikidata.org/wiki/Q213092","display_name":"Thread (computing)","level":2,"score":0.3221000134944916},{"id":"https://openalex.org/C135628077","wikidata":"https://www.wikidata.org/wiki/Q220184","display_name":"Finite element method","level":2,"score":0.31310001015663147},{"id":"https://openalex.org/C82876162","wikidata":"https://www.wikidata.org/wiki/Q17096504","display_name":"Latency (audio)","level":2,"score":0.3043000102043152},{"id":"https://openalex.org/C151319957","wikidata":"https://www.wikidata.org/wiki/Q752739","display_name":"Asynchronous communication","level":2,"score":0.29750001430511475},{"id":"https://openalex.org/C2778562939","wikidata":"https://www.wikidata.org/wiki/Q1298791","display_name":"Synchronization (alternating current)","level":3,"score":0.28619998693466187},{"id":"https://openalex.org/C2778119891","wikidata":"https://www.wikidata.org/wiki/Q477690","display_name":"CUDA","level":2,"score":0.2734000086784363},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.26420000195503235},{"id":"https://openalex.org/C206729178","wikidata":"https://www.wikidata.org/wiki/Q2271896","display_name":"Scheduling (production processes)","level":2,"score":0.2639000117778778},{"id":"https://openalex.org/C187191949","wikidata":"https://www.wikidata.org/wiki/Q1138496","display_name":"Profiling (computer programming)","level":2,"score":0.2556000053882599},{"id":"https://openalex.org/C202491316","wikidata":"https://www.wikidata.org/wiki/Q272683","display_name":"Instruction set","level":2,"score":0.25279998779296875},{"id":"https://openalex.org/C190470478","wikidata":"https://www.wikidata.org/wiki/Q2370229","display_name":"Invariant (physics)","level":2,"score":0.2515999972820282},{"id":"https://openalex.org/C113775141","wikidata":"https://www.wikidata.org/wiki/Q428691","display_name":"Computer engineering","level":1,"score":0.2515000104904175}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1145/3797905.3807857","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3797905.3807857","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 40th ACM International Conference on Supercomputing","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.1145/3797905.3807857","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3797905.3807857","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 40th ACM International Conference on Supercomputing","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":25,"referenced_works":["https://openalex.org/W1790356362","https://openalex.org/W1978588246","https://openalex.org/W2002555321","https://openalex.org/W2018225490","https://openalex.org/W2049415037","https://openalex.org/W2053572944","https://openalex.org/W2072132691","https://openalex.org/W2102295719","https://openalex.org/W2342281373","https://openalex.org/W2612795562","https://openalex.org/W2614048889","https://openalex.org/W2767520933","https://openalex.org/W2943869808","https://openalex.org/W2969262004","https://openalex.org/W3016268593","https://openalex.org/W3040786754","https://openalex.org/W3045712545","https://openalex.org/W3141650078","https://openalex.org/W3167826856","https://openalex.org/W3173812025","https://openalex.org/W3179468891","https://openalex.org/W4244254628","https://openalex.org/W4245654886","https://openalex.org/W4386073026","https://openalex.org/W4410699261"],"related_works":[],"abstract_inverted_index":{"Matrix-free":[0],"finite":[1,74],"element":[2,75],"methods":[3,236],"are":[4,118],"widely":[5],"used":[6],"in":[7,214],"large-scale":[8],"scientific":[9],"simulations":[10],"due":[11],"to":[12,130,162,171,177],"their":[13],"reduced":[14,194],"memory":[15,101,111],"footprint":[16],"and":[17,93,108,126,139,169,200,220],"favorable":[18],"arithmetic":[19,198],"intensity,":[20,199],"making":[21],"them":[22],"particularly":[23,153],"attractive":[24],"for":[25,33,112,166,173,228],"modern":[26,238],"GPU":[27,37,181,218],"architectures.":[28],"However,":[29],"achieving":[30],"high":[31],"performance":[32,151,232],"fully":[34,215],"fused,":[35],"matrix-free":[36,73,217,235],"kernels":[38,219],"remains":[39],"challenging,":[40],"as":[41],"execution":[42,68,211],"is":[43,226],"often":[44],"limited":[45],"by":[46],"pipeline":[47,69,212],"inefficiencies":[48],"rather":[49],"than":[50],"floating-point":[51],"throughput.":[52],"In":[53],"this":[54],"work,":[55],"we":[56],"present":[57],"Cheetah,":[58],"a":[59],"set":[60],"of":[61,70,210,234],"kernel-level":[62],"optimizations":[63,117],"that":[64,186,222],"systematically":[65],"redesign":[66],"the":[67,79,122,178,208,230],"just-in-time":[71],"compiled":[72],"operators":[76,141,168,175],"without":[77],"modifying":[78],"mathematical":[80],"formulation":[81],"or":[82],"user-facing":[83],"programming":[84],"model.":[85],"Cheetah":[86,136],"improves":[87],"register":[88],"reuse,":[89],"reduces":[90],"shared-memory":[91],"traffic":[92],"CTA-level":[94],"(cooperative":[95],"thread":[96],"array)":[97],"synchronization,":[98],"overlaps":[99],"indirect":[100],"accesses":[102],"with":[103,160],"computation":[104],"using":[105],"asynchronous":[106],"copy,":[107],"exploits":[109],"constant":[110],"invariant":[113],"operator":[114],"data.":[115],"These":[116],"implemented":[119],"transparently":[120],"within":[121],"libCEED":[123,180],"JIT":[124],"framework":[125],"require":[127],"no":[128],"changes":[129],"user-provided":[131],"quadrature":[132],"functions.":[133],"We":[134],"evaluate":[135],"on":[137,142,237],"mass-like":[138],"diffusion-like":[140],"an":[143],"NVIDIA":[144],"A100":[145],"GPU.":[146],"The":[147],"results":[148,206],"demonstrate":[149,221],"substantial":[150],"improvements,":[152],"at":[154],"polynomial":[155],"orders":[156],"p":[157],"\u2265":[158],"4,":[159],"up":[161,170],"30%":[163],"higher":[164],"throughput":[165],"mass":[167],"50%":[172],"diffusion":[174],"compared":[176],"baseline":[179],"backend.":[182],"Detailed":[183],"profiling":[184],"shows":[185],"these":[187],"gains":[188],"arise":[189],"from":[190],"improved":[191],"compute":[192],"utilization,":[193],"synchronization":[195],"overhead,":[196],"increased":[197],"more":[201],"effective":[202],"latency":[203],"hiding.":[204],"Our":[205],"highlight":[207],"importance":[209],"design":[213],"fused":[216],"low-level":[223],"kernel":[224],"restructuring":[225],"essential":[227],"unlocking":[229],"full":[231],"potential":[233],"GPUs.":[239]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2026-07-03T00:00:00"}
