{"id":"https://openalex.org/W7154595709","doi":"https://doi.org/10.1145/3807957","title":"Quantitative Analysis and Performance Optimization of Graph Neural Networks on Multi-core CPUs","display_name":"Quantitative Analysis and Performance Optimization of Graph Neural Networks on Multi-core CPUs","publication_year":2026,"publication_date":"2026-04-16","ids":{"openalex":"https://openalex.org/W7154595709","doi":"https://doi.org/10.1145/3807957"},"language":"en","primary_location":{"id":"doi:10.1145/3807957","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3807957","pdf_url":null,"source":{"id":"https://openalex.org/S26056741","display_name":"ACM Transactions on Architecture and Code Optimization","issn_l":"1544-3566","issn":["1544-3566","1544-3973"],"is_oa":true,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319798","host_organization_name":"Association for Computing Machinery","host_organization_lineage":["https://openalex.org/P4310319798"],"host_organization_lineage_names":["Association for Computing Machinery"],"type":"journal"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ACM Transactions on Architecture and Code Optimization","raw_type":"journal-article"},"type":"article","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"diamond","oa_url":"https://doi.org/10.1145/3807957","any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":null,"display_name":"Kangkang Chen","orcid":"https://orcid.org/0000-0001-5128-6748"},"institutions":[{"id":"https://openalex.org/I170215575","display_name":"National University of Defense Technology","ror":"https://ror.org/05d2yfz11","country_code":"CN","type":"education","lineage":["https://openalex.org/I170215575"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Kangkang Chen","raw_affiliation_strings":["National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology"],"raw_orcid":"https://orcid.org/0000-0001-5128-6748","affiliations":[{"raw_affiliation_string":"National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology","institution_ids":["https://openalex.org/I170215575"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5070555846","display_name":"Huayou Su","orcid":"https://orcid.org/0000-0002-3587-0917"},"institutions":[{"id":"https://openalex.org/I170215575","display_name":"National University of Defense Technology","ror":"https://ror.org/05d2yfz11","country_code":"CN","type":"education","lineage":["https://openalex.org/I170215575"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Huayou Su","raw_affiliation_strings":["National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology"],"raw_orcid":"https://orcid.org/0000-0002-3587-0917","affiliations":[{"raw_affiliation_string":"National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology","institution_ids":["https://openalex.org/I170215575"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5101260171","display_name":"Xi Yang","orcid":"https://orcid.org/0000-0003-4675-5866"},"institutions":[{"id":"https://openalex.org/I170215575","display_name":"National University of Defense Technology","ror":"https://ror.org/05d2yfz11","country_code":"CN","type":"education","lineage":["https://openalex.org/I170215575"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Xi Yang","raw_affiliation_strings":["National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology"],"raw_orcid":"https://orcid.org/0000-0003-4675-5866","affiliations":[{"raw_affiliation_string":"National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology","institution_ids":["https://openalex.org/I170215575"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5133754891","display_name":"Zitong An","orcid":"https://orcid.org/0009-0002-2817-0573"},"institutions":[{"id":"https://openalex.org/I170215575","display_name":"National University of Defense Technology","ror":"https://ror.org/05d2yfz11","country_code":"CN","type":"education","lineage":["https://openalex.org/I170215575"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Zitong An","raw_affiliation_strings":["National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology"],"raw_orcid":"https://orcid.org/0009-0002-2817-0573","affiliations":[{"raw_affiliation_string":"National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology","institution_ids":["https://openalex.org/I170215575"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5051680867","display_name":"Yong Dou","orcid":"https://orcid.org/0000-0002-1256-8934"},"institutions":[{"id":"https://openalex.org/I170215575","display_name":"National University of Defense Technology","ror":"https://ror.org/05d2yfz11","country_code":"CN","type":"education","lineage":["https://openalex.org/I170215575"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Yong Dou","raw_affiliation_strings":["National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology"],"raw_orcid":"https://orcid.org/0000-0002-1256-8934","affiliations":[{"raw_affiliation_string":"National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology","institution_ids":["https://openalex.org/I170215575"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5133814705","display_name":"Dongsheng Li","orcid":"https://orcid.org/0009-0006-2765-8541"},"institutions":[{"id":"https://openalex.org/I170215575","display_name":"National University of Defense Technology","ror":"https://ror.org/05d2yfz11","country_code":"CN","type":"education","lineage":["https://openalex.org/I170215575"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Dongsheng Li","raw_affiliation_strings":["National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology"],"raw_orcid":"https://orcid.org/0009-0006-2765-8541","affiliations":[{"raw_affiliation_string":"National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology","institution_ids":["https://openalex.org/I170215575"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I170215575"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.43421811,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":"23","issue":"2","first_page":"1","last_page":"25"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11273","display_name":"Advanced Graph Neural Networks","score":0.6013000011444092,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11273","display_name":"Advanced Graph Neural Networks","score":0.6013000011444092,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12292","display_name":"Graph Theory and Algorithms","score":0.33309999108314514,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T14347","display_name":"Big Data and Digital Economy","score":0.008100000210106373,"subfield":{"id":"https://openalex.org/subfields/1710","display_name":"Information Systems"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/speedup","display_name":"Speedup","score":0.5878999829292297},{"id":"https://openalex.org/keywords/matrix-multiplication","display_name":"Matrix multiplication","score":0.5356000065803528},{"id":"https://openalex.org/keywords/computation","display_name":"Computation","score":0.4878000020980835},{"id":"https://openalex.org/keywords/implementation","display_name":"Implementation","score":0.4318999946117401},{"id":"https://openalex.org/keywords/data-flow-analysis","display_name":"Data-flow analysis","score":0.42750000953674316},{"id":"https://openalex.org/keywords/graph","display_name":"Graph","score":0.42149999737739563},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.4027999937534332},{"id":"https://openalex.org/keywords/workload","display_name":"Workload","score":0.4000999927520752}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8955000042915344},{"id":"https://openalex.org/C68339613","wikidata":"https://www.wikidata.org/wiki/Q1549489","display_name":"Speedup","level":2,"score":0.5878999829292297},{"id":"https://openalex.org/C17349429","wikidata":"https://www.wikidata.org/wiki/Q1049914","display_name":"Matrix multiplication","level":3,"score":0.5356000065803528},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.5303000211715698},{"id":"https://openalex.org/C45374587","wikidata":"https://www.wikidata.org/wiki/Q12525525","display_name":"Computation","level":2,"score":0.4878000020980835},{"id":"https://openalex.org/C26713055","wikidata":"https://www.wikidata.org/wiki/Q245962","display_name":"Implementation","level":2,"score":0.4318999946117401},{"id":"https://openalex.org/C88468194","wikidata":"https://www.wikidata.org/wiki/Q1172416","display_name":"Data-flow analysis","level":3,"score":0.42750000953674316},{"id":"https://openalex.org/C132525143","wikidata":"https://www.wikidata.org/wiki/Q141488","display_name":"Graph","level":2,"score":0.42149999737739563},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.4027999937534332},{"id":"https://openalex.org/C2778476105","wikidata":"https://www.wikidata.org/wiki/Q628539","display_name":"Workload","level":2,"score":0.4000999927520752},{"id":"https://openalex.org/C113775141","wikidata":"https://www.wikidata.org/wiki/Q428691","display_name":"Computer engineering","level":1,"score":0.374099999666214},{"id":"https://openalex.org/C48903430","wikidata":"https://www.wikidata.org/wiki/Q491370","display_name":"Graph partition","level":3,"score":0.37310001254081726},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.3521000146865845},{"id":"https://openalex.org/C2778915421","wikidata":"https://www.wikidata.org/wiki/Q3643177","display_name":"Performance improvement","level":2,"score":0.3474000096321106},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.3402999937534332},{"id":"https://openalex.org/C2780595030","wikidata":"https://www.wikidata.org/wiki/Q3860309","display_name":"Multiplication (music)","level":2,"score":0.32589998841285706},{"id":"https://openalex.org/C80444323","wikidata":"https://www.wikidata.org/wiki/Q2878974","display_name":"Theoretical computer science","level":1,"score":0.31949999928474426},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.28189998865127563},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.2745000123977661},{"id":"https://openalex.org/C162319229","wikidata":"https://www.wikidata.org/wiki/Q175263","display_name":"Data structure","level":2,"score":0.27320000529289246},{"id":"https://openalex.org/C139571649","wikidata":"https://www.wikidata.org/wiki/Q1156793","display_name":"Program optimization","level":3,"score":0.26980000734329224},{"id":"https://openalex.org/C56372850","wikidata":"https://www.wikidata.org/wiki/Q1050404","display_name":"Sparse matrix","level":3,"score":0.2644999921321869},{"id":"https://openalex.org/C83283714","wikidata":"https://www.wikidata.org/wiki/Q121117","display_name":"Supercomputer","level":2,"score":0.26409998536109924},{"id":"https://openalex.org/C42812","wikidata":"https://www.wikidata.org/wiki/Q1082910","display_name":"Partition (number theory)","level":2,"score":0.25920000672340393},{"id":"https://openalex.org/C67953723","wikidata":"https://www.wikidata.org/wiki/Q192525","display_name":"Workstation","level":2,"score":0.2572999894618988},{"id":"https://openalex.org/C124101348","wikidata":"https://www.wikidata.org/wiki/Q172491","display_name":"Data mining","level":1,"score":0.25130000710487366}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1145/3807957","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3807957","pdf_url":null,"source":{"id":"https://openalex.org/S26056741","display_name":"ACM Transactions on Architecture and Code Optimization","issn_l":"1544-3566","issn":["1544-3566","1544-3973"],"is_oa":true,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319798","host_organization_name":"Association for Computing Machinery","host_organization_lineage":["https://openalex.org/P4310319798"],"host_organization_lineage_names":["Association for Computing Machinery"],"type":"journal"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ACM Transactions on Architecture and Code Optimization","raw_type":"journal-article"}],"best_oa_location":{"id":"doi:10.1145/3807957","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3807957","pdf_url":null,"source":{"id":"https://openalex.org/S26056741","display_name":"ACM Transactions on Architecture and Code Optimization","issn_l":"1544-3566","issn":["1544-3566","1544-3973"],"is_oa":true,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319798","host_organization_name":"Association for Computing Machinery","host_organization_lineage":["https://openalex.org/P4310319798"],"host_organization_lineage_names":["Association for Computing Machinery"],"type":"journal"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ACM Transactions on Architecture and Code Optimization","raw_type":"journal-article"},"sustainable_development_goals":[],"awards":[{"id":"https://openalex.org/G1702756715","display_name":null,"funder_award_id":"2022YFB4501400","funder_id":"https://openalex.org/F4320335777","funder_display_name":"National Key Research and Development Program of China"}],"funders":[{"id":"https://openalex.org/F4320335777","display_name":"National Key Research and Development Program of China","ror":null}],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":26,"referenced_works":["https://openalex.org/W1983157164","https://openalex.org/W2084379367","https://openalex.org/W2252007067","https://openalex.org/W2907492528","https://openalex.org/W2914721378","https://openalex.org/W2963653811","https://openalex.org/W2964337156","https://openalex.org/W2964915865","https://openalex.org/W3105753905","https://openalex.org/W3132185085","https://openalex.org/W3157805807","https://openalex.org/W3166510811","https://openalex.org/W3173204484","https://openalex.org/W3206504463","https://openalex.org/W3210601829","https://openalex.org/W4212836229","https://openalex.org/W4244254628","https://openalex.org/W4327503242","https://openalex.org/W4385567729","https://openalex.org/W4385819934","https://openalex.org/W4392251585","https://openalex.org/W4394923015","https://openalex.org/W4396571432","https://openalex.org/W4396628137","https://openalex.org/W4399208305","https://openalex.org/W4402044234"],"related_works":[],"abstract_inverted_index":{"Graph":[0,113],"Neural":[1],"Networks":[2],"(GNNs)":[3],"are":[4,27],"becoming":[5],"increasingly":[6],"popular":[7,177],"in":[8,17],"graph":[9,21],"data":[10,78,140],"processing":[11,127],"due":[12],"to":[13,24,138,147,214,221],"their":[14],"excellent":[15],"performance":[16,58,72],"feature":[18],"extraction":[19],"on":[20,45,62,129,180,188],"datasets.":[22],"Compared":[23,220],"GPUs,":[25],"CPUs":[26,46,64],"more":[28],"widely":[29],"accessible":[30],"and":[31,54,82,111,142,191,211,217,232],"serve":[32],"as":[33],"a":[34,48,94,108,133,143],"practical":[35],"platform":[36],"for":[37,100,152,165],"GNN":[38,43,60,178,201],"inference.":[39],"However,":[40],"achieving":[41],"efficient":[42,159],"execution":[44],"remains":[47],"challenge.":[49],"We":[50,169],"first":[51],"comprehensively":[52],"evaluate":[53,170],"quantitatively":[55],"analyze":[56],"the":[57,66,101,121,149,153,166,171,199],"of":[59,96,124,208,229],"inference":[61],"multi-core":[63,131,183],"using":[65],"state-of-the-art":[67,200],"frameworks,":[68],"identifying":[69],"four":[70],"key":[71],"bottlenecks:":[73],"inefficient":[74,83],"sparse":[75],"computation,":[76],"poor":[77],"locality,":[79,141],"workload":[80],"imbalance,":[81],"General":[84],"Matrix":[85,115],"Multiplication":[86,116],"(GEMM).":[87],"To":[88],"tackle":[89],"these":[90],"issues,":[91],"we":[92,104,156],"introduce":[93],"set":[95],"joint":[97],"optimizations.":[98],"Specifically,":[99],"aggregation":[102],"phase,":[103,155],"propose":[105],"three":[106,176,181],"optimizations:":[107],"register":[109],"padding":[110],"tiling":[112],"Sparse-dense":[114],"(GSpMM)":[117],"algorithm":[118],"that":[119,195],"leverages":[120],"computation":[122],"capability":[123],"long":[125],"vector":[126],"units":[128],"modern":[130],"CPUs,":[132],"destination":[134],"node-oriented":[135],"indexes":[136],"reorganization":[137],"enhance":[139],"boundary":[144],"buffer-based":[145],"method":[146],"balance":[148],"workloads.":[150],"Additionally,":[151],"update":[154],"develop":[157],"an":[158,205,226],"bias":[160],"fusion":[161],"GEMM":[162],"algorithm,":[163],"tailored":[164],"irregular":[167],"matrices.":[168],"proposed":[172],"optimizations":[173,197],"extensively":[174],"with":[175],"models":[179],"typical":[182],"CPU":[184],"platforms.":[185],"Experimental":[186],"results":[187],"Intel,":[189],"AMD,":[190],"ARM":[192],"platforms":[193],"show":[194],"our":[196,223],"outperform":[198],"framework":[202],"DGL":[203],"by":[204],"average":[206,227],"factor":[207],"2.41\u00d7,":[209],"1.58\u00d7,":[210],"2.04\u00d7":[212],"(up":[213],"4.75\u00d7,":[215],"2.70\u00d7,":[216],"3.55\u00d7),":[218],"respectively.":[219,234],"PyG,":[222],"implementations":[224],"achieve":[225],"speedup":[228],"1.70\u00d7,":[230],"1.86\u00d7,":[231],"2.44\u00d7,":[233]},"counts_by_year":[],"updated_date":"2026-06-26T06:17:10.115597","created_date":"2026-04-17T00:00:00"}
