{"id":"https://openalex.org/W4409248728","doi":"https://doi.org/10.1109/hpca61900.2025.00107","title":"Cooperative Warp Execution in Tensor Core for RISC-V GPGPU","display_name":"Cooperative Warp Execution in Tensor Core for RISC-V GPGPU","publication_year":2025,"publication_date":"2025-03-01","ids":{"openalex":"https://openalex.org/W4409248728","doi":"https://doi.org/10.1109/hpca61900.2025.00107"},"language":"en","primary_location":{"id":"doi:10.1109/hpca61900.2025.00107","is_oa":false,"landing_page_url":"https://doi.org/10.1109/hpca61900.2025.00107","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE International Symposium on High Performance Computer Architecture (HPCA)","raw_type":"proceedings-article"},"type":"article","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5117071312","display_name":"Abubakr Nada","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Abubakr Nada","raw_affiliation_strings":["imec"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"imec","institution_ids":[]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5000129571","display_name":"Giuseppe Maria Sarda","orcid":"https://orcid.org/0000-0001-6231-3553"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Giuseppe Maria Sarda","raw_affiliation_strings":["imec"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"imec","institution_ids":[]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5024667567","display_name":"Erwan Lenormand","orcid":"https://orcid.org/0000-0002-7383-6285"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Erwan Lenormand","raw_affiliation_strings":["imec"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"imec","institution_ids":[]}]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":3,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":5.2134,"has_fulltext":false,"cited_by_count":3,"citation_normalized_percentile":{"value":0.94448399,"is_in_top_1_percent":false,"is_in_top_10_percent":true},"cited_by_percentile_year":{"min":91,"max":99},"biblio":{"volume":null,"issue":null,"first_page":"1422","last_page":"1436"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.9926000237464905,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.9926000237464905,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10715","display_name":"Distributed and Parallel Computing Systems","score":0.9854999780654907,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12810","display_name":"Real-time simulation and control systems","score":0.9542999863624573,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7625696659088135},{"id":"https://openalex.org/keywords/parallel-computing","display_name":"Parallel computing","score":0.6674026250839233},{"id":"https://openalex.org/keywords/general-purpose-computing-on-graphics-processing-units","display_name":"General-purpose computing on graphics processing units","score":0.5910131931304932},{"id":"https://openalex.org/keywords/multi-core-processor","display_name":"Multi-core processor","score":0.5869064927101135},{"id":"https://openalex.org/keywords/computer-architecture","display_name":"Computer architecture","score":0.36082661151885986},{"id":"https://openalex.org/keywords/operating-system","display_name":"Operating system","score":0.2665058374404907},{"id":"https://openalex.org/keywords/graphics","display_name":"Graphics","score":0.11129403114318848}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7625696659088135},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.6674026250839233},{"id":"https://openalex.org/C50630238","wikidata":"https://www.wikidata.org/wiki/Q971505","display_name":"General-purpose computing on graphics processing units","level":3,"score":0.5910131931304932},{"id":"https://openalex.org/C78766204","wikidata":"https://www.wikidata.org/wiki/Q555032","display_name":"Multi-core processor","level":2,"score":0.5869064927101135},{"id":"https://openalex.org/C118524514","wikidata":"https://www.wikidata.org/wiki/Q173212","display_name":"Computer architecture","level":1,"score":0.36082661151885986},{"id":"https://openalex.org/C111919701","wikidata":"https://www.wikidata.org/wiki/Q9135","display_name":"Operating system","level":1,"score":0.2665058374404907},{"id":"https://openalex.org/C21442007","wikidata":"https://www.wikidata.org/wiki/Q1027879","display_name":"Graphics","level":2,"score":0.11129403114318848}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/hpca61900.2025.00107","is_oa":false,"landing_page_url":"https://doi.org/10.1109/hpca61900.2025.00107","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE International Symposium on High Performance Computer Architecture (HPCA)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":28,"referenced_works":["https://openalex.org/W1523401229","https://openalex.org/W1983235612","https://openalex.org/W2047060659","https://openalex.org/W2142444503","https://openalex.org/W2626312854","https://openalex.org/W2791673912","https://openalex.org/W2795002137","https://openalex.org/W2885918098","https://openalex.org/W2963989532","https://openalex.org/W2980186997","https://openalex.org/W3016542674","https://openalex.org/W3091804697","https://openalex.org/W3102337469","https://openalex.org/W3102510044","https://openalex.org/W3113606433","https://openalex.org/W3159607817","https://openalex.org/W3206171855","https://openalex.org/W3206857466","https://openalex.org/W4309672181","https://openalex.org/W4388283449","https://openalex.org/W4390189088","https://openalex.org/W4390280317","https://openalex.org/W4400409880","https://openalex.org/W4401328375","https://openalex.org/W6673062827","https://openalex.org/W6721281333","https://openalex.org/W6779824479","https://openalex.org/W6857972656"],"related_works":["https://openalex.org/W1993191611","https://openalex.org/W2023938924","https://openalex.org/W2918840249","https://openalex.org/W1991859582","https://openalex.org/W2110053126","https://openalex.org/W2079303253","https://openalex.org/W2104702637","https://openalex.org/W4248099758","https://openalex.org/W2979015021","https://openalex.org/W1980160788"],"abstract_inverted_index":{"The":[0,111],"rise":[1],"of":[2,89,104],"Deep":[3],"Neural":[4],"Networks":[5],"(DNNs)":[6],"has":[7],"amplified":[8],"the":[9,64,85,94,115,118,132,170,184],"demand":[10],"for":[11,43,73,107,177],"efficient":[12,26],"computation,":[13],"with":[14,34,101],"General":[15],"Matrix":[16],"Multiply":[17],"(GEMM)":[18],"operations":[19,179],"at":[20],"their":[21],"core.":[22],"While":[23],"ASICs":[24],"are":[25],"but":[27],"inflexible,":[28],"GPUs,":[29,32],"especially":[30],"NVIDIA":[31],"equipped":[33],"tensor":[35,77,91,126,133,162,171,186],"cores,":[36],"provide":[37],"a":[38,90,102,155],"flexible":[39],"yet":[40],"high-performance":[41],"solution":[42],"GEMM-based":[44],"workloads.":[45],"Previous":[46],"research":[47],"and":[48,56,70,87,125,141,180],"optimizations":[49],"have":[50],"largely":[51],"centered":[52],"on":[53,114],"NVIDIA\u2019s":[54],"architecture":[55],"programming":[57],"model,":[58],"which,":[59],"while":[60],"effective,":[61],"can":[62],"obscure":[63],"rationale":[65],"behind":[66],"certain":[67],"design":[68,86],"decisions":[69],"limit":[71],"flexibility":[72],"further":[74],"improvements":[75],"in":[76,138,161],"core":[78,92,127,134,172,187],"designs.":[79],"In":[80],"this":[81],"paper,":[82],"we":[83,153],"present":[84],"integration":[88,116],"into":[93],"open-source":[95],"RISC-V":[96],"Vortex":[97],"GPGPU":[98],"platform,":[99],"along":[100],"suite":[103],"intrinsics":[105],"designed":[106],"GEMM":[108,178],"kernel":[109],"generation.":[110],"analysis":[112],"conducted":[113],"elucidates":[117],"connections":[119],"between":[120],"GPU":[121],"system":[122],"architectural":[123],"parameters":[124],"configuration.":[128],"We":[129],"find":[130],"that":[131,142],"is":[135],"severely":[136],"under-utilized":[137],"many":[139],"cases":[140],"increased":[143],"compute":[144],"capacity":[145],"does":[146],"not":[147],"always":[148],"imply":[149],"better":[150],"performance.":[151],"Hence,":[152],"propose":[154],"novel":[156],"technique,":[157],"cooperative":[158],"warp":[159,167],"execution":[160],"core,":[163],"which":[164],"leverages":[165],"hardware-supported":[166],"cooperation":[168],"within":[169],"to":[173,191],"reduce":[174],"memory":[175],"requirements":[176],"boost":[181],"performance":[182],"over":[183],"baseline":[185],"implementation":[188],"by":[189],"up":[190],"3x.":[192]},"counts_by_year":[{"year":2026,"cited_by_count":2},{"year":2025,"cited_by_count":1}],"updated_date":"2026-06-11T09:08:48.828518","created_date":"2025-10-10T00:00:00"}
