{"id":"https://openalex.org/W7160643804","doi":"https://doi.org/10.48550/arxiv.2605.05496","title":"DICE: Enabling Efficient General-Purpose SIMT Execution with Statically Scheduled Coarse-Grained Reconfigurable Arrays","display_name":"DICE: Enabling Efficient General-Purpose SIMT Execution with Statically Scheduled Coarse-Grained Reconfigurable Arrays","publication_year":2026,"publication_date":"2026-05-06","ids":{"openalex":"https://openalex.org/W7160643804","doi":"https://doi.org/10.48550/arxiv.2605.05496"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.05496","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.05496","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.05496","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5135688817","display_name":"Jiayi Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Jiayi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135641777","display_name":"Ang Da Lu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Da Lu, Ang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135643453","display_name":"Zhichen Zeng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zeng, Zhichen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5135699771","display_name":"Ang Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Ang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.8479999899864197,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.8479999899864197,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10904","display_name":"Embedded Systems Design Techniques","score":0.06260000169277191,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T14347","display_name":"Big Data and Digital Economy","score":0.02669999934732914,"subfield":{"id":"https://openalex.org/subfields/1710","display_name":"Information Systems"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/control-flow","display_name":"Control flow","score":0.5386999845504761},{"id":"https://openalex.org/keywords/register-file","display_name":"Register file","score":0.529699981212616},{"id":"https://openalex.org/keywords/simd","display_name":"SIMD","score":0.47200000286102295},{"id":"https://openalex.org/keywords/control-reconfiguration","display_name":"Control reconfiguration","score":0.43880000710487366},{"id":"https://openalex.org/keywords/thread","display_name":"Thread (computing)","score":0.43050000071525574},{"id":"https://openalex.org/keywords/massively-parallel","display_name":"Massively parallel","score":0.4147000014781952},{"id":"https://openalex.org/keywords/overhead","display_name":"Overhead (engineering)","score":0.4041999876499176},{"id":"https://openalex.org/keywords/computation","display_name":"Computation","score":0.37790000438690186},{"id":"https://openalex.org/keywords/pipeline","display_name":"Pipeline (software)","score":0.3772999942302704}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8751000165939331},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.7669000029563904},{"id":"https://openalex.org/C160191386","wikidata":"https://www.wikidata.org/wiki/Q868299","display_name":"Control flow","level":2,"score":0.5386999845504761},{"id":"https://openalex.org/C117280010","wikidata":"https://www.wikidata.org/wiki/Q180944","display_name":"Register file","level":3,"score":0.529699981212616},{"id":"https://openalex.org/C150552126","wikidata":"https://www.wikidata.org/wiki/Q339387","display_name":"SIMD","level":2,"score":0.47200000286102295},{"id":"https://openalex.org/C119701452","wikidata":"https://www.wikidata.org/wiki/Q5165881","display_name":"Control reconfiguration","level":2,"score":0.43880000710487366},{"id":"https://openalex.org/C138101251","wikidata":"https://www.wikidata.org/wiki/Q213092","display_name":"Thread (computing)","level":2,"score":0.43050000071525574},{"id":"https://openalex.org/C190475519","wikidata":"https://www.wikidata.org/wiki/Q544384","display_name":"Massively parallel","level":2,"score":0.4147000014781952},{"id":"https://openalex.org/C2779960059","wikidata":"https://www.wikidata.org/wiki/Q7113681","display_name":"Overhead (engineering)","level":2,"score":0.4041999876499176},{"id":"https://openalex.org/C45374587","wikidata":"https://www.wikidata.org/wiki/Q12525525","display_name":"Computation","level":2,"score":0.37790000438690186},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.3772999942302704},{"id":"https://openalex.org/C22029948","wikidata":"https://www.wikidata.org/wiki/Q45089","display_name":"Dice","level":2,"score":0.3702000081539154},{"id":"https://openalex.org/C201410400","wikidata":"https://www.wikidata.org/wiki/Q1064412","display_name":"Multithreading","level":3,"score":0.36070001125335693},{"id":"https://openalex.org/C153247305","wikidata":"https://www.wikidata.org/wiki/Q835713","display_name":"Memory address","level":3,"score":0.35260000824928284},{"id":"https://openalex.org/C107598950","wikidata":"https://www.wikidata.org/wiki/Q259864","display_name":"Microarchitecture","level":2,"score":0.3273000121116638},{"id":"https://openalex.org/C149635348","wikidata":"https://www.wikidata.org/wiki/Q193040","display_name":"Embedded system","level":1,"score":0.3183000087738037},{"id":"https://openalex.org/C9390403","wikidata":"https://www.wikidata.org/wiki/Q3966","display_name":"Computer hardware","level":1,"score":0.3165000081062317},{"id":"https://openalex.org/C170723468","wikidata":"https://www.wikidata.org/wiki/Q182933","display_name":"x86","level":3,"score":0.29789999127388},{"id":"https://openalex.org/C2776834041","wikidata":"https://www.wikidata.org/wiki/Q25346349","display_name":"Execution model","level":2,"score":0.2964000105857849},{"id":"https://openalex.org/C82687282","wikidata":"https://www.wikidata.org/wiki/Q66221","display_name":"Auxiliary memory","level":2,"score":0.2957000136375427},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.2842000126838684},{"id":"https://openalex.org/C99138194","wikidata":"https://www.wikidata.org/wiki/Q183427","display_name":"Hash function","level":2,"score":0.28299999237060547},{"id":"https://openalex.org/C2778100165","wikidata":"https://www.wikidata.org/wiki/Q1589327","display_name":"Memory hierarchy","level":3,"score":0.27869999408721924},{"id":"https://openalex.org/C2742236","wikidata":"https://www.wikidata.org/wiki/Q924713","display_name":"Efficient energy use","level":2,"score":0.27709999680519104},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.27379998564720154},{"id":"https://openalex.org/C2779602883","wikidata":"https://www.wikidata.org/wiki/Q15544750","display_name":"Memory architecture","level":2,"score":0.2702000141143799},{"id":"https://openalex.org/C176649486","wikidata":"https://www.wikidata.org/wiki/Q2308807","display_name":"Memory management","level":3,"score":0.26669999957084656},{"id":"https://openalex.org/C162319229","wikidata":"https://www.wikidata.org/wiki/Q175263","display_name":"Data structure","level":2,"score":0.25369998812675476},{"id":"https://openalex.org/C118524514","wikidata":"https://www.wikidata.org/wiki/Q173212","display_name":"Computer architecture","level":1,"score":0.25279998779296875},{"id":"https://openalex.org/C206729178","wikidata":"https://www.wikidata.org/wiki/Q2271896","display_name":"Scheduling (production processes)","level":2,"score":0.250900000333786}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.05496","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.05496","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.05496","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.05496","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.7291437387466431,"display_name":"Affordable and clean energy","id":"https://metadata.un.org/sdg/7"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"While":[0],"GPUs":[1],"dominate":[2],"massively":[3],"parallel":[4],"computing":[5],"through":[6],"the":[7,45,75,203,211,219],"single-instruction,":[8,15],"multiple-thread":[9],"(SIMT)":[10],"programming":[11],"model,":[12],"their":[13],"underlying":[14],"multiple-data":[16],"(SIMD)":[17],"execution":[18,229],"incurs":[19],"substantial":[20,232],"energy":[21,194,233],"overhead":[22],"from":[23,156],"frequent":[24],"register":[25,170],"file":[26,171],"(RF)":[27],"accesses":[28,88,172],"and":[29,103,145,180,196],"complex":[30],"control":[31,105],"logic.":[32],"We":[33],"present":[34],"DICE,":[35],"a":[36,71,146,188],"novel":[37],"architecture":[38],"that":[39,59,167,226],"addresses":[40],"these":[41],"inefficiencies":[42],"by":[43,116,173],"replacing":[44],"SIMD":[46,57],"backend":[47],"with":[48,95],"minimal-overhead,":[49],"statically":[50],"scheduled":[51],"coarse-grained":[52],"reconfigurable":[53],"arrays":[54],"(CGRAs).":[55],"Unlike":[56],"units":[58],"execute":[60],"warps":[61],"of":[62,191],"threads":[63,69],"in":[64,70,164],"lockstep,":[65],"DICE":[66,111,125,168,213,224],"dispatches":[67],"active":[68],"pipelined":[72,158],"manner":[73],"onto":[74],"CGRA":[76,123,184],"fabric,":[77],"where":[78],"data":[79],"flow":[80],"directly":[81],"between":[82],"processing":[83],"elements":[84],"(PEs),":[85],"reducing":[86],"RF":[87],"for":[89],"intermediate":[90],"values.":[91],"To":[92],"handle":[93],"operations":[94],"runtime":[96],"dynamism,":[97],"such":[98],"as":[99],"variable-latency":[100],"memory":[101,133,148,154,181],"loads":[102],"data-dependent":[104],"flow,":[106],"while":[107,210],"preserving":[108],"static":[109],"scheduling,":[110],"compiles":[112],"programs":[113],"into":[114],"\"p-graphs\"":[115],"partitioning":[117],"dynamic":[118,193],"dependence":[119],"edges":[120],"across":[121],"separate":[122],"configurations.":[124],"further":[126],"introduces":[127],"several":[128],"key":[129],"optimizations:":[130],"double-buffered":[131],"configuration":[132],"to":[134,141,152,202,218],"hide":[135],"reconfiguration":[136],"latency,":[137],"compile-time":[138],"p-graph":[139],"unrolling":[140],"enhance":[142],"resource":[143],"utilization,":[144],"temporal":[147],"coalescing":[149],"unit":[150],"(TMCU)":[151],"merge":[153],"requests":[155],"consecutive,":[157],"threads.":[159],"Evaluations":[160],"on":[161,175],"Rodinia":[162],"benchmarks":[163],"Accel-sim":[165],"demonstrate":[166],"reduces":[169],"68%":[174],"average.":[176],"With":[177],"equivalent":[178],"computation":[179],"resources,":[182],"DICE's":[183],"Processors":[185],"(CPs)":[186],"achieve":[187],"geometric":[189],"mean":[190],"1.77-1.90x":[192],"efficiency":[195],"42.0%-45.9%":[197],"average":[198],"power":[199],"reduction":[200],"compared":[201],"modeled":[204,220],"NVIDIA":[205],"Turing":[206,221],"Streaming":[207],"Multiprocessors":[208],"(SMs),":[209],"full":[212],"system":[214],"achieves":[215],"performance":[216],"comparable":[217],"GPU":[222],"baselines.":[223],"demonstrates":[225],"spatial":[227],"pipeline":[228],"can":[230],"deliver":[231],"savings":[234],"without":[235],"sacrificing":[236],"performance.":[237]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-05-09T00:00:00"}
