{"id":"https://openalex.org/W4414197909","doi":"https://doi.org/10.1109/dac63849.2025.11132423","title":"DARIS: An Oversubscribed Spatio-Temporal Scheduler for Real-Time DNN Inference on GPUs","display_name":"DARIS: An Oversubscribed Spatio-Temporal Scheduler for Real-Time DNN Inference on GPUs","publication_year":2025,"publication_date":"2025-06-22","ids":{"openalex":"https://openalex.org/W4414197909","doi":"https://doi.org/10.1109/dac63849.2025.11132423"},"language":"en","primary_location":{"id":"doi:10.1109/dac63849.2025.11132423","is_oa":false,"landing_page_url":"https://doi.org/10.1109/dac63849.2025.11132423","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 62nd ACM/IEEE Design Automation Conference (DAC)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5099172099","display_name":"Amir Fakhim Babaei","orcid":null},"institutions":[{"id":"https://openalex.org/I859038795","display_name":"Virginia Tech","ror":"https://ror.org/02smfhw86","country_code":"US","type":"education","lineage":["https://openalex.org/I859038795"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Amir Fakhim Babaei","raw_affiliation_strings":["Virginia Tech Arlington,Department of Electrical &#x0026; Computer Engineering,Virginia,USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Virginia Tech Arlington,Department of Electrical &#x0026; Computer Engineering,Virginia,USA","institution_ids":["https://openalex.org/I859038795"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5047344565","display_name":"Thidapat Chantem","orcid":"https://orcid.org/0000-0002-5688-5720"},"institutions":[{"id":"https://openalex.org/I859038795","display_name":"Virginia Tech","ror":"https://ror.org/02smfhw86","country_code":"US","type":"education","lineage":["https://openalex.org/I859038795"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Thidapat Chantem","raw_affiliation_strings":["Virginia Tech Arlington,Department of Electrical &#x0026; Computer Engineering,Virginia,USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Virginia Tech Arlington,Department of Electrical &#x0026; Computer Engineering,Virginia,USA","institution_ids":["https://openalex.org/I859038795"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I859038795"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":1,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"7"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10444","display_name":"Context-Aware Activity Recognition Systems","score":0.9294000267982483,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10444","display_name":"Context-Aware Activity Recognition Systems","score":0.9294000267982483,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12702","display_name":"Brain Tumor Detection and Classification","score":0.9006999731063843,"subfield":{"id":"https://openalex.org/subfields/2808","display_name":"Neurology"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/concurrency","display_name":"Concurrency","score":0.6644999980926514},{"id":"https://openalex.org/keywords/cuda","display_name":"CUDA","score":0.5781000256538391},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.578000009059906},{"id":"https://openalex.org/keywords/scheduling","display_name":"Scheduling (production processes)","score":0.5472000241279602},{"id":"https://openalex.org/keywords/deep-neural-networks","display_name":"Deep neural networks","score":0.5138000249862671},{"id":"https://openalex.org/keywords/throughput","display_name":"Throughput","score":0.474700003862381}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8773000240325928},{"id":"https://openalex.org/C193702766","wikidata":"https://www.wikidata.org/wiki/Q1414548","display_name":"Concurrency","level":2,"score":0.6644999980926514},{"id":"https://openalex.org/C2778119891","wikidata":"https://www.wikidata.org/wiki/Q477690","display_name":"CUDA","level":2,"score":0.5781000256538391},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.578000009059906},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.5532000064849854},{"id":"https://openalex.org/C206729178","wikidata":"https://www.wikidata.org/wiki/Q2271896","display_name":"Scheduling (production processes)","level":2,"score":0.5472000241279602},{"id":"https://openalex.org/C2984842247","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep neural networks","level":3,"score":0.5138000249862671},{"id":"https://openalex.org/C157764524","wikidata":"https://www.wikidata.org/wiki/Q1383412","display_name":"Throughput","level":3,"score":0.474700003862381},{"id":"https://openalex.org/C82876162","wikidata":"https://www.wikidata.org/wiki/Q17096504","display_name":"Latency (audio)","level":2,"score":0.47110000252723694},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.43549999594688416},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.4239000082015991},{"id":"https://openalex.org/C120314980","wikidata":"https://www.wikidata.org/wiki/Q180634","display_name":"Distributed computing","level":1,"score":0.4138000011444092},{"id":"https://openalex.org/C2989134064","wikidata":"https://www.wikidata.org/wiki/Q288510","display_name":"Execution time","level":2,"score":0.38830000162124634},{"id":"https://openalex.org/C2779304628","wikidata":"https://www.wikidata.org/wiki/Q3503480","display_name":"Face (sociological concept)","level":2,"score":0.3416999876499176},{"id":"https://openalex.org/C50630238","wikidata":"https://www.wikidata.org/wiki/Q971505","display_name":"General-purpose computing on graphics processing units","level":3,"score":0.33160001039505005},{"id":"https://openalex.org/C79403827","wikidata":"https://www.wikidata.org/wiki/Q3988","display_name":"Real-time computing","level":1,"score":0.3221000134944916},{"id":"https://openalex.org/C118524514","wikidata":"https://www.wikidata.org/wiki/Q173212","display_name":"Computer architecture","level":1,"score":0.3156999945640564},{"id":"https://openalex.org/C113775141","wikidata":"https://www.wikidata.org/wiki/Q428691","display_name":"Computer engineering","level":1,"score":0.2865999937057495},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.2728999853134155}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/dac63849.2025.11132423","is_oa":false,"landing_page_url":"https://doi.org/10.1109/dac63849.2025.11132423","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 62nd ACM/IEEE Design Automation Conference (DAC)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":21,"referenced_works":["https://openalex.org/W1901129140","https://openalex.org/W2183341477","https://openalex.org/W2194775991","https://openalex.org/W2952562115","https://openalex.org/W3097411828","https://openalex.org/W3159436656","https://openalex.org/W3170887803","https://openalex.org/W4200404225","https://openalex.org/W4312038612","https://openalex.org/W4312198993","https://openalex.org/W4313855892","https://openalex.org/W4316042033","https://openalex.org/W4379380535","https://openalex.org/W4387005975","https://openalex.org/W4389545344","https://openalex.org/W4390263770","https://openalex.org/W4390677227","https://openalex.org/W4391583807","https://openalex.org/W4392768326","https://openalex.org/W4394861161","https://openalex.org/W4401568379"],"related_works":[],"abstract_inverted_index":{"The":[0],"widespread":[1],"use":[2],"of":[3,124],"Deep":[4],"Neural":[5],"Networks":[6],"(DNNs)":[7],"is":[8],"limited":[9],"by":[10,69,87],"high":[11],"computational":[12],"demands,":[13],"especially":[14],"in":[15],"constrained":[16],"environments.":[17],"GPUs,":[18,40],"though":[19],"effective":[20],"accelerators,":[21],"often":[22],"face":[23],"underutilization":[24],"and":[25,44,50,64,90,95],"rely":[26],"on":[27],"coarse-grained":[28],"scheduling.":[29],"This":[30],"paper":[31],"introduces":[32],"DARIS,":[33],"a":[34,51],"priority-based":[35],"real-time":[36],"DNN":[37,77],"scheduler":[38],"for":[39,47,55],"utilizing":[41],"NVIDIA\u2019s":[42],"MPS":[43],"CUDA":[45],"streaming":[46],"spatial":[48],"sharing,":[49],"synchronization-based":[52],"staging":[53],"method":[54],"temporal":[56],"partitioning.":[57],"In":[58],"particular,":[59],"DARIS":[60,84],"improves":[61,85],"GPU":[62,67,80],"utilization":[63],"uniquely":[65],"analyzes":[66],"concurrency":[68],"oversubscribing":[70],"computing":[71],"resources.":[72],"It":[73],"also":[74],"supports":[75],"zero-delay":[76],"migration":[78],"between":[79],"partitions.":[81],"Experiments":[82],"show":[83],"throughput":[86],"$15":[88],"\\%$":[89,92],"$11.5":[91],"over":[93],"batching":[94],"state-of-the-art":[96],"schedulers,":[97],"respectively,":[98],"even":[99],"without":[100],"batching.":[101],"All":[102],"high-priority":[103],"tasks":[104,109],"meet":[105],"deadlines,":[106],"with":[107],"low-priority":[108,125],"having":[110],"under":[111],"2%":[112],"deadline":[113],"miss":[114],"rate.":[115],"High-priority":[116],"response":[117],"times":[118],"are":[119],"33%":[120],"better":[121],"than":[122],"those":[123],"tasks.":[126]},"counts_by_year":[{"year":2026,"cited_by_count":1}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
