{"id":"https://openalex.org/W4406355567","doi":"https://doi.org/10.1109/ictc62082.2024.10827238","title":"Latency-Aware GPU Scheduling for DL Inference Tasks with Internal Resource Partitioning Strategy","display_name":"Latency-Aware GPU Scheduling for DL Inference Tasks with Internal Resource Partitioning Strategy","publication_year":2024,"publication_date":"2024-10-16","ids":{"openalex":"https://openalex.org/W4406355567","doi":"https://doi.org/10.1109/ictc62082.2024.10827238"},"language":"en","primary_location":{"id":"doi:10.1109/ictc62082.2024.10827238","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ictc62082.2024.10827238","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2024 15th International Conference on Information and Communication Technology Convergence (ICTC)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5100400958","display_name":"Taewoo Kim","orcid":"https://orcid.org/0000-0003-4290-6460"},"institutions":[{"id":"https://openalex.org/I157485424","display_name":"Korea Advanced Institute of Science and Technology","ror":"https://ror.org/05apxxy63","country_code":"KR","type":"education","lineage":["https://openalex.org/I157485424"]}],"countries":["KR"],"is_corresponding":false,"raw_author_name":"Taewoo Kim","raw_affiliation_strings":["School of Electrical Engineering KAIST,Deajeon,Korea"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"School of Electrical Engineering KAIST,Deajeon,Korea","institution_ids":["https://openalex.org/I157485424"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5100731256","display_name":"Changha Lee","orcid":"https://orcid.org/0000-0003-3687-2989"},"institutions":[{"id":"https://openalex.org/I157485424","display_name":"Korea Advanced Institute of Science and Technology","ror":"https://ror.org/05apxxy63","country_code":"KR","type":"education","lineage":["https://openalex.org/I157485424"]}],"countries":["KR"],"is_corresponding":false,"raw_author_name":"Changha Lee","raw_affiliation_strings":["School of Electrical Engineering KAIST,Deajeon,Korea"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"School of Electrical Engineering KAIST,Deajeon,Korea","institution_ids":["https://openalex.org/I157485424"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5112182690","display_name":"Chan-Hyun Youn","orcid":null},"institutions":[{"id":"https://openalex.org/I157485424","display_name":"Korea Advanced Institute of Science and Technology","ror":"https://ror.org/05apxxy63","country_code":"KR","type":"education","lineage":["https://openalex.org/I157485424"]}],"countries":["KR"],"is_corresponding":false,"raw_author_name":"Chan-Hyun Youn","raw_affiliation_strings":["School of Electrical Engineering KAIST,Deajeon,Korea"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"School of Electrical Engineering KAIST,Deajeon,Korea","institution_ids":["https://openalex.org/I157485424"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I157485424"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"295","last_page":"300"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10715","display_name":"Distributed and Parallel Computing Systems","score":0.996399998664856,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10715","display_name":"Distributed and Parallel Computing Systems","score":0.996399998664856,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.9890000224113464,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10904","display_name":"Embedded Systems Design Techniques","score":0.9628999829292297,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.8358893394470215},{"id":"https://openalex.org/keywords/latency","display_name":"Latency (audio)","score":0.695514976978302},{"id":"https://openalex.org/keywords/scheduling","display_name":"Scheduling (production processes)","score":0.652069628238678},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.6051502227783203},{"id":"https://openalex.org/keywords/processor-scheduling","display_name":"Processor scheduling","score":0.6016355752944946},{"id":"https://openalex.org/keywords/parallel-computing","display_name":"Parallel computing","score":0.46475139260292053},{"id":"https://openalex.org/keywords/distributed-computing","display_name":"Distributed computing","score":0.44799724221229553},{"id":"https://openalex.org/keywords/resource","display_name":"Resource (disambiguation)","score":0.34989166259765625},{"id":"https://openalex.org/keywords/computer-architecture","display_name":"Computer architecture","score":0.3366376757621765},{"id":"https://openalex.org/keywords/computer-network","display_name":"Computer network","score":0.25155359506607056},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.15717840194702148},{"id":"https://openalex.org/keywords/telecommunications","display_name":"Telecommunications","score":0.07921543717384338}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8358893394470215},{"id":"https://openalex.org/C82876162","wikidata":"https://www.wikidata.org/wiki/Q17096504","display_name":"Latency (audio)","level":2,"score":0.695514976978302},{"id":"https://openalex.org/C206729178","wikidata":"https://www.wikidata.org/wiki/Q2271896","display_name":"Scheduling (production processes)","level":2,"score":0.652069628238678},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.6051502227783203},{"id":"https://openalex.org/C2984822820","wikidata":"https://www.wikidata.org/wiki/Q1123036","display_name":"Processor scheduling","level":3,"score":0.6016355752944946},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.46475139260292053},{"id":"https://openalex.org/C120314980","wikidata":"https://www.wikidata.org/wiki/Q180634","display_name":"Distributed computing","level":1,"score":0.44799724221229553},{"id":"https://openalex.org/C206345919","wikidata":"https://www.wikidata.org/wiki/Q20380951","display_name":"Resource (disambiguation)","level":2,"score":0.34989166259765625},{"id":"https://openalex.org/C118524514","wikidata":"https://www.wikidata.org/wiki/Q173212","display_name":"Computer architecture","level":1,"score":0.3366376757621765},{"id":"https://openalex.org/C31258907","wikidata":"https://www.wikidata.org/wiki/Q1301371","display_name":"Computer network","level":1,"score":0.25155359506607056},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.15717840194702148},{"id":"https://openalex.org/C76155785","wikidata":"https://www.wikidata.org/wiki/Q418","display_name":"Telecommunications","level":1,"score":0.07921543717384338},{"id":"https://openalex.org/C21547014","wikidata":"https://www.wikidata.org/wiki/Q1423657","display_name":"Operations management","level":1,"score":0.0},{"id":"https://openalex.org/C162324750","wikidata":"https://www.wikidata.org/wiki/Q8134","display_name":"Economics","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/ictc62082.2024.10827238","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ictc62082.2024.10827238","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2024 15th International Conference on Information and Communication Technology Convergence (ICTC)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":13,"referenced_works":["https://openalex.org/W1536680647","https://openalex.org/W1901129140","https://openalex.org/W2194775991","https://openalex.org/W2962946486","https://openalex.org/W2982083293","https://openalex.org/W2982157693","https://openalex.org/W3096831136","https://openalex.org/W3097411828","https://openalex.org/W4385245566","https://openalex.org/W6730956707","https://openalex.org/W6755207826","https://openalex.org/W6758474236","https://openalex.org/W6779103662"],"related_works":["https://openalex.org/W3128807919","https://openalex.org/W3176411177","https://openalex.org/W2128410848","https://openalex.org/W2118368532","https://openalex.org/W2102390841","https://openalex.org/W3047653192","https://openalex.org/W2096289371","https://openalex.org/W2126232624","https://openalex.org/W2434525066","https://openalex.org/W3140149227"],"abstract_inverted_index":{"With":[0],"advancements":[1],"in":[2,154,171],"architecture":[3],"and":[4,95,129,149,180,207],"open-source":[5],"foundation":[6],"models":[7],"extracting":[8],"general":[9],"knowledge,":[10],"many":[11],"developers":[12],"are":[13],"leveraging":[14],"deep":[15],"learning":[16],"(DL)":[17],"as":[18,92],"application":[19],"services.":[20],"To":[21],"coduct":[22],"computation-intensive":[23],"matrix":[24],"operations,":[25],"hardware":[26],"resources":[27,148,185],"with":[28,125],"numerous":[29],"parallel":[30,93],"cores":[31,94],"have":[32],"also":[33],"seen":[34],"significant":[35],"progress.":[36],"Due":[37],"to":[38,72,105,119,141,211],"the":[39,74,108,111,162,186,191],"high":[40],"operational":[41],"costs":[42],"of":[43,48,76,183,193],"such":[44,91],"resources,":[45,90],"efficient":[46],"processing":[47,85,143],"DL":[49,64,195],"tasks":[50,66,152,196],"has":[51,123],"become":[52],"crucial":[53],"for":[54,63],"computing":[55],"resource":[56,61],"providers.":[57],"Most":[58],"studies":[59],"on":[60,68],"management":[62],"inference":[65,84,101],"focus":[67],"adjusting":[69,176],"batch":[70,120,127,173,178],"sizes":[71,128],"control":[73],"efficiency":[75,144,209],"a":[77,99,137,155],"resource.":[78,109],"Different":[79],"from":[80],"training":[81],"tasks,":[82],"however,":[83],"uses":[86],"relatively":[87],"few":[88],"internal":[89,147,163,184],"memory":[96],"units.":[97],"Consequently,":[98],"single":[100,156],"task":[102],"often":[103],"fails":[104],"fully":[106],"utilize":[107],"Moreover,":[110],"latency":[112,159],"prediction":[113,169],"model,":[114],"which":[115],"is":[116],"linearly":[117],"proportional":[118],"size,":[121],"still":[122],"limitations":[124],"small":[126,172],"diverse":[130],"archi-tectures.":[131],"In":[132],"this":[133],"paper,":[134],"we":[135],"introduce":[136],"novel":[138],"GPU":[139],"scheduler":[140,188],"improve":[142],"by":[145],"partitioning":[146],"executing":[150],"multiple":[151],"simultaneously":[153],"GPU.":[157],"Our":[158],"model":[160],"considers":[161],"kernel":[164],"operation":[165],"distribution,":[166],"enabling":[167],"precise":[168],"even":[170],"sizes.":[174],"By":[175],"both":[177],"size":[179],"usage":[181],"ratio":[182],"proposed":[187],"can":[189],"achieve":[190],"coexistence":[192],"multi-tenant":[194],"effectively.":[197],"Experimental":[198],"evaluations":[199],"demonstrate":[200],"that":[201],"our":[202],"approach":[203],"achieves":[204],"higher":[205],"throughput":[206],"power":[208],"compared":[210],"conventional":[212],"scheduling":[213],"mechanisms.":[214]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
