{"id":"https://openalex.org/W4385765144","doi":"https://doi.org/10.1145/3589013.3596678","title":"Accelerating Performance of GPU-based Workloads Using CXL","display_name":"Accelerating Performance of GPU-based Workloads Using CXL","publication_year":2023,"publication_date":"2023-08-10","ids":{"openalex":"https://openalex.org/W4385765144","doi":"https://doi.org/10.1145/3589013.3596678"},"language":"en","primary_location":{"id":"doi:10.1145/3589013.3596678","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3589013.3596678","pdf_url":"https://dl.acm.org/doi/pdf/10.1145/3589013.3596678","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 13th Workshop on AI and Scientific Computing at Scale using Flexible Computing","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://dl.acm.org/doi/pdf/10.1145/3589013.3596678","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5017707472","display_name":"Moiz Arif","orcid":"https://orcid.org/0000-0002-8823-5562"},"institutions":[{"id":"https://openalex.org/I155173764","display_name":"Rochester Institute of Technology","ror":"https://ror.org/00v4yb702","country_code":"US","type":"education","lineage":["https://openalex.org/I155173764"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Moiz Arif","raw_affiliation_strings":["Rochester Institute of Technology, Rochester, NY, USA"],"raw_orcid":"https://orcid.org/0000-0002-8823-5562","affiliations":[{"raw_affiliation_string":"Rochester Institute of Technology, Rochester, NY, USA","institution_ids":["https://openalex.org/I155173764"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5049218913","display_name":"Avinash Maurya","orcid":"https://orcid.org/0000-0002-8200-0148"},"institutions":[{"id":"https://openalex.org/I155173764","display_name":"Rochester Institute of Technology","ror":"https://ror.org/00v4yb702","country_code":"US","type":"education","lineage":["https://openalex.org/I155173764"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Avinash Maurya","raw_affiliation_strings":["Rochester Institute of Technology, Rochester, NY, USA"],"raw_orcid":"https://orcid.org/0000-0002-8200-0148","affiliations":[{"raw_affiliation_string":"Rochester Institute of Technology, Rochester, NY, USA","institution_ids":["https://openalex.org/I155173764"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5054011637","display_name":"M. Mustafa Rafique","orcid":"https://orcid.org/0000-0002-5034-2880"},"institutions":[{"id":"https://openalex.org/I155173764","display_name":"Rochester Institute of Technology","ror":"https://ror.org/00v4yb702","country_code":"US","type":"education","lineage":["https://openalex.org/I155173764"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"M. Mustafa Rafique","raw_affiliation_strings":["Rochester Institute of Technology, Rochester, NY, USA"],"raw_orcid":"https://orcid.org/0000-0002-5034-2880","affiliations":[{"raw_affiliation_string":"Rochester Institute of Technology, Rochester, NY, USA","institution_ids":["https://openalex.org/I155173764"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I155173764"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":true,"cited_by_count":6,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"27","last_page":"31"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11181","display_name":"Advanced Data Storage Technologies","score":0.9997000098228455,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10101","display_name":"Cloud Computing and Resource Management","score":0.9994000196456909,"subfield":{"id":"https://openalex.org/subfields/1710","display_name":"Information Systems"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.8755525350570679},{"id":"https://openalex.org/keywords/host","display_name":"Host (biology)","score":0.5055253505706787},{"id":"https://openalex.org/keywords/throughput","display_name":"Throughput","score":0.45752084255218506},{"id":"https://openalex.org/keywords/parallel-computing","display_name":"Parallel computing","score":0.4547152519226074},{"id":"https://openalex.org/keywords/latency","display_name":"Latency (audio)","score":0.43919339776039124},{"id":"https://openalex.org/keywords/interleaved-memory","display_name":"Interleaved memory","score":0.41874635219573975},{"id":"https://openalex.org/keywords/memory-management","display_name":"Memory management","score":0.3924928307533264},{"id":"https://openalex.org/keywords/semiconductor-memory","display_name":"Semiconductor memory","score":0.274588942527771},{"id":"https://openalex.org/keywords/operating-system","display_name":"Operating system","score":0.26367586851119995},{"id":"https://openalex.org/keywords/wireless","display_name":"Wireless","score":0.10114273428916931}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8755525350570679},{"id":"https://openalex.org/C126831891","wikidata":"https://www.wikidata.org/wiki/Q221673","display_name":"Host (biology)","level":2,"score":0.5055253505706787},{"id":"https://openalex.org/C157764524","wikidata":"https://www.wikidata.org/wiki/Q1383412","display_name":"Throughput","level":3,"score":0.45752084255218506},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.4547152519226074},{"id":"https://openalex.org/C82876162","wikidata":"https://www.wikidata.org/wiki/Q17096504","display_name":"Latency (audio)","level":2,"score":0.43919339776039124},{"id":"https://openalex.org/C63511323","wikidata":"https://www.wikidata.org/wiki/Q908936","display_name":"Interleaved memory","level":4,"score":0.41874635219573975},{"id":"https://openalex.org/C176649486","wikidata":"https://www.wikidata.org/wiki/Q2308807","display_name":"Memory management","level":3,"score":0.3924928307533264},{"id":"https://openalex.org/C98986596","wikidata":"https://www.wikidata.org/wiki/Q1143031","display_name":"Semiconductor memory","level":2,"score":0.274588942527771},{"id":"https://openalex.org/C111919701","wikidata":"https://www.wikidata.org/wiki/Q9135","display_name":"Operating system","level":1,"score":0.26367586851119995},{"id":"https://openalex.org/C555944384","wikidata":"https://www.wikidata.org/wiki/Q249","display_name":"Wireless","level":2,"score":0.10114273428916931},{"id":"https://openalex.org/C86803240","wikidata":"https://www.wikidata.org/wiki/Q420","display_name":"Biology","level":0,"score":0.0},{"id":"https://openalex.org/C18903297","wikidata":"https://www.wikidata.org/wiki/Q7150","display_name":"Ecology","level":1,"score":0.0},{"id":"https://openalex.org/C76155785","wikidata":"https://www.wikidata.org/wiki/Q418","display_name":"Telecommunications","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1145/3589013.3596678","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3589013.3596678","pdf_url":"https://dl.acm.org/doi/pdf/10.1145/3589013.3596678","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 13th Workshop on AI and Scientific Computing at Scale using Flexible Computing","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.1145/3589013.3596678","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3589013.3596678","pdf_url":"https://dl.acm.org/doi/pdf/10.1145/3589013.3596678","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 13th Workshop on AI and Scientific Computing at Scale using Flexible Computing","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[{"id":"https://openalex.org/G2131453672","display_name":"Collaborative Research: CNS Core: Medium:HardLambda: A new FaaS Abstraction for Cross-Stack Resource Management in Disaggregated Datacenters","funder_award_id":"2106635","funder_id":"https://openalex.org/F4320306076","funder_display_name":"National Science Foundation"},{"id":"https://openalex.org/G4535588230","display_name":null,"funder_award_id":"2106634, 2106635","funder_id":"https://openalex.org/F4320306076","funder_display_name":"National Science Foundation"},{"id":"https://openalex.org/G7581022229","display_name":null,"funder_award_id":"2106634/2106635","funder_id":"https://openalex.org/F4320306076","funder_display_name":"National Science Foundation"},{"id":"https://openalex.org/G8515454090","display_name":"Collaborative Research: CNS Core: Medium:HardLambda: A new FaaS Abstraction for Cross-Stack Resource Management in Disaggregated Datacenters","funder_award_id":"2106634","funder_id":"https://openalex.org/F4320306076","funder_display_name":"National Science Foundation"}],"funders":[{"id":"https://openalex.org/F4320306076","display_name":"National Science Foundation","ror":"https://ror.org/021nxhr62"}],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W4385765144.pdf","grobid_xml":"https://content.openalex.org/works/W4385765144.grobid-xml"},"referenced_works_count":14,"referenced_works":["https://openalex.org/W2592263880","https://openalex.org/W2791186466","https://openalex.org/W2949756009","https://openalex.org/W2953590165","https://openalex.org/W3114711045","https://openalex.org/W3174688441","https://openalex.org/W4281924108","https://openalex.org/W4282555269","https://openalex.org/W4312304862","https://openalex.org/W4316660797","https://openalex.org/W4318541517","https://openalex.org/W4319941941","https://openalex.org/W4320067983","https://openalex.org/W4327930439"],"related_works":["https://openalex.org/W2334181344","https://openalex.org/W2401095501","https://openalex.org/W2362277122","https://openalex.org/W2558276258","https://openalex.org/W2934889147","https://openalex.org/W4293054943","https://openalex.org/W2526783553","https://openalex.org/W4249130715","https://openalex.org/W4214748026","https://openalex.org/W1531461453"],"abstract_inverted_index":{"High-performance":[0],"computing":[1],"(HPC)":[2],"workloads":[3,45,64,105],"such":[4,150],"as":[5,204],"scientific":[6],"simulations":[7,186],"and":[8,18,92,112,146,154,168,193],"deep":[9],"learning":[10],"(DL)":[11],"running":[12,65,106],"across":[13,38,107],"multi-GPU":[14,108,152],"systems":[15,153],"are":[16],"memory":[17,24,31,48,56,62,87,118,147,181,209],"data-intensive,":[19],"relying":[20],"on":[21,49,59,66,130,149,162,185],"the":[22,39,50,60,70,84,124,131,139,160,163,170,207],"main":[23],"to":[25,110,128,142,158,198,206],"complement":[26],"its":[27],"limited":[28],"onboard":[29],"high-bandwidth":[30],"(HBM).":[32],"To":[33,134],"facilitate":[34],"faster":[35],"data":[36,125,172,201],"transfer":[37,173,202],"slow":[40],"device-to-host":[41],"PCIe":[42],"interconnects,":[43],"these":[44],"typically":[46],"pin":[47,113],"host":[51,61],"system,":[52],"thereby":[53],"creating":[54],"a":[55,96,188],"capacity":[57,88],"limitation":[58],"for":[63],"peer":[67],"GPUs":[68],"of":[69,178,187,190],"same":[71],"node.":[72],"Compute":[73],"express":[74],"link":[75],"(CXL)":[76],"is":[77],"an":[78,156],"emerging":[79],"technology":[80],"that":[81],"transparently":[82],"extends":[83],"available":[85],"system":[86,194],"at":[89],"low":[90],"latency":[91],"high":[93],"throughput":[94,126,167],"in":[95],"cache-coherent":[97],"fashion.":[98],"While":[99],"this":[100,135],"can":[101,121],"be":[102],"leveraged":[103],"by":[104],"nodes":[109],"allocate":[111],"more":[114],"memory,":[115,165],"using":[116],"conventional":[117,143],"allocation":[119,148,182,210],"schemes":[120],"adversely":[122],"impact":[123],"due":[127],"contention":[129,161],"CXL":[132,164],"memory.":[133],"end,":[136],"we":[137],"highlight":[138],"challenges":[140],"related":[141],"job":[144,191],"scheduling":[145],"CXL-enabled":[151],"propose":[155],"algorithm":[157],"mitigate":[159],"maximize":[166],"reduce":[169],"overall":[171],"time.":[174],"Our":[175],"preliminary":[176],"evaluation":[177],"our":[179],"proposed":[180],"approach":[183],"based":[184],"variety":[189],"profiles":[192],"configurations":[195],"demonstrates":[196],"up":[197],"65%":[199],"lower":[200],"overheads":[203],"compared":[205],"existing":[208],"approaches.":[211]},"counts_by_year":[{"year":2025,"cited_by_count":3},{"year":2024,"cited_by_count":1},{"year":2023,"cited_by_count":2}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
