{"id":"https://openalex.org/W4386707654","doi":"https://doi.org/10.1145/3605573.3605647","title":"CoTrain: Efficient Scheduling for Large-Model Training upon GPU and CPU in Parallel","display_name":"CoTrain: Efficient Scheduling for Large-Model Training upon GPU and CPU in Parallel","publication_year":2023,"publication_date":"2023-08-07","ids":{"openalex":"https://openalex.org/W4386707654","doi":"https://doi.org/10.1145/3605573.3605647"},"language":"en","primary_location":{"id":"doi:10.1145/3605573.3605647","is_oa":false,"landing_page_url":"https://doi.org/10.1145/3605573.3605647","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 52nd International Conference on Parallel Processing","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5103242451","display_name":"Zhenxing Li","orcid":"https://orcid.org/0009-0001-8029-5165"},"institutions":[{"id":"https://openalex.org/I47720641","display_name":"Huazhong University of Science and Technology","ror":"https://ror.org/00p991c53","country_code":"CN","type":"education","lineage":["https://openalex.org/I47720641"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Zhenxing Li","raw_affiliation_strings":["Huazhong University of Science and Technology, China"],"raw_orcid":"https://orcid.org/0009-0001-8029-5165","affiliations":[{"raw_affiliation_string":"Huazhong University of Science and Technology, China","institution_ids":["https://openalex.org/I47720641"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5065846003","display_name":"Qiang Cao","orcid":"https://orcid.org/0000-0001-9124-0533"},"institutions":[{"id":"https://openalex.org/I47720641","display_name":"Huazhong University of Science and Technology","ror":"https://ror.org/00p991c53","country_code":"CN","type":"education","lineage":["https://openalex.org/I47720641"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Qiang Cao","raw_affiliation_strings":["Huazhong University of Science and Technology, China"],"raw_orcid":"https://orcid.org/0000-0001-9124-0533","affiliations":[{"raw_affiliation_string":"Huazhong University of Science and Technology, China","institution_ids":["https://openalex.org/I47720641"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5082048166","display_name":"Yajie Chen","orcid":"https://orcid.org/0009-0001-3036-6527"},"institutions":[{"id":"https://openalex.org/I36399199","display_name":"Nanjing University of Science and Technology","ror":"https://ror.org/00xp9wg62","country_code":"CN","type":"education","lineage":["https://openalex.org/I36399199"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Yajie Chen","raw_affiliation_strings":["Nanjing University of Science and Technology, China"],"raw_orcid":"https://orcid.org/0009-0001-3036-6527","affiliations":[{"raw_affiliation_string":"Nanjing University of Science and Technology, China","institution_ids":["https://openalex.org/I36399199"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5025362574","display_name":"Wenrui Yan","orcid":"https://orcid.org/0000-0003-4706-9729"},"institutions":[{"id":"https://openalex.org/I4391012619","display_name":"Shanghai Artificial Intelligence Laboratory","ror":"https://ror.org/03wkvpx79","country_code":"CN","type":"facility","lineage":["https://openalex.org/I4391012619"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Wenrui Yan","raw_affiliation_strings":["Shanghai AI Laboratory, China"],"raw_orcid":"https://orcid.org/0000-0003-4706-9729","affiliations":[{"raw_affiliation_string":"Shanghai AI Laboratory, China","institution_ids":["https://openalex.org/I4391012619"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":3,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":10,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"92","last_page":"101"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10036","display_name":"Advanced Neural Network Applications","score":0.9980000257492065,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10036","display_name":"Advanced Neural Network Applications","score":0.9980000257492065,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.996999979019165,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.9937999844551086,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.8214308023452759},{"id":"https://openalex.org/keywords/parallel-computing","display_name":"Parallel computing","score":0.7491128444671631},{"id":"https://openalex.org/keywords/scheduling","display_name":"Scheduling (production processes)","score":0.588783860206604},{"id":"https://openalex.org/keywords/cpu-shielding","display_name":"CPU shielding","score":0.4886961281299591},{"id":"https://openalex.org/keywords/cuda","display_name":"CUDA","score":0.4502812623977661},{"id":"https://openalex.org/keywords/general-purpose-computing-on-graphics-processing-units","display_name":"General-purpose computing on graphics processing units","score":0.44814229011535645},{"id":"https://openalex.org/keywords/processor-scheduling","display_name":"Processor scheduling","score":0.4405430555343628},{"id":"https://openalex.org/keywords/central-processing-unit","display_name":"Central processing unit","score":0.3814571499824524},{"id":"https://openalex.org/keywords/operating-system","display_name":"Operating system","score":0.20582541823387146},{"id":"https://openalex.org/keywords/schedule","display_name":"Schedule","score":0.15709656476974487},{"id":"https://openalex.org/keywords/graphics","display_name":"Graphics","score":0.06218302249908447},{"id":"https://openalex.org/keywords/mathematical-optimization","display_name":"Mathematical optimization","score":0.0515919029712677},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.05026507377624512}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8214308023452759},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.7491128444671631},{"id":"https://openalex.org/C206729178","wikidata":"https://www.wikidata.org/wiki/Q2271896","display_name":"Scheduling (production processes)","level":2,"score":0.588783860206604},{"id":"https://openalex.org/C180613757","wikidata":"https://www.wikidata.org/wiki/Q5013757","display_name":"CPU shielding","level":3,"score":0.4886961281299591},{"id":"https://openalex.org/C2778119891","wikidata":"https://www.wikidata.org/wiki/Q477690","display_name":"CUDA","level":2,"score":0.4502812623977661},{"id":"https://openalex.org/C50630238","wikidata":"https://www.wikidata.org/wiki/Q971505","display_name":"General-purpose computing on graphics processing units","level":3,"score":0.44814229011535645},{"id":"https://openalex.org/C2984822820","wikidata":"https://www.wikidata.org/wiki/Q1123036","display_name":"Processor scheduling","level":3,"score":0.4405430555343628},{"id":"https://openalex.org/C49154492","wikidata":"https://www.wikidata.org/wiki/Q5300","display_name":"Central processing unit","level":2,"score":0.3814571499824524},{"id":"https://openalex.org/C111919701","wikidata":"https://www.wikidata.org/wiki/Q9135","display_name":"Operating system","level":1,"score":0.20582541823387146},{"id":"https://openalex.org/C68387754","wikidata":"https://www.wikidata.org/wiki/Q7271585","display_name":"Schedule","level":2,"score":0.15709656476974487},{"id":"https://openalex.org/C21442007","wikidata":"https://www.wikidata.org/wiki/Q1027879","display_name":"Graphics","level":2,"score":0.06218302249908447},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.0515919029712677},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.05026507377624512}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1145/3605573.3605647","is_oa":false,"landing_page_url":"https://doi.org/10.1145/3605573.3605647","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 52nd International Conference on Parallel Processing","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Affordable and clean energy","id":"https://metadata.un.org/sdg/7","score":0.5699999928474426}],"awards":[{"id":"https://openalex.org/G226297826","display_name":null,"funder_award_id":"No.2018YFA0701800","funder_id":"https://openalex.org/F4320335777","funder_display_name":"National Key Research and Development Program of China"}],"funders":[{"id":"https://openalex.org/F4320335777","display_name":"National Key Research and Development Program of China","ror":null}],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":17,"referenced_works":["https://openalex.org/W114517082","https://openalex.org/W2734941459","https://openalex.org/W2901299405","https://openalex.org/W2963446712","https://openalex.org/W2969388332","https://openalex.org/W2970971581","https://openalex.org/W3010830594","https://openalex.org/W3012514909","https://openalex.org/W3081168214","https://openalex.org/W3116059414","https://openalex.org/W3129831491","https://openalex.org/W3205803342","https://openalex.org/W4287594180","https://openalex.org/W4301361180","https://openalex.org/W6713134421","https://openalex.org/W6750715941","https://openalex.org/W6778883912"],"related_works":["https://openalex.org/W2387982802","https://openalex.org/W1896942098","https://openalex.org/W1963859303","https://openalex.org/W2364044215","https://openalex.org/W2389600408","https://openalex.org/W240129890","https://openalex.org/W3048701459","https://openalex.org/W1991061790","https://openalex.org/W2088078730","https://openalex.org/W2061938028"],"abstract_inverted_index":{"The":[0,171],"parameters":[1],"of":[2,32,74,136,148],"deep":[3],"learning":[4],"(DL)":[5],"have":[6],"ballooned":[7],"from":[8],"millions":[9],"to":[10,36,44,105,119,139,142,176,193],"trillions":[11],"over":[12],"the":[13,29,50,70,80,84,129,177,185,197],"past":[14],"decade,":[15],"thus":[16,38,63,144],"cannot":[17],"be":[18,88],"fully":[19],"placed":[20],"in":[21,184],"a":[22,100,107,134],"limited":[23],"GPU":[24,91,115,140,150,158],"memory.":[25],"Existing":[26],"works":[27],"offload":[28],"parameter-update":[30,85,137],"stage":[31,51,59,82,86,138],"training":[33,46,186,198],"DL":[34,75],"model":[35],"CPU,":[37],"leveraging":[39],"CPU":[40,54,93,117,152],"capability":[41],"and":[42,72,77,83,92,110,116,118,125,151,159,163],"memory":[43],"support":[45],"large-scale":[47],"model.":[48],"However,":[49],"running":[52,60],"upon":[53,61,90],"could":[55],"block":[56],"its":[57,111],"following":[58],"GPU,":[62],"wasting":[64],"expensive":[65],"GPU-cycles.":[66],"We":[67,161],"first":[68],"analyze":[69],"dataflow":[71],"workflow":[73],"training,":[76],"find":[78],"that":[79,174],"backward":[81],"can":[87],"parallelized":[89],"respectively.":[94],"To":[95],"this":[96],"end,":[97],"we":[98],"present":[99],"DL-training":[101],"scheduling":[102],"framework,":[103],"CoTrain,":[104],"allocate":[106],"compute":[108],"task":[109],"corresponding":[112],"data":[113,155],"into":[114],"parallelize":[120],"them":[121],"effectively":[122],"at":[123],"coarse-grain":[124],"fine-grain":[126],"way.":[127],"Particularly,":[128],"fine-grained":[130],"task-partition":[131],"scheme":[132],"allocates":[133],"portion":[135],"according":[141],"data-reuse-distance,":[143],"largely":[145],"avoiding":[146],"idleness":[147],"both":[149],"while":[153,188],"reducing":[154],"movement":[156],"between":[157],"CPU.":[160],"build":[162],"evaluate":[164],"CoTrain":[165,180],"atop":[166],"PyTorch":[167],"under":[168],"representative":[169],"models.":[170],"results":[172],"show":[173],"compared":[175],"state-of-the-art":[178],"ZeRO-Offload,":[179],"achieves":[181],"30.4%":[182],"improvement":[183],"throughput":[187],"increasing":[189],"model-size":[190],"by":[191],"up":[192],"7%":[194],"without":[195],"changing":[196],"semantics.":[199]},"counts_by_year":[{"year":2026,"cited_by_count":2},{"year":2025,"cited_by_count":2},{"year":2024,"cited_by_count":6}],"updated_date":"2026-07-22T07:51:19.307946","created_date":"2025-10-10T00:00:00"}
