{"id":"https://openalex.org/W3038086838","doi":"https://doi.org/10.1145/3369583.3392684","title":"Efficient GPU Memory Management for Nonlinear DNNs","display_name":"Efficient GPU Memory Management for Nonlinear DNNs","publication_year":2020,"publication_date":"2020-06-22","ids":{"openalex":"https://openalex.org/W3038086838","doi":"https://doi.org/10.1145/3369583.3392684","mag":"3038086838"},"language":"en","primary_location":{"id":"doi:10.1145/3369583.3392684","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3369583.3392684","pdf_url":"https://dl.acm.org/doi/pdf/10.1145/3369583.3392684","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 29th International Symposium on High-Performance Parallel and Distributed Computing","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://dl.acm.org/doi/pdf/10.1145/3369583.3392684","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5005205340","display_name":"Donglin Yang","orcid":"https://orcid.org/0000-0002-3913-3623"},"institutions":[{"id":"https://openalex.org/I102149020","display_name":"University of North Carolina at Charlotte","ror":"https://ror.org/04dawnj30","country_code":"US","type":"education","lineage":["https://openalex.org/I102149020"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Donglin Yang","raw_affiliation_strings":["University of North Carolina at Charlotte, Charlotte, NC, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of North Carolina at Charlotte, Charlotte, NC, USA","institution_ids":["https://openalex.org/I102149020"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5063911669","display_name":"Dazhao Cheng","orcid":"https://orcid.org/0000-0003-2869-7623"},"institutions":[{"id":"https://openalex.org/I102149020","display_name":"University of North Carolina at Charlotte","ror":"https://ror.org/04dawnj30","country_code":"US","type":"education","lineage":["https://openalex.org/I102149020"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Dazhao Cheng","raw_affiliation_strings":["University of North Carolina at Charlotte, Charlotte, NC, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of North Carolina at Charlotte, Charlotte, NC, USA","institution_ids":["https://openalex.org/I102149020"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I102149020"],"apc_list":null,"apc_paid":null,"fwci":2.4792,"has_fulltext":true,"cited_by_count":18,"citation_normalized_percentile":{"value":0.90199583,"is_in_top_1_percent":false,"is_in_top_10_percent":true},"cited_by_percentile_year":{"min":90,"max":98},"biblio":{"volume":null,"issue":null,"first_page":"185","last_page":"196"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.9987999796867371,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.9987999796867371,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12303","display_name":"Tensor decomposition and applications","score":0.9937000274658203,"subfield":{"id":"https://openalex.org/subfields/2605","display_name":"Computational Mathematics"},"field":{"id":"https://openalex.org/fields/26","display_name":"Mathematics"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10036","display_name":"Advanced Neural Network Applications","score":0.9887999892234802,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.8772271275520325},{"id":"https://openalex.org/keywords/bottleneck","display_name":"Bottleneck","score":0.7296068668365479},{"id":"https://openalex.org/keywords/memory-footprint","display_name":"Memory footprint","score":0.6085320711135864},{"id":"https://openalex.org/keywords/parallel-computing","display_name":"Parallel computing","score":0.5705813765525818},{"id":"https://openalex.org/keywords/memory-management","display_name":"Memory management","score":0.524066686630249},{"id":"https://openalex.org/keywords/distributed-computing","display_name":"Distributed computing","score":0.4598051607608795},{"id":"https://openalex.org/keywords/exploit","display_name":"Exploit","score":0.4543269872665405},{"id":"https://openalex.org/keywords/dram","display_name":"Dram","score":0.43352001905441284},{"id":"https://openalex.org/keywords/high-memory","display_name":"High memory","score":0.4117480218410492},{"id":"https://openalex.org/keywords/computer-architecture","display_name":"Computer architecture","score":0.3893336355686188},{"id":"https://openalex.org/keywords/computer-engineering","display_name":"Computer engineering","score":0.3656471371650696},{"id":"https://openalex.org/keywords/embedded-system","display_name":"Embedded system","score":0.2188796103000641},{"id":"https://openalex.org/keywords/computer-hardware","display_name":"Computer hardware","score":0.18267998099327087},{"id":"https://openalex.org/keywords/semiconductor-memory","display_name":"Semiconductor memory","score":0.15342646837234497}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8772271275520325},{"id":"https://openalex.org/C2780513914","wikidata":"https://www.wikidata.org/wiki/Q18210350","display_name":"Bottleneck","level":2,"score":0.7296068668365479},{"id":"https://openalex.org/C74912251","wikidata":"https://www.wikidata.org/wiki/Q6815727","display_name":"Memory footprint","level":2,"score":0.6085320711135864},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.5705813765525818},{"id":"https://openalex.org/C176649486","wikidata":"https://www.wikidata.org/wiki/Q2308807","display_name":"Memory management","level":3,"score":0.524066686630249},{"id":"https://openalex.org/C120314980","wikidata":"https://www.wikidata.org/wiki/Q180634","display_name":"Distributed computing","level":1,"score":0.4598051607608795},{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.4543269872665405},{"id":"https://openalex.org/C7366592","wikidata":"https://www.wikidata.org/wiki/Q1255620","display_name":"Dram","level":2,"score":0.43352001905441284},{"id":"https://openalex.org/C2781357197","wikidata":"https://www.wikidata.org/wiki/Q5757597","display_name":"High memory","level":2,"score":0.4117480218410492},{"id":"https://openalex.org/C118524514","wikidata":"https://www.wikidata.org/wiki/Q173212","display_name":"Computer architecture","level":1,"score":0.3893336355686188},{"id":"https://openalex.org/C113775141","wikidata":"https://www.wikidata.org/wiki/Q428691","display_name":"Computer engineering","level":1,"score":0.3656471371650696},{"id":"https://openalex.org/C149635348","wikidata":"https://www.wikidata.org/wiki/Q193040","display_name":"Embedded system","level":1,"score":0.2188796103000641},{"id":"https://openalex.org/C9390403","wikidata":"https://www.wikidata.org/wiki/Q3966","display_name":"Computer hardware","level":1,"score":0.18267998099327087},{"id":"https://openalex.org/C98986596","wikidata":"https://www.wikidata.org/wiki/Q1143031","display_name":"Semiconductor memory","level":2,"score":0.15342646837234497},{"id":"https://openalex.org/C38652104","wikidata":"https://www.wikidata.org/wiki/Q3510521","display_name":"Computer security","level":1,"score":0.0},{"id":"https://openalex.org/C111919701","wikidata":"https://www.wikidata.org/wiki/Q9135","display_name":"Operating system","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1145/3369583.3392684","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3369583.3392684","pdf_url":"https://dl.acm.org/doi/pdf/10.1145/3369583.3392684","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 29th International Symposium on High-Performance Parallel and Distributed Computing","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.1145/3369583.3392684","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3369583.3392684","pdf_url":"https://dl.acm.org/doi/pdf/10.1145/3369583.3392684","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 29th International Symposium on High-Performance Parallel and Distributed Computing","raw_type":"proceedings-article"},"sustainable_development_goals":[{"display_name":"Industry, innovation and infrastructure","id":"https://metadata.un.org/sdg/9","score":0.5400000214576721}],"awards":[{"id":"https://openalex.org/G2164527530","display_name":"SHF: Small: A Hybrid NVM based Computing Architecture for Machine Learning Applications","funder_award_id":"1908843","funder_id":"https://openalex.org/F4320306076","funder_display_name":"National Science Foundation"}],"funders":[{"id":"https://openalex.org/F4320306076","display_name":"National Science Foundation","ror":"https://ror.org/021nxhr62"}],"has_content":{"grobid_xml":true,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W3038086838.pdf","grobid_xml":"https://content.openalex.org/works/W3038086838.grobid-xml"},"referenced_works_count":39,"referenced_works":["https://openalex.org/W587794757","https://openalex.org/W1498436455","https://openalex.org/W1563795667","https://openalex.org/W1667652561","https://openalex.org/W1724438581","https://openalex.org/W1996773027","https://openalex.org/W2089336473","https://openalex.org/W2097117768","https://openalex.org/W2102017903","https://openalex.org/W2112796928","https://openalex.org/W2119144962","https://openalex.org/W2130306094","https://openalex.org/W2154579312","https://openalex.org/W2158899491","https://openalex.org/W2160815625","https://openalex.org/W2163605009","https://openalex.org/W2168231600","https://openalex.org/W2178615544","https://openalex.org/W2184045248","https://openalex.org/W2194775991","https://openalex.org/W2274287116","https://openalex.org/W2330958039","https://openalex.org/W2332506150","https://openalex.org/W2489529491","https://openalex.org/W2504108613","https://openalex.org/W2883283076","https://openalex.org/W2883830791","https://openalex.org/W2893813411","https://openalex.org/W2949888546","https://openalex.org/W2950656546","https://openalex.org/W2952339051","https://openalex.org/W2964174152","https://openalex.org/W2970971581","https://openalex.org/W2971843695","https://openalex.org/W2997617958","https://openalex.org/W3101104221","https://openalex.org/W3103894541","https://openalex.org/W3118608800","https://openalex.org/W4301361180"],"related_works":["https://openalex.org/W2125264433","https://openalex.org/W4281677350","https://openalex.org/W4237401226","https://openalex.org/W4284884988","https://openalex.org/W2038054897","https://openalex.org/W4236777984","https://openalex.org/W2798332276","https://openalex.org/W2112457107","https://openalex.org/W2159716314","https://openalex.org/W4200309432"],"abstract_inverted_index":{"Deep":[0],"neural":[1],"networks":[2,37,54,141,240],"(DNNs)":[3],"have":[4],"been":[5],"widely":[6],"applied":[7,115],"in":[8],"the":[9,36,42,51,59,63,68,72,83,88,94,102,108,117,128,140,157,163,185,235],"field":[10],"of":[11,53,61,82],"artificial":[12],"intelligence,":[13],"e.g.,":[14],"natural":[15],"language":[16],"processing,":[17],"computer":[18],"vision,":[19],"etc.":[20],"Researchers":[21],"and":[22,40,76,121,155,197,202,210,216],"industry":[23],"practitioners":[24],"typically":[25],"use":[26],"GPU":[27,44,89,136],"to":[28,55,71,86,116,161,181,228,243],"train":[29],"complex":[30,143],"hundred-layers":[31],"deep":[32],"networks.":[33,126,212],"However,":[34,104],"as":[35,97],"going":[38],"wider":[39],"deeper,":[41],"limited":[43],"memory":[45,73,90,130,137,169,188,223],"becomes":[46],"a":[47,173],"significant":[48],"bottleneck,":[49],"restricting":[50],"size":[52],"be":[56,113],"trained.":[57],"In":[58],"training":[60],"DNNs,":[62],"intermediate":[64],"layer":[65],"outputs":[66],"are":[67],"major":[69],"contributors":[70],"footprint.":[74],"Offloading":[75],"prefetching":[77],"feature":[78],"maps":[79],"is":[80],"one":[81],"crucial":[84],"techniques":[85],"overcome":[87],"shortage":[91],"by":[92,226,241],"utilizing":[93],"CPU":[95],"DRAM":[96],"an":[98,151],"external":[99],"buffer":[100],"for":[101,124,139,190,238],"GPU.":[103],"we":[105,149,171],"find":[106],"that":[107],"layer-by-layer":[109],"asynchronous":[110],"approach":[111,220],"cannot":[112],"effectively":[114],"overlap":[118,164],"between":[119],"communication":[120],"computation,":[122],"particularly":[123],"nonlinear":[125,211,239],"Furthermore,":[127],"default":[129],"management":[131],"policy":[132,180],"could":[133],"cause":[134],"high":[135],"fragmentation":[138],"with":[142,193,214],"nonlinearities.":[144],"Based":[145],"on":[146,184,207],"these":[147],"observations,":[148],"adopt":[150],"efficient":[152],"graph":[153],"analysis":[154],"exploit":[156],"layered":[158],"dependency":[159],"structures":[160,192],"improve":[162,234],"ratio.":[165],"To":[166],"achieve":[167,222],"minimal":[168],"fragmentation,":[170],"design":[172],"Group":[174],"Tensors":[175],"By":[176],"Mobility":[177],"(GTBM)":[178],"placement":[179],"allocate":[182],"tensors":[183],"proposed":[186,219],"unified":[187],"pool":[189],"data":[191,195],"varied":[194],"sizes":[196],"dynamic":[198],"dependencies.":[199],"We":[200],"implement":[201],"evaluate":[203],"our":[204,218],"system,":[205],"Dymem,":[206],"several":[208],"linear":[209],"Compared":[213],"vDNN":[215],"SuperNeurons,":[217],"can":[221,233],"cost":[224],"reduction":[225],"up":[227,242],"31%.":[229],"The":[230],"dependency-aware":[231],"strategy":[232],"end-to-end":[236],"throughput":[237],"42%.":[244]},"counts_by_year":[{"year":2025,"cited_by_count":3},{"year":2024,"cited_by_count":4},{"year":2023,"cited_by_count":1},{"year":2022,"cited_by_count":4},{"year":2021,"cited_by_count":4},{"year":2020,"cited_by_count":2}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
