{"id":"https://openalex.org/W4416251083","doi":"https://doi.org/10.1109/ijcnn64981.2025.11228785","title":"Parallel Optimization of Quantized CNNs for Efficient GPU Inference","display_name":"Parallel Optimization of Quantized CNNs for Efficient GPU Inference","publication_year":2025,"publication_date":"2025-06-30","ids":{"openalex":"https://openalex.org/W4416251083","doi":"https://doi.org/10.1109/ijcnn64981.2025.11228785"},"language":null,"primary_location":{"id":"doi:10.1109/ijcnn64981.2025.11228785","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ijcnn64981.2025.11228785","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5117522778","display_name":"Marco Lettiero","orcid":"https://orcid.org/0009-0003-0155-4881"},"institutions":[{"id":"https://openalex.org/I183638586","display_name":"Parthenope University of Naples","ror":"https://ror.org/05pcv4v03","country_code":"IT","type":"education","lineage":["https://openalex.org/I183638586"]}],"countries":["IT"],"is_corresponding":false,"raw_author_name":"Marco Lettiero","raw_affiliation_strings":["University of Naples Parthenope,Dept. of Science and Technology,Naples,Italy"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Naples Parthenope,Dept. of Science and Technology,Naples,Italy","institution_ids":["https://openalex.org/I183638586"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5027506040","display_name":"Pasquale De Luca","orcid":"https://orcid.org/0000-0001-7031-920X"},"institutions":[{"id":"https://openalex.org/I183638586","display_name":"Parthenope University of Naples","ror":"https://ror.org/05pcv4v03","country_code":"IT","type":"education","lineage":["https://openalex.org/I183638586"]}],"countries":["IT"],"is_corresponding":false,"raw_author_name":"Pasquale De Luca","raw_affiliation_strings":["University of Naples Parthenope,Dept. of Science and Technology,Naples,Italy"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Naples Parthenope,Dept. of Science and Technology,Naples,Italy","institution_ids":["https://openalex.org/I183638586"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I183638586"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.39396756,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"8"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10036","display_name":"Advanced Neural Network Applications","score":0.9417999982833862,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10036","display_name":"Advanced Neural Network Applications","score":0.9417999982833862,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T14347","display_name":"Big Data and Digital Economy","score":0.00989999994635582,"subfield":{"id":"https://openalex.org/subfields/1710","display_name":"Information Systems"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10901","display_name":"Advanced Data Compression Techniques","score":0.004100000020116568,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/quantization","display_name":"Quantization (signal processing)","score":0.8206999897956848},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.697700023651123},{"id":"https://openalex.org/keywords/memory-footprint","display_name":"Memory footprint","score":0.5976999998092651},{"id":"https://openalex.org/keywords/deep-learning","display_name":"Deep learning","score":0.49239999055862427},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.47769999504089355},{"id":"https://openalex.org/keywords/deep-neural-networks","display_name":"Deep neural networks","score":0.4700999855995178},{"id":"https://openalex.org/keywords/leverage","display_name":"Leverage (statistics)","score":0.4262000024318695}],"concepts":[{"id":"https://openalex.org/C28855332","wikidata":"https://www.wikidata.org/wiki/Q198099","display_name":"Quantization (signal processing)","level":2,"score":0.8206999897956848},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7804999947547913},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.697700023651123},{"id":"https://openalex.org/C74912251","wikidata":"https://www.wikidata.org/wiki/Q6815727","display_name":"Memory footprint","level":2,"score":0.5976999998092651},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.49239999055862427},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.47769999504089355},{"id":"https://openalex.org/C2984842247","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep neural networks","level":3,"score":0.4700999855995178},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.4480000138282776},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.4343000054359436},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.4262000024318695},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4129999876022339},{"id":"https://openalex.org/C113775141","wikidata":"https://www.wikidata.org/wiki/Q428691","display_name":"Computer engineering","level":1,"score":0.37310001254081726},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.3547999858856201},{"id":"https://openalex.org/C2781357197","wikidata":"https://www.wikidata.org/wiki/Q5757597","display_name":"High memory","level":2,"score":0.31690001487731934},{"id":"https://openalex.org/C80469333","wikidata":"https://www.wikidata.org/wiki/Q189088","display_name":"Von Neumann architecture","level":2,"score":0.30399999022483826},{"id":"https://openalex.org/C68339613","wikidata":"https://www.wikidata.org/wiki/Q1549489","display_name":"Speedup","level":2,"score":0.29409998655319214},{"id":"https://openalex.org/C199833920","wikidata":"https://www.wikidata.org/wiki/Q612536","display_name":"Vector quantization","level":2,"score":0.2800999879837036},{"id":"https://openalex.org/C12186640","wikidata":"https://www.wikidata.org/wiki/Q6815743","display_name":"Memory model","level":3,"score":0.2770000100135803},{"id":"https://openalex.org/C179799912","wikidata":"https://www.wikidata.org/wiki/Q205084","display_name":"Computational complexity theory","level":2,"score":0.2754000127315521},{"id":"https://openalex.org/C81363708","wikidata":"https://www.wikidata.org/wiki/Q17084460","display_name":"Convolutional neural network","level":2,"score":0.25850000977516174},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.2572999894618988}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/ijcnn64981.2025.11228785","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ijcnn64981.2025.11228785","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320324632","display_name":"Ministero dello Sviluppo Economico","ror":"https://ror.org/011z3ff80"}],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":24,"referenced_works":["https://openalex.org/W2147800946","https://openalex.org/W2233116163","https://openalex.org/W2424437773","https://openalex.org/W2963122961","https://openalex.org/W2999803881","https://openalex.org/W3015735225","https://openalex.org/W3133702157","https://openalex.org/W3137147200","https://openalex.org/W3170405112","https://openalex.org/W3170750006","https://openalex.org/W3172942063","https://openalex.org/W4285291868","https://openalex.org/W4285412966","https://openalex.org/W4297888106","https://openalex.org/W4313856669","https://openalex.org/W4324057834","https://openalex.org/W4386607611","https://openalex.org/W4388333441","https://openalex.org/W4392358084","https://openalex.org/W4393115925","https://openalex.org/W4396217396","https://openalex.org/W4401889011","https://openalex.org/W4407661798","https://openalex.org/W4409528426"],"related_works":[],"abstract_inverted_index":{"Deep":[0,126],"Neural":[1,127],"Networks":[2],"have":[3],"achieved":[4],"remarkable":[5],"success":[6],"in":[7,75,234],"various":[8],"machine":[9],"learning":[10],"tasks,":[11],"such":[12],"as":[13],"computer":[14],"vision":[15],"and":[16,23,42,73,81,99,111,167,189,227,237],"natural":[17],"language":[18],"processing,":[19],"but":[20,209],"their":[21,28,112],"computational":[22,123],"memory":[24,82,168,192,214],"requirements":[25],"often":[26],"limit":[27],"deployment.":[29],"Quantization":[30,93],"offers":[31],"a":[32,162],"promising":[33],"solution":[34],"by":[35,120],"reducing":[36],"model":[37],"precision":[38,69],"while":[39,142],"maintaining":[40],"accuracy,":[41,78],"it":[43],"can":[44],"be":[45],"combined":[46],"with":[47,170],"other":[48],"common":[49],"optimization":[50],"strategies":[51],"for":[52],"further":[53],"efficiency":[54],"gains.":[55],"This":[56],"paper":[57],"investigates":[58],"the":[59,64,91,108,117,121,132,152,221,229],"effects":[60],"of":[61,77,125,154,207,223,231],"quantization":[62,98,144,160,225],"on":[63,90,131],"VGG16":[65],"model,":[66],"comparing":[67],"different":[68],"levels":[70],"(FP32,":[71],"FP8,":[72],"INT8)":[74],"terms":[76],"inference":[79,181,205],"time,":[80],"usage.":[83],"We":[84],"propose":[85],"an":[86,136,204],"optimized":[87],"approach,":[88],"based":[89],"Post-Training":[92],"method,":[94],"that":[95],"minimizes":[96],"redundant":[97],"dequantization":[100],"steps":[101],"through":[102],"layer":[103],"fusion.":[104],"Moreover,":[105],"we":[106],"leverage":[107],"GPU":[109,191],"architectures":[110],"parallelization":[113],"capabilities":[114],"to":[115,151,185,196,199,216],"overcome":[116],"challenges":[118],"posed":[119],"high":[122],"complexity":[124],"Networks.":[128],"Experiments":[129],"conducted":[130],"CIFAR-10":[133],"dataset":[134],"using":[135],"NVIDIA":[137],"RTX":[138],"4090":[139],"demonstrate":[140,228],"that,":[141],"INT8":[143,202],"does":[145],"not":[146],"consistently":[147],"outperform":[148],"FP32":[149],"due":[150],"lack":[153],"full":[155],"specific":[156],"hardware":[157],"support,":[158],"FP8":[159,179],"achieves":[161],"better":[163],"balance":[164],"between":[165],"speed":[166],"footprint":[169],"minimal":[171],"accuracy":[172],"degradation.":[173],"Specifically,":[174],"at":[175],"batch":[176],"size":[177],"4096,":[178],"reduces":[180],"time":[182,206],"from":[183,194],"789ms":[184],"471ms":[186],"(\u224840%":[187],"speed-up)":[188],"cuts":[190],"usage":[193,215],"100%":[195],"68%":[197],"compared":[198],"FP32,":[200],"whereas":[201],"reaches":[203],"475ms":[208],"maintains":[210],"or":[211],"slightly":[212],"increases":[213],"104%.":[217],"Our":[218],"findings":[219],"underscore":[220],"importance":[222],"hardware-aware":[224],"techniques":[226],"viability":[230],"reduced-precision":[232],"models":[233],"real-time":[235],"applications":[236],"resource-constrained":[238],"environments.":[239]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-11-14T00:00:00"}
