{"id":"https://openalex.org/W7157017193","doi":"https://doi.org/10.1145/3806645.3807576","title":"GICC: A High-Performance Runtime for GPU-Initiated Communication and Coordination in Modern HPC Systems","display_name":"GICC: A High-Performance Runtime for GPU-Initiated Communication and Coordination in Modern HPC Systems","publication_year":2026,"publication_date":"2026-07-11","ids":{"openalex":"https://openalex.org/W7157017193","doi":"https://doi.org/10.1145/3806645.3807576"},"language":null,"primary_location":{"id":"doi:10.1145/3806645.3807576","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3806645.3807576","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 35th International Symposium on High-Performance Parallel and Distributed Computing","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["arxiv","crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://doi.org/10.1145/3806645.3807576","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5083746071","display_name":"Baodi Shan","orcid":"https://orcid.org/0000-0002-1022-3801"},"institutions":[{"id":"https://openalex.org/I59553526","display_name":"Stony Brook University","ror":"https://ror.org/05qghxh33","country_code":"US","type":"education","lineage":["https://openalex.org/I59553526"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Baodi Shan","raw_affiliation_strings":["Stony Brook University, Stony Brook, New York, USA"],"raw_orcid":"https://orcid.org/0000-0002-1022-3801","affiliations":[{"raw_affiliation_string":"Stony Brook University, Stony Brook, New York, USA","institution_ids":["https://openalex.org/I59553526"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134793010","display_name":"Mauricio Araya-Polo","orcid":null},"institutions":[{"id":"https://openalex.org/I103084370","display_name":"Total (France)","ror":"https://ror.org/04sk34n56","country_code":"FR","type":"company","lineage":["https://openalex.org/I103084370"]}],"countries":["FR"],"is_corresponding":false,"raw_author_name":"Mauricio Araya-Polo","raw_affiliation_strings":["TotalEnergies EP Research &amp; Technology USA, Houston, Texas, USA"],"raw_orcid":"https://orcid.org/0000-0002-5537-1840","affiliations":[{"raw_affiliation_string":"TotalEnergies EP Research &amp; Technology USA, Houston, Texas, USA","institution_ids":["https://openalex.org/I103084370"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5134707217","display_name":"Barbara Chapman","orcid":null},"institutions":[{"id":"https://openalex.org/I59553526","display_name":"Stony Brook University","ror":"https://ror.org/05qghxh33","country_code":"US","type":"education","lineage":["https://openalex.org/I59553526"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Barbara Chapman","raw_affiliation_strings":["Stony Brook University, Stony Brook, New York, USA"],"raw_orcid":"https://orcid.org/0000-0001-8449-8579","affiliations":[{"raw_affiliation_string":"Stony Brook University, Stony Brook, New York, USA","institution_ids":["https://openalex.org/I59553526"]}]}],"institutions":[],"countries_distinct_count":2,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"45","last_page":"57"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.9210000038146973,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.9210000038146973,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10829","display_name":"Interconnection Networks and Systems","score":0.014399999752640724,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10101","display_name":"Cloud Computing and Resource Management","score":0.011099999770522118,"subfield":{"id":"https://openalex.org/subfields/1710","display_name":"Information Systems"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/asynchronous-communication","display_name":"Asynchronous communication","score":0.6503000259399414},{"id":"https://openalex.org/keywords/latency","display_name":"Latency (audio)","score":0.5478000044822693},{"id":"https://openalex.org/keywords/stencil","display_name":"Stencil","score":0.4828000068664551},{"id":"https://openalex.org/keywords/infiniband","display_name":"InfiniBand","score":0.48260000348091125},{"id":"https://openalex.org/keywords/thread","display_name":"Thread (computing)","score":0.47530001401901245},{"id":"https://openalex.org/keywords/implementation","display_name":"Implementation","score":0.4523000121116638},{"id":"https://openalex.org/keywords/host","display_name":"Host (biology)","score":0.4332999885082245},{"id":"https://openalex.org/keywords/scheduling","display_name":"Scheduling (production processes)","score":0.4169999957084656},{"id":"https://openalex.org/keywords/execution-model","display_name":"Execution model","score":0.3799000084400177},{"id":"https://openalex.org/keywords/computation","display_name":"Computation","score":0.37290000915527344}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8712000250816345},{"id":"https://openalex.org/C151319957","wikidata":"https://www.wikidata.org/wiki/Q752739","display_name":"Asynchronous communication","level":2,"score":0.6503000259399414},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.5848000049591064},{"id":"https://openalex.org/C82876162","wikidata":"https://www.wikidata.org/wiki/Q17096504","display_name":"Latency (audio)","level":2,"score":0.5478000044822693},{"id":"https://openalex.org/C76752949","wikidata":"https://www.wikidata.org/wiki/Q7607499","display_name":"Stencil","level":2,"score":0.4828000068664551},{"id":"https://openalex.org/C2781030343","wikidata":"https://www.wikidata.org/wiki/Q922437","display_name":"InfiniBand","level":2,"score":0.48260000348091125},{"id":"https://openalex.org/C138101251","wikidata":"https://www.wikidata.org/wiki/Q213092","display_name":"Thread (computing)","level":2,"score":0.47530001401901245},{"id":"https://openalex.org/C26713055","wikidata":"https://www.wikidata.org/wiki/Q245962","display_name":"Implementation","level":2,"score":0.4523000121116638},{"id":"https://openalex.org/C120314980","wikidata":"https://www.wikidata.org/wiki/Q180634","display_name":"Distributed computing","level":1,"score":0.4496000111103058},{"id":"https://openalex.org/C126831891","wikidata":"https://www.wikidata.org/wiki/Q221673","display_name":"Host (biology)","level":2,"score":0.4332999885082245},{"id":"https://openalex.org/C206729178","wikidata":"https://www.wikidata.org/wiki/Q2271896","display_name":"Scheduling (production processes)","level":2,"score":0.4169999957084656},{"id":"https://openalex.org/C2776834041","wikidata":"https://www.wikidata.org/wiki/Q25346349","display_name":"Execution model","level":2,"score":0.3799000084400177},{"id":"https://openalex.org/C45374587","wikidata":"https://www.wikidata.org/wiki/Q12525525","display_name":"Computation","level":2,"score":0.37290000915527344},{"id":"https://openalex.org/C2778562939","wikidata":"https://www.wikidata.org/wiki/Q1298791","display_name":"Synchronization (alternating current)","level":3,"score":0.3598000109195709},{"id":"https://openalex.org/C111919701","wikidata":"https://www.wikidata.org/wiki/Q9135","display_name":"Operating system","level":1,"score":0.35359999537467957},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.3515999913215637},{"id":"https://openalex.org/C105339364","wikidata":"https://www.wikidata.org/wiki/Q2297740","display_name":"Software deployment","level":2,"score":0.3424000144004822},{"id":"https://openalex.org/C201410400","wikidata":"https://www.wikidata.org/wiki/Q1064412","display_name":"Multithreading","level":3,"score":0.3296000063419342},{"id":"https://openalex.org/C133875982","wikidata":"https://www.wikidata.org/wiki/Q764810","display_name":"Shared memory","level":2,"score":0.3142000138759613},{"id":"https://openalex.org/C169590947","wikidata":"https://www.wikidata.org/wiki/Q47506","display_name":"Compiler","level":2,"score":0.3122999966144562},{"id":"https://openalex.org/C193702766","wikidata":"https://www.wikidata.org/wiki/Q1414548","display_name":"Concurrency","level":2,"score":0.3052999973297119},{"id":"https://openalex.org/C64270927","wikidata":"https://www.wikidata.org/wiki/Q206924","display_name":"PCI Express","level":3,"score":0.3050000071525574},{"id":"https://openalex.org/C2778514511","wikidata":"https://www.wikidata.org/wiki/Q1374194","display_name":"Programmer","level":2,"score":0.2987000048160553},{"id":"https://openalex.org/C133588205","wikidata":"https://www.wikidata.org/wiki/Q28455645","display_name":"Instruction prefetch","level":3,"score":0.2978000044822693},{"id":"https://openalex.org/C52723943","wikidata":"https://www.wikidata.org/wiki/Q1127410","display_name":"Serialization","level":2,"score":0.2962000072002411},{"id":"https://openalex.org/C149635348","wikidata":"https://www.wikidata.org/wiki/Q193040","display_name":"Embedded system","level":1,"score":0.2865999937057495},{"id":"https://openalex.org/C130795937","wikidata":"https://www.wikidata.org/wiki/Q2561570","display_name":"Remote direct memory access","level":2,"score":0.2863999903202057},{"id":"https://openalex.org/C2780870223","wikidata":"https://www.wikidata.org/wiki/Q1004415","display_name":"Runtime system","level":2,"score":0.28540000319480896},{"id":"https://openalex.org/C189930140","wikidata":"https://www.wikidata.org/wiki/Q1112878","display_name":"CAS latency","level":4,"score":0.2800999879837036},{"id":"https://openalex.org/C2780300890","wikidata":"https://www.wikidata.org/wiki/Q851973","display_name":"PlanetLab","level":3,"score":0.27630001306533813},{"id":"https://openalex.org/C141917322","wikidata":"https://www.wikidata.org/wiki/Q1025017","display_name":"Cache coherence","level":5,"score":0.26429998874664307},{"id":"https://openalex.org/C34165917","wikidata":"https://www.wikidata.org/wiki/Q188267","display_name":"Programming paradigm","level":2,"score":0.26170000433921814},{"id":"https://openalex.org/C854659","wikidata":"https://www.wikidata.org/wiki/Q1859284","display_name":"Message passing","level":2,"score":0.25920000672340393},{"id":"https://openalex.org/C83283714","wikidata":"https://www.wikidata.org/wiki/Q121117","display_name":"Supercomputer","level":2,"score":0.2565000057220459},{"id":"https://openalex.org/C118524514","wikidata":"https://www.wikidata.org/wiki/Q173212","display_name":"Computer architecture","level":1,"score":0.25540000200271606},{"id":"https://openalex.org/C115537543","wikidata":"https://www.wikidata.org/wiki/Q165596","display_name":"Cache","level":2,"score":0.2540000081062317}],"mesh":[],"locations_count":2,"locations":[{"id":"doi:10.1145/3806645.3807576","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3806645.3807576","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 35th International Symposium on High-Performance Parallel and Distributed Computing","raw_type":"proceedings-article"},{"id":"pmh:oai:arXiv.org:2604.22126","is_oa":true,"landing_page_url":"https://arxiv.org/abs/2604.22126","pdf_url":"https://arxiv.org/pdf/2604.22126","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"}],"best_oa_location":{"id":"doi:10.1145/3806645.3807576","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3806645.3807576","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 35th International Symposium on High-Performance Parallel and Distributed Computing","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[{"id":"https://openalex.org/G1313983767","display_name":null,"funder_award_id":"DE-AC02","funder_id":"https://openalex.org/F4320338284","funder_display_name":"Argonne National Laboratory"},{"id":"https://openalex.org/G3075337988","display_name":null,"funder_award_id":"06CH11357","funder_id":"https://openalex.org/F4320338284","funder_display_name":"Argonne National Laboratory"},{"id":"https://openalex.org/G4088772752","display_name":"SHF:Small:Performance Portable Parallel Programming on Extremely Heterogeneous Systems","funder_award_id":"2113996","funder_id":"https://openalex.org/F4320306076","funder_display_name":"National Science Foundation"},{"id":"https://openalex.org/G498139845","display_name":null,"funder_award_id":"DE-AC02","funder_id":"https://openalex.org/F4320332359","funder_display_name":"Office of Science"},{"id":"https://openalex.org/G5085543421","display_name":null,"funder_award_id":"AC02-06CH11357","funder_id":"https://openalex.org/F4320338284","funder_display_name":"Argonne National Laboratory"},{"id":"https://openalex.org/G6918803902","display_name":null,"funder_award_id":"06CH11357","funder_id":"https://openalex.org/F4320332359","funder_display_name":"Office of Science"},{"id":"https://openalex.org/G7351994996","display_name":null,"funder_award_id":"DE-AC02-06CH11357","funder_id":"https://openalex.org/F4320306076","funder_display_name":"National Science Foundation"},{"id":"https://openalex.org/G7439212527","display_name":null,"funder_award_id":"CCF-2113996","funder_id":"https://openalex.org/F4320306076","funder_display_name":"National Science Foundation"},{"id":"https://openalex.org/G8143874970","display_name":null,"funder_award_id":"AC02-06CH11357","funder_id":"https://openalex.org/F4320332359","funder_display_name":"Office of Science"}],"funders":[{"id":"https://openalex.org/F4320306076","display_name":"National Science Foundation","ror":"https://ror.org/021nxhr62"},{"id":"https://openalex.org/F4320324219","display_name":"Total","ror":"https://ror.org/04sk34n56"},{"id":"https://openalex.org/F4320332359","display_name":"Office of Science","ror":"https://ror.org/00mmn6b08"},{"id":"https://openalex.org/F4320338284","display_name":"Argonne National Laboratory","ror":"https://ror.org/05gvnxz63"}],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Distributed":[0],"GPU":[1,46,96,112,151,165],"applications":[2],"increasingly":[3],"rely":[4,55],"on":[5,56,106,190,241],"kernel-level,":[6],"cross-node":[7],"coordination":[8,135,172,177],"to":[9,98,149,207,216,223],"reduce":[10],"launch":[11],"overheads":[12],"and":[13,59,85,130,140,152,192,197,209,234],"improve":[14],"compute-communication":[15],"overlap,":[16],"but":[17,79],"such":[18,25],"support":[19],"is":[20,77],"lacking.":[21],"On":[22,73,199,218,236],"OFI-based":[23,185],"interconnects":[24],"as":[26,117,119],"HPE":[27],"Slingshot,":[28,200],"which":[29,256],"powers":[30],"six":[31],"of":[32],"the":[33,38,43,107,145,171],"top":[34,44],"ten":[35],"systems":[36],"in":[37],"November":[39],"2025":[40],"Top500,":[41],"including":[42],"three,":[45],"kernels":[47,97],"cannot":[48],"autonomously":[49],"drive":[50],"distributed":[51],"coordination:":[52],"existing":[53,184],"runtimes":[54],"host-driven":[57],"progress":[58],"lack":[60],"a":[61,92,156],"bounded":[62],"mechanism":[63],"for":[64],"recycling":[65],"pre-staged":[66],"NIC":[67,146,161,180],"work":[68],"across":[69],"repeated":[70],"GPU-triggered":[71],"operations.":[72],"InfiniBand,":[74,219],"GPU-initiated":[75],"communication":[76,252],"possible,":[78],"current":[80],"implementations":[81],"incur":[82],"unnecessary":[83,232],"synchronization":[84],"locking":[86,233],"overheads.":[87],"This":[88,174],"paper":[89],"presents":[90],"GICC,":[91,255],"framework":[93],"that":[94],"enables":[95],"directly":[99],"trigger":[100],"NIC-level":[101],"operations":[102],"without":[103,167],"host":[104,153,158],"involvement":[105],"fast":[108],"path.":[109,173],"In":[110],"stencils,":[111],"threads":[113],"initiate":[114],"halo":[115],"exchanges":[116],"soon":[118],"boundary":[120,131],"regions":[121],"are":[122],"computed,":[123],"enabling":[124],"fine-grained":[125],"overlap":[126],"between":[127],"interior":[128],"computation":[129],"transfer.":[132],"GICC":[133,189,201],"decouples":[134],"semantics":[136],"from":[137,183],"data":[138],"movement":[139],"introduces":[141],"asynchronous":[142],"resource":[143],"reclamation:":[144],"signals":[147],"completion":[148],"both":[150],"memory,":[154],"letting":[155],"lightweight":[157],"thread":[159],"recycle":[160],"resources":[162],"concurrently":[163],"with":[164],"execution":[166],"injecting":[168],"latency":[169,204,227],"into":[170],"sustains":[175],"GPU-driven":[176],"under":[178],"finite":[179],"state,":[181],"absent":[182],"runtimes.":[186],"We":[187],"implement":[188],"NVIDIA":[191],"AMD":[193,243],"GPUs":[194],"over":[195,249],"InfiniBand":[196],"Slingshot.":[198],"reduces":[202],"per-coordination":[203],"by":[205,214,230],"up":[206,215,222],"229x":[208],"improves":[210],"weak":[211],"scaling":[212],"efficiency":[213,260],"25%.":[217],"it":[220],"achieves":[221,257],"1.95x":[224],"lower":[225],"put":[226],"than":[228,254],"NVSHMEM":[229],"eliminating":[231],"synchronization.":[235],"an":[237],"industrial":[238],"stencil":[239],"proxy":[240],"64":[242],"MI250X":[244],"GCDs,":[245],"GPU-aware":[246],"MPI":[247],"incurs":[248],"52%":[250],"higher":[251],"time":[253],"42%":[258],"parallel":[259],"versus":[261],"MPI's":[262],"35.4%.":[263]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2026-04-29T00:00:00"}
