{"id":"https://openalex.org/W7163647863","doi":"https://doi.org/10.48550/arxiv.2606.05495","title":"SET: Stream-Event-Triggered Scheduling for Efficient CUDA Graph Pipelines","display_name":"SET: Stream-Event-Triggered Scheduling for Efficient CUDA Graph Pipelines","publication_year":2026,"publication_date":"2026-06-03","ids":{"openalex":"https://openalex.org/W7163647863","doi":"https://doi.org/10.48550/arxiv.2606.05495"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.05495","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.05495","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.05495","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5016863481","display_name":"Zhengxiong Li","orcid":"https://orcid.org/0000-0003-1880-5096"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Zhengxiong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5088685794","display_name":"Tsung\u2010Wei Huang","orcid":"https://orcid.org/0000-0001-9768-3378"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Huang, Tsung-Wei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5137926374","display_name":"Umit Ogras","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ogras, Umit","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.41909998655319214,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.41909998655319214,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12292","display_name":"Graph Theory and Algorithms","score":0.2071000039577484,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10904","display_name":"Embedded Systems Design Techniques","score":0.19709999859333038,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/cuda","display_name":"CUDA","score":0.6966999769210815},{"id":"https://openalex.org/keywords/scheduling","display_name":"Scheduling (production processes)","score":0.6219000220298767},{"id":"https://openalex.org/keywords/pipeline-transport","display_name":"Pipeline transport","score":0.5889000296592712},{"id":"https://openalex.org/keywords/speedup","display_name":"Speedup","score":0.5677000284194946},{"id":"https://openalex.org/keywords/data-flow-analysis","display_name":"Data-flow analysis","score":0.4560000002384186},{"id":"https://openalex.org/keywords/kernel","display_name":"Kernel (algebra)","score":0.42250001430511475},{"id":"https://openalex.org/keywords/synchronization","display_name":"Synchronization (alternating current)","score":0.40529999136924744},{"id":"https://openalex.org/keywords/graph","display_name":"Graph","score":0.3646000027656555}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8518999814987183},{"id":"https://openalex.org/C2778119891","wikidata":"https://www.wikidata.org/wiki/Q477690","display_name":"CUDA","level":2,"score":0.6966999769210815},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.6647999882698059},{"id":"https://openalex.org/C206729178","wikidata":"https://www.wikidata.org/wiki/Q2271896","display_name":"Scheduling (production processes)","level":2,"score":0.6219000220298767},{"id":"https://openalex.org/C175309249","wikidata":"https://www.wikidata.org/wiki/Q725864","display_name":"Pipeline transport","level":2,"score":0.5889000296592712},{"id":"https://openalex.org/C68339613","wikidata":"https://www.wikidata.org/wiki/Q1549489","display_name":"Speedup","level":2,"score":0.5677000284194946},{"id":"https://openalex.org/C88468194","wikidata":"https://www.wikidata.org/wiki/Q1172416","display_name":"Data-flow analysis","level":3,"score":0.4560000002384186},{"id":"https://openalex.org/C74193536","wikidata":"https://www.wikidata.org/wiki/Q574844","display_name":"Kernel (algebra)","level":2,"score":0.42250001430511475},{"id":"https://openalex.org/C2778562939","wikidata":"https://www.wikidata.org/wiki/Q1298791","display_name":"Synchronization (alternating current)","level":3,"score":0.40529999136924744},{"id":"https://openalex.org/C120314980","wikidata":"https://www.wikidata.org/wiki/Q180634","display_name":"Distributed computing","level":1,"score":0.3822999894618988},{"id":"https://openalex.org/C132525143","wikidata":"https://www.wikidata.org/wiki/Q141488","display_name":"Graph","level":2,"score":0.3646000027656555},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.35929998755455017},{"id":"https://openalex.org/C50630238","wikidata":"https://www.wikidata.org/wiki/Q971505","display_name":"General-purpose computing on graphics processing units","level":3,"score":0.3546999990940094},{"id":"https://openalex.org/C27458966","wikidata":"https://www.wikidata.org/wiki/Q1187693","display_name":"Control flow graph","level":2,"score":0.35429999232292175},{"id":"https://openalex.org/C107568181","wikidata":"https://www.wikidata.org/wiki/Q5319000","display_name":"Dynamic priority scheduling","level":3,"score":0.3246000111103058},{"id":"https://openalex.org/C2989134064","wikidata":"https://www.wikidata.org/wiki/Q288510","display_name":"Execution time","level":2,"score":0.3061999976634979},{"id":"https://openalex.org/C149635348","wikidata":"https://www.wikidata.org/wiki/Q193040","display_name":"Embedded system","level":1,"score":0.30059999227523804},{"id":"https://openalex.org/C31689143","wikidata":"https://www.wikidata.org/wiki/Q733809","display_name":"Fair-share scheduling","level":3,"score":0.298799991607666},{"id":"https://openalex.org/C553261973","wikidata":"https://www.wikidata.org/wiki/Q14579","display_name":"Linux kernel","level":2,"score":0.26750001311302185},{"id":"https://openalex.org/C74197172","wikidata":"https://www.wikidata.org/wiki/Q1195339","display_name":"Directed acyclic graph","level":2,"score":0.25780001282691956},{"id":"https://openalex.org/C489000","wikidata":"https://www.wikidata.org/wiki/Q747385","display_name":"Data flow diagram","level":2,"score":0.2549999952316284},{"id":"https://openalex.org/C172430144","wikidata":"https://www.wikidata.org/wiki/Q17111997","display_name":"Symmetric multiprocessor system","level":2,"score":0.25440001487731934},{"id":"https://openalex.org/C79403827","wikidata":"https://www.wikidata.org/wiki/Q3988","display_name":"Real-time computing","level":1,"score":0.25119999051094055}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.05495","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.05495","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.05495","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.05495","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Achieving":[0],"peak":[1],"GPU":[2],"performance":[3],"remains":[4],"a":[5,54,79,98],"significant":[6],"challenge":[7],"as":[8,38],"the":[9,63,67],"system":[10],"throughput":[11],"is":[12],"constrained":[13],"by":[14,128],"host-device":[15],"synchronization":[16,64],"delays":[17],"and":[18,27,41,66,88,124],"kernel":[19,25,70],"scheduling":[20,46,126],"overheads,":[21],"even":[22],"with":[23,102],"aggressive":[24],"optimizations":[26],"batch":[28],"processing.":[29],"Furthermore,":[30],"existing":[31],"approaches":[32],"often":[33],"underutilize":[34],"hardware":[35,95],"resources":[36],"such":[37],"compute":[39],"cores":[40],"copy":[42],"engines":[43],"due":[44],"to":[45,61,91,105,131],"overheads.":[47],"To":[48],"address":[49],"these":[50],"problems,":[51],"we":[52],"propose":[53],"CUDA":[55,133],"runtime":[56],"framework":[57],"for":[58,109],"task-parallel":[59,81],"pipelines":[60],"minimize":[62],"overheads":[65,127],"gap":[68],"between":[69],"executions.":[71],"The":[72],"proposed":[73],"solution":[74],"combines":[75],"two":[76],"innovations:":[77],"(1)":[78],"multi-stream":[80],"pipeline":[82],"programming":[83],"model":[84],"that":[85],"leverages":[86],"event-chaining":[87],"work-stealing":[89],"mechanisms":[90],"fully":[92],"utilize":[93],"available":[94],"resources;":[96],"(2)":[97],"graph-based":[99],"execution":[100],"flow":[101],"per-stream":[103],"buffers":[104],"ensure":[106],"memory":[107],"safety":[108],"multiple":[110],"in-flight":[111],"jobs":[112],"running":[113],"concurrently.":[114],"Extensive":[115],"evaluations":[116],"on":[117],"representative":[118],"real-world":[119],"workloads":[120],"show":[121],"1.15--1.44X":[122],"speedup":[123],"reduce":[125],"18--54%":[129],"compared":[130],"state-of-the-art":[132],"graph":[134],"baselines.":[135]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-06-06T00:00:00"}
