{"id":"https://openalex.org/W7161875529","doi":"https://doi.org/10.48550/arxiv.2605.19140","title":"Learning to Hand Off: Provably Convergent Workflow Learning under Interface Constraints","display_name":"Learning to Hand Off: Provably Convergent Workflow Learning under Interface Constraints","publication_year":2026,"publication_date":"2026-05-18","ids":{"openalex":"https://openalex.org/W7161875529","doi":"https://doi.org/10.48550/arxiv.2605.19140"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.19140","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.19140","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.19140","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5136509541","display_name":"Jiayu Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Jiayu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136510613","display_name":"Enpei Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Enpei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136525483","display_name":"Dawei Zhou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhou, Dawei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136514761","display_name":"Elynn Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Elynn","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5136576906","display_name":"Yujun Yan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yan, Yujun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.45899999141693115,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.45899999141693115,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10764","display_name":"Privacy-Preserving Technologies in Data","score":0.10119999945163727,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.0625,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/asynchronous-communication","display_name":"Asynchronous communication","score":0.6564000248908997},{"id":"https://openalex.org/keywords/workflow","display_name":"Workflow","score":0.5253000259399414},{"id":"https://openalex.org/keywords/interface","display_name":"Interface (matter)","score":0.490200012922287},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.48579999804496765},{"id":"https://openalex.org/keywords/upper-and-lower-bounds","display_name":"Upper and lower bounds","score":0.4659000039100647},{"id":"https://openalex.org/keywords/oracle","display_name":"Oracle","score":0.42820000648498535},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.42160001397132874},{"id":"https://openalex.org/keywords/representation","display_name":"Representation (politics)","score":0.4172999858856201},{"id":"https://openalex.org/keywords/state","display_name":"State (computer science)","score":0.37389999628067017},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.3517000079154968}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7893000245094299},{"id":"https://openalex.org/C151319957","wikidata":"https://www.wikidata.org/wiki/Q752739","display_name":"Asynchronous communication","level":2,"score":0.6564000248908997},{"id":"https://openalex.org/C177212765","wikidata":"https://www.wikidata.org/wiki/Q627335","display_name":"Workflow","level":2,"score":0.5253000259399414},{"id":"https://openalex.org/C113843644","wikidata":"https://www.wikidata.org/wiki/Q901882","display_name":"Interface (matter)","level":4,"score":0.490200012922287},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.48579999804496765},{"id":"https://openalex.org/C77553402","wikidata":"https://www.wikidata.org/wiki/Q13222579","display_name":"Upper and lower bounds","level":2,"score":0.4659000039100647},{"id":"https://openalex.org/C55166926","wikidata":"https://www.wikidata.org/wiki/Q2892946","display_name":"Oracle","level":2,"score":0.42820000648498535},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.42160001397132874},{"id":"https://openalex.org/C2776359362","wikidata":"https://www.wikidata.org/wiki/Q2145286","display_name":"Representation (politics)","level":3,"score":0.4172999858856201},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.37389999628067017},{"id":"https://openalex.org/C120314980","wikidata":"https://www.wikidata.org/wiki/Q180634","display_name":"Distributed computing","level":1,"score":0.3734000027179718},{"id":"https://openalex.org/C80444323","wikidata":"https://www.wikidata.org/wiki/Q2878974","display_name":"Theoretical computer science","level":1,"score":0.37299999594688416},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.3517000079154968},{"id":"https://openalex.org/C2779010991","wikidata":"https://www.wikidata.org/wiki/Q2720909","display_name":"Artifact (error)","level":2,"score":0.34880000352859497},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.33899998664855957},{"id":"https://openalex.org/C55439883","wikidata":"https://www.wikidata.org/wiki/Q360812","display_name":"Correctness","level":2,"score":0.33550000190734863},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.31790000200271606},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.3131999969482422},{"id":"https://openalex.org/C49937458","wikidata":"https://www.wikidata.org/wiki/Q2599292","display_name":"Probabilistic logic","level":2,"score":0.310699999332428},{"id":"https://openalex.org/C2779019669","wikidata":"https://www.wikidata.org/wiki/Q25203946","display_name":"Asynchrony (computer programming)","level":3,"score":0.3091999888420105},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3089999854564667},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.3052000105381012},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.298799991607666},{"id":"https://openalex.org/C126780896","wikidata":"https://www.wikidata.org/wiki/Q899871","display_name":"Distortion (music)","level":4,"score":0.2978000044822693},{"id":"https://openalex.org/C113336015","wikidata":"https://www.wikidata.org/wiki/Q574010","display_name":"Complete information","level":2,"score":0.28949999809265137},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.28679999709129333},{"id":"https://openalex.org/C154504017","wikidata":"https://www.wikidata.org/wiki/Q853614","display_name":"Identifier","level":2,"score":0.28519999980926514},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.28349998593330383},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.2782999873161316},{"id":"https://openalex.org/C8272713","wikidata":"https://www.wikidata.org/wiki/Q176737","display_name":"Stochastic process","level":2,"score":0.2768000066280365},{"id":"https://openalex.org/C2779662365","wikidata":"https://www.wikidata.org/wiki/Q5416694","display_name":"Event (particle physics)","level":2,"score":0.2676999866962433},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.26089999079704285},{"id":"https://openalex.org/C18555067","wikidata":"https://www.wikidata.org/wiki/Q8375051","display_name":"Joint (building)","level":2,"score":0.26010000705718994},{"id":"https://openalex.org/C189693848","wikidata":"https://www.wikidata.org/wiki/Q6031064","display_name":"Information exchange","level":2,"score":0.25589999556541443}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.19140","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.19140","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.19140","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.19140","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/16","display_name":"Peace, Justice and strong institutions","score":0.5936493873596191}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"We":[0,54],"study":[1],"workflow":[2],"learning":[3],"in":[4,80,155],"a":[5,14,21,95,116,176,198],"setting":[6],"where":[7],"specialized":[8],"agents":[9],"hand":[10],"off":[11],"control":[12],"through":[13],"shared":[15],"artifact,":[16],"each":[17,208],"agent":[18,203],"observes":[19],"only":[20],"local":[22],"function":[23],"of":[24,43,150,209],"that":[25,47,101,180,195],"artifact":[26],"and":[27,32,72,115,142,190],"its":[28,216],"own":[29],"private":[30],"state,":[31],"no":[33],"centralized":[34,199],"learner":[35],"accesses":[36],"joint":[37,205],"trajectories":[38],"--":[39],"the":[40,120,129,163,182,210,220],"operating":[41],"regime":[42,57],"multi-agent":[44,140,188,191],"LLM":[45],"pipelines":[46],"span":[48],"organizational,":[49],"vendor,":[50],"or":[51],"trust":[52],"boundaries.":[53],"formalize":[55],"this":[56,125,161],"as":[58,219],"an":[59,75],"interface-constrained":[60],"semi-Markov":[61],"decision":[62,66],"process":[63],"(IC-SMDP),":[64],"whose":[65],"epochs":[67],"occur":[68],"at":[69,84],"handoff":[70,86],"times,":[71],"design":[73],"IC-$Q$,":[74],"asynchronous":[76],"decentralized":[77,171],"$Q$-learning":[78,169],"algorithm":[79],"which":[81,151],"cross-agent":[82],"coordination":[83],"every":[85],"is":[87,94,162],"exactly":[88],"one":[89],"scalar.":[90],"Our":[91],"main":[92],"result":[93],"finite-sample":[96,165],"bound":[97,126,183,221],"for":[98,167],"neural":[99,109,168],"IC-$Q$":[100,196],"decomposes":[102],"into":[103],"three":[104,211],"independently":[105],"controllable":[106],"error":[107,212],"sources:":[108],"function-approximation":[110],"error,":[111],"interface":[112],"representation":[113],"gap,":[114],"mixing-time":[117],"residual,":[118],"under":[119,146,170],"random":[121,147],"option-duration":[122],"discount.":[123],"Establishing":[124],"requires":[127],"lifting":[128],"approximate":[130],"information":[131],"state":[132],"(AIS)":[133],"framework":[134],"from":[135],"single-agent":[136],"primitive-step":[137],"MDPs":[138],"to":[139],"SMDPs":[141],"controlling":[143],"Markovian":[144],"noise":[145],"duration,":[148],"neither":[149],"has":[152],"been":[153],"done":[154],"prior":[156],"work.":[157],"To":[158],"our":[159],"knowledge":[160],"first":[164],"guarantee":[166],"partial":[172],"observability.":[173],"Four":[174],"experiments:":[175],"controlled":[177],"synthetic":[178],"IC-SMDP":[179],"validates":[181],"term-by-term,":[184],"multi-LLM":[185],"mathematical":[186],"reasoning,":[187],"routing,":[189],"CPU":[192],"programming,":[193],"show":[194],"matches":[197],"oracle":[200],"without":[201],"any":[202],"observing":[204],"trajectories,":[206],"with":[207],"sources":[213],"scaling":[214],"along":[215],"corresponding":[217],"axis":[218],"predicts.":[222]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-05-21T00:00:00"}
