{"id":"https://openalex.org/W7133825736","doi":"https://doi.org/10.48550/arxiv.2603.04247","title":"Online Learning for Multi-Layer Hierarchical Inference under Partial and Policy-Dependent Feedback","display_name":"Online Learning for Multi-Layer Hierarchical Inference under Partial and Policy-Dependent Feedback","publication_year":2026,"publication_date":"2026-03-04","ids":{"openalex":"https://openalex.org/W7133825736","doi":"https://doi.org/10.48550/arxiv.2603.04247"},"language":null,"primary_location":{"id":"pmh:doi:10.48550/arxiv.2603.04247","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"type":"article","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":null,"any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5128144850","display_name":"Haoran Zhang (731854)","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Haoran","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128179117","display_name":"Seohyeon Cha","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cha, Seohyeon","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5091785648","display_name":"Hasan Burhan Beytur","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Beytur, Hasan Burhan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128186692","display_name":"Kevin S Chan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chan, Kevin S","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5008917819","display_name":"Gustavo de Veciana","orcid":"https://orcid.org/0000-0002-1498-494X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"de Veciana, Gustavo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5067602750","display_name":"Haris Vikalo","orcid":"https://orcid.org/0000-0002-7945-4114"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Vikalo, Haris","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.2297536,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.8698999881744385,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},"topics":[{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.8698999881744385,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.04769999906420708,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T13553","display_name":"Age of Information Optimization","score":0.015699999406933784,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/oracle","display_name":"Oracle","score":0.6571999788284302},{"id":"https://openalex.org/keywords/regret","display_name":"Regret","score":0.6340000033378601},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.6139000058174133},{"id":"https://openalex.org/keywords/estimator","display_name":"Estimator","score":0.5857999920845032},{"id":"https://openalex.org/keywords/observability","display_name":"Observability","score":0.5776000022888184},{"id":"https://openalex.org/keywords/hindsight-bias","display_name":"Hindsight bias","score":0.4855000078678131},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.4772999882698059},{"id":"https://openalex.org/keywords/node","display_name":"Node (physics)","score":0.43639999628067017},{"id":"https://openalex.org/keywords/routing","display_name":"Routing (electronic design automation)","score":0.424699991941452}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7251999974250793},{"id":"https://openalex.org/C55166926","wikidata":"https://www.wikidata.org/wiki/Q2892946","display_name":"Oracle","level":2,"score":0.6571999788284302},{"id":"https://openalex.org/C50817715","wikidata":"https://www.wikidata.org/wiki/Q79895177","display_name":"Regret","level":2,"score":0.6340000033378601},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.6139000058174133},{"id":"https://openalex.org/C185429906","wikidata":"https://www.wikidata.org/wiki/Q1130160","display_name":"Estimator","level":2,"score":0.5857999920845032},{"id":"https://openalex.org/C36299963","wikidata":"https://www.wikidata.org/wiki/Q1369844","display_name":"Observability","level":2,"score":0.5776000022888184},{"id":"https://openalex.org/C10347200","wikidata":"https://www.wikidata.org/wiki/Q1960297","display_name":"Hindsight bias","level":2,"score":0.4855000078678131},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.4772999882698059},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.43849998712539673},{"id":"https://openalex.org/C62611344","wikidata":"https://www.wikidata.org/wiki/Q1062658","display_name":"Node (physics)","level":2,"score":0.43639999628067017},{"id":"https://openalex.org/C74172769","wikidata":"https://www.wikidata.org/wiki/Q1446839","display_name":"Routing (electronic design automation)","level":2,"score":0.424699991941452},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4142000079154968},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.36890000104904175},{"id":"https://openalex.org/C2777472644","wikidata":"https://www.wikidata.org/wiki/Q16968992","display_name":"Approximate inference","level":3,"score":0.3402999937534332},{"id":"https://openalex.org/C22367795","wikidata":"https://www.wikidata.org/wiki/Q7625208","display_name":"Structured prediction","level":2,"score":0.32989999651908875},{"id":"https://openalex.org/C29202148","wikidata":"https://www.wikidata.org/wiki/Q287260","display_name":"Resource allocation","level":2,"score":0.32109999656677246},{"id":"https://openalex.org/C73602740","wikidata":"https://www.wikidata.org/wiki/Q7795822","display_name":"Thompson sampling","level":3,"score":0.30250000953674316},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.296099990606308},{"id":"https://openalex.org/C124101348","wikidata":"https://www.wikidata.org/wiki/Q172491","display_name":"Data mining","level":1,"score":0.2930000126361847},{"id":"https://openalex.org/C206345919","wikidata":"https://www.wikidata.org/wiki/Q20380951","display_name":"Resource (disambiguation)","level":2,"score":0.2921000123023987},{"id":"https://openalex.org/C2986087404","wikidata":"https://www.wikidata.org/wiki/Q15946010","display_name":"Online learning","level":2,"score":0.28130000829696655},{"id":"https://openalex.org/C80444323","wikidata":"https://www.wikidata.org/wiki/Q2878974","display_name":"Theoretical computer science","level":1,"score":0.275299996137619},{"id":"https://openalex.org/C54108766","wikidata":"https://www.wikidata.org/wiki/Q391064","display_name":"Packet loss","level":3,"score":0.2741999924182892},{"id":"https://openalex.org/C107673813","wikidata":"https://www.wikidata.org/wiki/Q812534","display_name":"Bayesian probability","level":2,"score":0.27140000462532043},{"id":"https://openalex.org/C160234255","wikidata":"https://www.wikidata.org/wiki/Q812535","display_name":"Bayesian inference","level":3,"score":0.266400009393692},{"id":"https://openalex.org/C110875604","wikidata":"https://www.wikidata.org/wiki/Q75","display_name":"The Internet","level":2,"score":0.26089999079704285},{"id":"https://openalex.org/C774472","wikidata":"https://www.wikidata.org/wiki/Q6760393","display_name":"Margin (machine learning)","level":2,"score":0.257999986410141},{"id":"https://openalex.org/C917703","wikidata":"https://www.wikidata.org/wiki/Q7239668","display_name":"Predictive inference","level":5,"score":0.2549000084400177},{"id":"https://openalex.org/C74193536","wikidata":"https://www.wikidata.org/wiki/Q574844","display_name":"Kernel (algebra)","level":2,"score":0.25049999356269836}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:doi:10.48550/arxiv.2603.04247","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},{"id":"doi:10.48550/arxiv.2603.04247","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.04247","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:doi:10.48550/arxiv.2603.04247","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Hierarchical":[0],"inference":[1,41,90],"systems":[2,38],"route":[3],"tasks":[4],"across":[5,46],"multiple":[6],"computational":[7],"layers,":[8,47],"where":[9],"each":[10],"node":[11,24],"may":[12],"either":[13],"finalize":[14],"a":[15,23,57,63,126],"prediction":[16,51],"locally":[17],"or":[18],"offload":[19],"the":[20,26,100,119,152],"task":[21],"to":[22,78,151,179],"in":[25,36,68,157],"next":[27],"layer":[28],"for":[29,87],"further":[30],"processing.":[31],"Learning":[32],"optimal":[33],"routing":[34,86,155],"policies":[35],"such":[37],"is":[39,43,53],"challenging:":[40],"loss":[42,102,136],"defined":[44],"recursively":[45],"while":[48],"feedback":[49,66,115],"on":[50,169],"error":[52],"revealed":[54],"only":[55],"at":[56],"terminal":[58],"oracle":[59],"layer.":[60],"This":[61],"induces":[62],"partial,":[64],"policy-dependent":[65,144],"structure":[67,103],"which":[69],"observability":[70],"probabilities":[71],"decay":[72],"with":[73,131],"depth,":[74],"causing":[75],"importance-weighted":[76,108,181],"estimators":[77],"suffer":[79],"from":[80],"amplified":[81],"variance.":[82],"We":[83,98,146],"study":[84],"online":[85],"multi-layer":[88],"hierarchical":[89],"under":[91,141,162],"long-term":[92],"resource":[93,166],"constraints":[94],"and":[95,104,138,143,159,165,176],"terminal-only":[96],"feedback.":[97,145],"formalize":[99],"recursive":[101],"show":[105],"that":[106],"naive":[107],"contextual":[109],"bandit":[110],"methods":[111],"become":[112],"unstable":[113],"as":[114],"probability":[116],"decays":[117],"along":[118],"hierarchy.":[120],"To":[121],"address":[122],"this,":[123],"we":[124],"develop":[125],"variance-reduced":[127],"EXP4-based":[128],"algorithm":[129],"integrated":[130],"Lyapunov":[132],"optimization,":[133],"yielding":[134],"unbiased":[135],"estimation":[137],"stable":[139],"learning":[140],"sparse":[142],"provide":[147],"regret":[148],"guarantees":[149],"relative":[150],"best":[153],"fixed":[154],"policy":[156],"hindsight":[158],"establish":[160],"near-optimality":[161],"stochastic":[163],"arrivals":[164],"constraints.":[167],"Experiments":[168],"large-scale":[170],"multi-task":[171],"workloads":[172],"demonstrate":[173],"improved":[174],"stability":[175],"performance":[177],"compared":[178],"standard":[180],"approaches.":[182]},"counts_by_year":[],"updated_date":"2026-07-15T18:14:33.161393","created_date":"2026-03-06T00:00:00"}
