{"id":"https://openalex.org/W7117250523","doi":"https://doi.org/10.1109/ton.2025.3648382","title":"Distributed Learning for Multi-Stage Bandits: No-Regret Algorithm and Lower Bound","display_name":"Distributed Learning for Multi-Stage Bandits: No-Regret Algorithm and Lower Bound","publication_year":2025,"publication_date":"2025-12-25","ids":{"openalex":"https://openalex.org/W7117250523","doi":"https://doi.org/10.1109/ton.2025.3648382"},"language":null,"primary_location":{"id":"doi:10.1109/ton.2025.3648382","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ton.2025.3648382","pdf_url":null,"source":{"id":"https://openalex.org/S5407042750","display_name":"IEEE Transactions on Networking","issn_l":"2998-4157","issn":["2998-4157"],"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Transactions on Networking","raw_type":"journal-article"},"type":"article","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5060672325","display_name":"I-Hong Hou","orcid":"https://orcid.org/0000-0002-1166-8773"},"institutions":[{"id":"https://openalex.org/I91045830","display_name":"Texas A&M University","ror":"https://ror.org/01f5ytq51","country_code":"US","type":"education","lineage":["https://openalex.org/I91045830"]}],"countries":["US"],"is_corresponding":true,"raw_author_name":"I-Hong Hou","raw_affiliation_strings":["Department of ECE, Texas A&#x0026;M University, College Station, TX, USA"],"raw_orcid":"https://orcid.org/0000-0002-1166-8773","affiliations":[{"raw_affiliation_string":"Department of ECE, Texas A&#x0026;M University, College Station, TX, USA","institution_ids":["https://openalex.org/I91045830"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":["https://openalex.org/A5060672325"],"corresponding_institution_ids":["https://openalex.org/I91045830"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.63163174,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":"34","issue":null,"first_page":"2416","last_page":"2429"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.9728999733924866,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},"topics":[{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.9728999733924866,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T11031","display_name":"Game Theory and Applications","score":0.005200000014156103,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.003800000064074993,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/sublinear-function","display_name":"Sublinear function","score":0.7832000255584717},{"id":"https://openalex.org/keywords/regret","display_name":"Regret","score":0.7304999828338623},{"id":"https://openalex.org/keywords/oracle","display_name":"Oracle","score":0.6743000149726868},{"id":"https://openalex.org/keywords/upper-and-lower-bounds","display_name":"Upper and lower bounds","score":0.542900025844574},{"id":"https://openalex.org/keywords/distributed-algorithm","display_name":"Distributed algorithm","score":0.49709999561309814},{"id":"https://openalex.org/keywords/variety","display_name":"Variety (cybernetics)","score":0.4368000030517578},{"id":"https://openalex.org/keywords/online-learning","display_name":"Online learning","score":0.4115999937057495},{"id":"https://openalex.org/keywords/distributed-learning","display_name":"Distributed learning","score":0.41100001335144043},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.3783000111579895}],"concepts":[{"id":"https://openalex.org/C117160843","wikidata":"https://www.wikidata.org/wiki/Q338652","display_name":"Sublinear function","level":2,"score":0.7832000255584717},{"id":"https://openalex.org/C50817715","wikidata":"https://www.wikidata.org/wiki/Q79895177","display_name":"Regret","level":2,"score":0.7304999828338623},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6942999958992004},{"id":"https://openalex.org/C55166926","wikidata":"https://www.wikidata.org/wiki/Q2892946","display_name":"Oracle","level":2,"score":0.6743000149726868},{"id":"https://openalex.org/C77553402","wikidata":"https://www.wikidata.org/wiki/Q13222579","display_name":"Upper and lower bounds","level":2,"score":0.542900025844574},{"id":"https://openalex.org/C130120984","wikidata":"https://www.wikidata.org/wiki/Q2835898","display_name":"Distributed algorithm","level":2,"score":0.49709999561309814},{"id":"https://openalex.org/C136197465","wikidata":"https://www.wikidata.org/wiki/Q1729295","display_name":"Variety (cybernetics)","level":2,"score":0.4368000030517578},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.42750000953674316},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.42559999227523804},{"id":"https://openalex.org/C2986087404","wikidata":"https://www.wikidata.org/wiki/Q15946010","display_name":"Online learning","level":2,"score":0.4115999937057495},{"id":"https://openalex.org/C2779582901","wikidata":"https://www.wikidata.org/wiki/Q21013010","display_name":"Distributed learning","level":2,"score":0.41100001335144043},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.3783000111579895},{"id":"https://openalex.org/C2780586882","wikidata":"https://www.wikidata.org/wiki/Q7520643","display_name":"Simple (philosophy)","level":2,"score":0.37770000100135803},{"id":"https://openalex.org/C2777212361","wikidata":"https://www.wikidata.org/wiki/Q5127848","display_name":"Class (philosophy)","level":2,"score":0.37720000743865967},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.36169999837875366},{"id":"https://openalex.org/C148220186","wikidata":"https://www.wikidata.org/wiki/Q7111912","display_name":"Outcome (game theory)","level":2,"score":0.3522999882698059},{"id":"https://openalex.org/C37736160","wikidata":"https://www.wikidata.org/wiki/Q1801315","display_name":"Adversarial system","level":2,"score":0.3490999937057495},{"id":"https://openalex.org/C41550386","wikidata":"https://www.wikidata.org/wiki/Q529909","display_name":"Multi-agent system","level":2,"score":0.32269999384880066},{"id":"https://openalex.org/C36686422","wikidata":"https://www.wikidata.org/wiki/Q11167","display_name":"Tilde","level":2,"score":0.3176000118255615},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.31369999051094055},{"id":"https://openalex.org/C46814582","wikidata":"https://www.wikidata.org/wiki/Q23389","display_name":"Nash equilibrium","level":2,"score":0.302700012922287},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.2915000021457672},{"id":"https://openalex.org/C80444323","wikidata":"https://www.wikidata.org/wiki/Q2878974","display_name":"Theoretical computer science","level":1,"score":0.2842999994754791},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.28349998593330383},{"id":"https://openalex.org/C196921405","wikidata":"https://www.wikidata.org/wiki/Q786431","display_name":"Online algorithm","level":2,"score":0.2800999879837036},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.2754000127315521},{"id":"https://openalex.org/C95627357","wikidata":"https://www.wikidata.org/wiki/Q7979889","display_name":"Weighted Majority Algorithm","level":5,"score":0.26820001006126404},{"id":"https://openalex.org/C73602740","wikidata":"https://www.wikidata.org/wiki/Q7795822","display_name":"Thompson sampling","level":3,"score":0.26030001044273376}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/ton.2025.3648382","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ton.2025.3648382","pdf_url":null,"source":{"id":"https://openalex.org/S5407042750","display_name":"IEEE Transactions on Networking","issn_l":"2998-4157","issn":["2998-4157"],"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Transactions on Networking","raw_type":"journal-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[{"id":"https://openalex.org/G4174256167","display_name":null,"funder_award_id":"W911NF-22-1-015","funder_id":"https://openalex.org/F4320338281","funder_display_name":"Army Research Office"},{"id":"https://openalex.org/G4798458958","display_name":null,"funder_award_id":"CCF-2332800","funder_id":"https://openalex.org/F4320306076","funder_display_name":"National Science Foundation"},{"id":"https://openalex.org/G5110785868","display_name":null,"funder_award_id":"N000142412615","funder_id":"https://openalex.org/F4320337345","funder_display_name":"Office of Naval Research"},{"id":"https://openalex.org/G741275359","display_name":null,"funder_award_id":"ECCS-2127721","funder_id":"https://openalex.org/F4320306076","funder_display_name":"National Science Foundation"},{"id":"https://openalex.org/G7619895760","display_name":null,"funder_award_id":"W911NF-22-1-015","funder_id":"https://openalex.org/F5115820410","funder_display_name":"Army Contracting Command - Aberdeen Proving Ground"}],"funders":[{"id":"https://openalex.org/F4320306076","display_name":"National Science Foundation","ror":"https://ror.org/021nxhr62"},{"id":"https://openalex.org/F4320337345","display_name":"Office of Naval Research","ror":"https://ror.org/00rk2pe57"},{"id":"https://openalex.org/F4320338281","display_name":"Army Research Office","ror":"https://ror.org/05epdh915"},{"id":"https://openalex.org/F5115820410","display_name":"Army Contracting Command - Aberdeen Proving Ground","ror":null}],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":27,"referenced_works":["https://openalex.org/W1625390266","https://openalex.org/W1976495016","https://openalex.org/W1985422740","https://openalex.org/W2069317438","https://openalex.org/W2077902449","https://openalex.org/W2103724767","https://openalex.org/W2126316555","https://openalex.org/W2140571193","https://openalex.org/W2170294075","https://openalex.org/W2543823843","https://openalex.org/W2789066082","https://openalex.org/W2887117815","https://openalex.org/W2947863222","https://openalex.org/W2950929549","https://openalex.org/W2962747795","https://openalex.org/W3000370936","https://openalex.org/W3000993635","https://openalex.org/W3118244830","https://openalex.org/W3140137197","https://openalex.org/W3198204252","https://openalex.org/W3198227059","https://openalex.org/W3215366842","https://openalex.org/W4206683864","https://openalex.org/W4226083856","https://openalex.org/W4285606386","https://openalex.org/W4292022450","https://openalex.org/W4403018115"],"related_works":[],"abstract_inverted_index":{"Motivated":[0],"by":[1,33,66],"the":[2,51,55,69,98,114,118,126,146,151,174,189,196,222,233],"distributed":[3,80,165],"nature":[4],"of":[5,54,74,93,128,148,191,203,215],"many":[6],"network":[7,216],"applications,":[8],"this":[9,75,94,156],"paper":[10,76,95],"proposes":[11],"a":[12,23,34,132,163,178,201,213],"new":[13],"online":[14,81,166,229],"learning":[15,82,147,167,230],"problem":[16],"called":[17],"multi-stage":[18,21],"bandits.":[19],"In":[20,111],"bandits,":[22],"job":[24],"needs":[25,139],"to":[26,78,113,140,144,195],"go":[27],"through":[28],"multiple":[29,129],"stages,":[30],"each":[31],"managed":[32],"different":[35],"agent,":[36],"before":[37],"generating":[38],"an":[39,137],"outcome.":[40],"Each":[41],"agent":[42,107,138],"can":[43],"only":[44,105],"control":[45,62],"its":[46,142],"own":[47],"action":[48],"and":[49,108],"learn":[50],"final":[52],"outcome":[53],"job.":[56],"It":[57],"has":[58],"neither":[59],"knowledge":[60],"nor":[61],"on":[63,212],"actions":[64,143],"taken":[65],"agents":[67,149],"in":[68,88,117,150],"next":[70,152],"stage.":[71,110,153],"The":[72,91],"goal":[73],"is":[77,177,193],"develop":[79],"algorithms":[83,231],"that":[84,125,173,181,188,221],"achieve":[85],"sublinear":[86,183],"regret":[87,190,197],"adversarial":[89],"environments.":[90],"setting":[92],"significantly":[96,225],"expands":[97],"traditional":[99,119,234],"multi-armed":[100,120,235],"bandit":[101,121,236],"problem,":[102,122],"which":[103],"considers":[104],"one":[106,109],"addition":[112],"exploration-exploitation":[115],"dilemma":[116],"we":[123,161,208],"show":[124,187,220],"consideration":[127],"stages":[130],"introduces":[131],"third":[133],"component,":[134],"education,":[135],"where":[136],"choose":[141],"facilitate":[145],"To":[154],"solve":[155],"newly":[157],"introduced":[158],"exploration-exploitation-education":[159],"trilemma,":[160],"propose":[162],"simple":[164],"algorithm,":[168],"\u03f5\u2212EXP3.":[169],"We":[170,185],"theoretically":[171],"prove":[172],"\u03f5\u2212EXP3":[175,192,223],"algorithm":[176,224],"no-regret":[179,228],"policy":[180],"achieves":[182],"regret.":[184],"also":[186],"close":[194],"lower":[198],"bound":[199],"under":[200],"class":[202],"time-homogeneous":[204],"oracle":[205],"policies.":[206],"Finally,":[207],"conduct":[209],"simulation":[210],"studies":[211],"variety":[214],"applications.":[217],"Simulation":[218],"results":[219],"outperforms":[226],"existing":[227],"for":[232],"problem.":[237]},"counts_by_year":[],"updated_date":"2026-01-14T23:40:02.550235","created_date":"2025-12-25T00:00:00"}
