{"id":"https://openalex.org/W7167971283","doi":"https://doi.org/10.48550/arxiv.2607.08012","title":"Provably Optimal Learning Algorithms for Assistance Games","display_name":"Provably Optimal Learning Algorithms for Assistance Games","publication_year":2026,"publication_date":"2026-07-09","ids":{"openalex":"https://openalex.org/W7167971283","doi":"https://doi.org/10.48550/arxiv.2607.08012"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2607.08012","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.08012","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2607.08012","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5041790875","display_name":"Nivasini Ananthakrishnan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ananthakrishnan, Nivasini","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135982465","display_name":"Mark Bedaywi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bedaywi, Mark","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140433475","display_name":"Michael I. Jordan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jordan, Michael I.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140400217","display_name":"Stuart Russell","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Russell, Stuart","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5080772091","display_name":"Nika Haghtalab","orcid":"https://orcid.org/0000-0002-8612-2089"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Haghtalab, Nika","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.8478999733924866,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},"topics":[{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.8478999733924866,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.06689999997615814,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11031","display_name":"Game Theory and Applications","score":0.04280000180006027,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/regret","display_name":"Regret","score":0.8574000000953674},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.512499988079071},{"id":"https://openalex.org/keywords/state","display_name":"State (computer science)","score":0.4855000078678131},{"id":"https://openalex.org/keywords/logarithm","display_name":"Logarithm","score":0.4702000021934509},{"id":"https://openalex.org/keywords/string","display_name":"String (physics)","score":0.3986000120639801},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.3465999960899353},{"id":"https://openalex.org/keywords/factor","display_name":"Factor (programming language)","score":0.33889999985694885},{"id":"https://openalex.org/keywords/probably-approximately-correct-learning","display_name":"Probably approximately correct learning","score":0.33739998936653137}],"concepts":[{"id":"https://openalex.org/C50817715","wikidata":"https://www.wikidata.org/wiki/Q79895177","display_name":"Regret","level":2,"score":0.8574000000953674},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7085999846458435},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.512499988079071},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.4855000078678131},{"id":"https://openalex.org/C39927690","wikidata":"https://www.wikidata.org/wiki/Q11197","display_name":"Logarithm","level":2,"score":0.4702000021934509},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.4697999954223633},{"id":"https://openalex.org/C157486923","wikidata":"https://www.wikidata.org/wiki/Q1376436","display_name":"String (physics)","level":2,"score":0.3986000120639801},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3693999946117401},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.3465999960899353},{"id":"https://openalex.org/C2781039887","wikidata":"https://www.wikidata.org/wiki/Q1391724","display_name":"Factor (programming language)","level":2,"score":0.33889999985694885},{"id":"https://openalex.org/C176248197","wikidata":"https://www.wikidata.org/wiki/Q458526","display_name":"Probably approximately correct learning","level":4,"score":0.33739998936653137},{"id":"https://openalex.org/C90119067","wikidata":"https://www.wikidata.org/wiki/Q43260","display_name":"Polynomial","level":2,"score":0.3357999920845032},{"id":"https://openalex.org/C80444323","wikidata":"https://www.wikidata.org/wiki/Q2878974","display_name":"Theoretical computer science","level":1,"score":0.335099995136261},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.33169999718666077},{"id":"https://openalex.org/C166109690","wikidata":"https://www.wikidata.org/wiki/Q4677422","display_name":"Action selection","level":3,"score":0.31470000743865967},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.2928999960422516},{"id":"https://openalex.org/C774472","wikidata":"https://www.wikidata.org/wiki/Q6760393","display_name":"Margin (machine learning)","level":2,"score":0.29249998927116394},{"id":"https://openalex.org/C51167844","wikidata":"https://www.wikidata.org/wiki/Q4422623","display_name":"Latent variable","level":2,"score":0.271699994802475},{"id":"https://openalex.org/C148764684","wikidata":"https://www.wikidata.org/wiki/Q621751","display_name":"Approximation algorithm","level":2,"score":0.27160000801086426},{"id":"https://openalex.org/C2986087404","wikidata":"https://www.wikidata.org/wiki/Q15946010","display_name":"Online learning","level":2,"score":0.2687999904155731},{"id":"https://openalex.org/C196083921","wikidata":"https://www.wikidata.org/wiki/Q7915758","display_name":"Variance (accounting)","level":2,"score":0.26409998536109924},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.2605000138282776}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2607.08012","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.08012","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2607.08012","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.08012","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"This":[0],"paper":[1],"studies":[2],"an":[3,12,16],"online":[4],"variant":[5],"of":[6,40,69,78,82,114,122,182],"the":[7,31,41,43,50,55,67,72,75,83,102,105,120,123,140],"assistance":[8,63,70,111],"games":[9],"framework,":[10],"where":[11],"informed":[13,32],"agent":[14,18,33,45],"and":[15,80,104,125],"uninformed":[17,44],"repeatedly":[19],"interact":[20],"over":[21],"$T$":[22],"timesteps":[23],"to":[24,93,167,178,186],"optimize":[25],"a":[26,37,109,146,168,173,180],"common":[27],"reward":[28],"function.":[29],"While":[30],"(the":[34,46],"human)":[35],"observes":[36,48],"latent":[38,91],"state":[39,126],"world,":[42],"assistant)":[47],"only":[49],"human's":[51],"actions.":[52],"We":[53,65,96,142],"provide":[54],"first":[56],"provably":[57],"efficient":[58],"learning":[59],"algorithms":[60,99,129,163],"for":[61,100,139],"repeated":[62],"games.":[64],"introduce":[66],"notion":[68],"regret:":[71],"gap":[73],"between":[74],"cumulative":[76],"utility":[77],"interactions":[79],"that":[81,107,144],"optimal":[84,184],"joint":[85],"policies":[86],"in":[87,119,132],"hindsight,":[88],"which":[89],"map":[90],"states":[92],"action":[94,124],"pairs.":[95],"present":[97],"decentralized":[98],"both":[101],"human":[103],"assistant":[106],"achieve":[108,179],"$(1-1/e)$-approximate":[110],"regret":[112,147],"rate":[113,181],"$\\widetilde{O}(T^{3/4})$,":[115],"with":[116],"runtime":[117],"polynomial":[118],"size":[121],"spaces.":[127],"These":[128],"are":[130],"general;":[131],"particular,":[133],"they":[134],"accommodate":[135],"any":[136],"no-regret":[137,162],"algorithm":[138],"assistant.":[141],"prove":[143],"achieving":[145],"approximation":[148],"factor":[149],"better":[150],"than":[151],"$(1-1/e)$":[152],"is":[153],"computationally":[154],"intractable.":[155],"Furthermore,":[156],"we":[157],"demonstrate":[158],"how":[159],"these":[160],"generic":[161],"can":[164],"be":[165],"tailored":[166],"pseudo-decentralized":[169],"setting":[170],"--":[171,177],"using":[172],"shared":[174],"random":[175],"string":[176],"$\\widetilde{O}(T^{1/2})$,":[183],"up":[185],"logarithmic":[187],"factors.":[188]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-07-11T00:00:00"}
