{"id":"https://openalex.org/W7161232441","doi":"https://doi.org/10.48550/arxiv.2605.14350","title":"Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling","display_name":"Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling","publication_year":2026,"publication_date":"2026-05-14","ids":{"openalex":"https://openalex.org/W7161232441","doi":"https://doi.org/10.48550/arxiv.2605.14350"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.14350","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.14350","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.14350","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5090519403","display_name":"Nicholas E. Corrado","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Corrado, Nicholas E.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136192158","display_name":"Wenyuan Huang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Huang, Wenyuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5133904780","display_name":"Josiah P. Hanna","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Hanna, Josiah P.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.5630999803543091,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.5630999803543091,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.11079999804496765,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.10769999772310257,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.76419997215271},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.6850000023841858},{"id":"https://openalex.org/keywords/sampling","display_name":"Sampling (signal processing)","score":0.5562999844551086},{"id":"https://openalex.org/keywords/minimax","display_name":"Minimax","score":0.4986000061035156},{"id":"https://openalex.org/keywords/adaptive-sampling","display_name":"Adaptive sampling","score":0.445499986410141},{"id":"https://openalex.org/keywords/focus","display_name":"Focus (optics)","score":0.414900004863739},{"id":"https://openalex.org/keywords/importance-sampling","display_name":"Importance sampling","score":0.3765999972820282},{"id":"https://openalex.org/keywords/task-analysis","display_name":"Task analysis","score":0.35409998893737793}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7918999791145325},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.76419997215271},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.6850000023841858},{"id":"https://openalex.org/C140779682","wikidata":"https://www.wikidata.org/wiki/Q210868","display_name":"Sampling (signal processing)","level":3,"score":0.5562999844551086},{"id":"https://openalex.org/C149728462","wikidata":"https://www.wikidata.org/wiki/Q751319","display_name":"Minimax","level":2,"score":0.4986000061035156},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4779999852180481},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4569999873638153},{"id":"https://openalex.org/C2781395549","wikidata":"https://www.wikidata.org/wiki/Q4680762","display_name":"Adaptive sampling","level":3,"score":0.445499986410141},{"id":"https://openalex.org/C192209626","wikidata":"https://www.wikidata.org/wiki/Q190909","display_name":"Focus (optics)","level":2,"score":0.414900004863739},{"id":"https://openalex.org/C52740198","wikidata":"https://www.wikidata.org/wiki/Q1539564","display_name":"Importance sampling","level":3,"score":0.3765999972820282},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.35409998893737793},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.3292999863624573},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.32190001010894775},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.2978000044822693},{"id":"https://openalex.org/C28006648","wikidata":"https://www.wikidata.org/wiki/Q6934509","display_name":"Multi-task learning","level":3,"score":0.2858999967575073},{"id":"https://openalex.org/C73602740","wikidata":"https://www.wikidata.org/wiki/Q7795822","display_name":"Thompson sampling","level":3,"score":0.2806999981403351},{"id":"https://openalex.org/C160920958","wikidata":"https://www.wikidata.org/wiki/Q7662746","display_name":"Synthetic data","level":2,"score":0.2727999985218048},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.27149999141693115},{"id":"https://openalex.org/C18762648","wikidata":"https://www.wikidata.org/wiki/Q42213","display_name":"Work (physics)","level":2,"score":0.2648000121116638},{"id":"https://openalex.org/C2778915421","wikidata":"https://www.wikidata.org/wiki/Q3643177","display_name":"Performance improvement","level":2,"score":0.26179999113082886}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.14350","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.14350","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.14350","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.14350","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Multi-task":[0],"reinforcement":[1],"learning":[2],"(MTRL)":[3],"aims":[4],"to":[5,10,45,56,80,86,94,99,107,184],"train":[6],"a":[7,63,139,146,158,167],"single":[8],"agent":[9],"efficiently":[11],"optimize":[12],"performance":[13,182],"across":[14],"multiple":[15],"tasks":[16,22,31,88,101,127],"simultaneously.":[17],"However,":[18],"jointly":[19],"optimizing":[20],"all":[21],"often":[23],"yields":[24],"imbalanced":[25,68],"learning:":[26],"agents":[27],"quickly":[28],"solve":[29,95],"easy":[30,87],"but":[32],"learn":[33],"slowly":[34],"on":[35,62,166],"harder":[36],"ones.":[37],"While":[38],"prior":[39],"work":[40],"primarily":[41],"attributes":[42],"this":[43,111],"imbalance":[44],"conflicting":[46],"task":[47,186],"gradients":[48],"and":[49,65,96,162,173,179],"proposes":[50],"gradient":[51],"manipulation":[52],"or":[53],"specialized":[54],"architectures":[55],"address":[57,110],"it,":[58],"we":[59,113,144],"instead":[60],"focus":[61],"distinct":[64],"under-explored":[66],"challenge:":[67],"data":[69,85,98,177],"allocation.":[70],"Standard":[71],"MTRL":[72,137],"allocates":[73],"an":[74,121],"equal":[75],"number":[76],"of":[77],"environment":[78],"interactions":[79,93],"each":[81],"task,":[82],"which":[83,143],"over-allocates":[84],"that":[89,102,123],"require":[90,103],"relatively":[91],"few":[92],"under-allocates":[97],"hard":[100],"substantially":[104],"more":[105],"experience":[106],"solve.":[108],"To":[109],"challenge,":[112],"introduce":[114],"Distributionally":[115],"Robust":[116],"Adaptive":[117],"Task":[118],"Sampling":[119],"(DRATS),":[120],"algorithm":[122],"adaptively":[124],"prioritizes":[125],"sampling":[126,187],"furthest":[128],"from":[129,142],"being":[130],"solved.":[131],"We":[132],"derive":[133,145],"DRATS":[134,175],"by":[135],"formalizing":[136],"as":[138],"feasibility":[140],"problem":[141],"minimax":[147],"objective":[148],"for":[149],"minimizing":[150],"the":[151,155,163],"worst-case":[152],"return":[153,161,165],"gap,":[154],"difference":[156],"between":[157],"desired":[159],"target":[160],"agent's":[164],"task.":[168],"In":[169],"benchmarks":[170],"like":[171],"MetaWorld-MT10":[172],"MT50,":[174],"improves":[176],"efficiency":[178],"increases":[180],"worst-task":[181],"compared":[183],"existing":[185],"algorithms.":[188]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-16T00:00:00"}
