{"id":"https://openalex.org/W7162802750","doi":"https://doi.org/10.48550/arxiv.2605.29293","title":"LLM-ALSO: LLM-Driven Adaptive Learning-Signal Optimization for Multi-Agent Reinforcement Learning","display_name":"LLM-ALSO: LLM-Driven Adaptive Learning-Signal Optimization for Multi-Agent Reinforcement Learning","publication_year":2026,"publication_date":"2026-05-28","ids":{"openalex":"https://openalex.org/W7162802750","doi":"https://doi.org/10.48550/arxiv.2605.29293"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.29293","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.29293","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.29293","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5137382493","display_name":"Xiaoguang Wu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wu, Xiaoguang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137354115","display_name":"Zhi Zheng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zheng, Zhi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5137347476","display_name":"Hui Xiong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xiong, Hui","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7994999885559082,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7994999885559082,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.01269999984651804,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12535","display_name":"Machine Learning and Data Classification","score":0.012299999594688416,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8133000135421753},{"id":"https://openalex.org/keywords/adaptation","display_name":"Adaptation (eye)","score":0.5404999852180481},{"id":"https://openalex.org/keywords/generator","display_name":"Generator (circuit theory)","score":0.5266000032424927},{"id":"https://openalex.org/keywords/domain","display_name":"Domain (mathematical analysis)","score":0.45419999957084656},{"id":"https://openalex.org/keywords/active-learning","display_name":"Active learning (machine learning)","score":0.3443000018596649},{"id":"https://openalex.org/keywords/training","display_name":"Training (meteorology)","score":0.33239999413490295},{"id":"https://openalex.org/keywords/iterative-and-incremental-development","display_name":"Iterative and incremental development","score":0.3174000084400177},{"id":"https://openalex.org/keywords/iterative-learning-control","display_name":"Iterative learning control","score":0.3077000081539154}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8133000135421753},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7524999976158142},{"id":"https://openalex.org/C139807058","wikidata":"https://www.wikidata.org/wiki/Q352374","display_name":"Adaptation (eye)","level":2,"score":0.5404999852180481},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5396000146865845},{"id":"https://openalex.org/C2780992000","wikidata":"https://www.wikidata.org/wiki/Q17016113","display_name":"Generator (circuit theory)","level":3,"score":0.5266000032424927},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.49559998512268066},{"id":"https://openalex.org/C36503486","wikidata":"https://www.wikidata.org/wiki/Q11235244","display_name":"Domain (mathematical analysis)","level":2,"score":0.45419999957084656},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.3443000018596649},{"id":"https://openalex.org/C2777211547","wikidata":"https://www.wikidata.org/wiki/Q17141490","display_name":"Training (meteorology)","level":2,"score":0.33239999413490295},{"id":"https://openalex.org/C143587482","wikidata":"https://www.wikidata.org/wiki/Q1543216","display_name":"Iterative and incremental development","level":2,"score":0.3174000084400177},{"id":"https://openalex.org/C117619785","wikidata":"https://www.wikidata.org/wiki/Q6094414","display_name":"Iterative learning control","level":3,"score":0.3077000081539154},{"id":"https://openalex.org/C52970973","wikidata":"https://www.wikidata.org/wiki/Q2497134","display_name":"Adaptive system","level":2,"score":0.304500013589859},{"id":"https://openalex.org/C534262118","wikidata":"https://www.wikidata.org/wiki/Q177719","display_name":"Medical diagnosis","level":2,"score":0.29670000076293945},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.28110000491142273},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.27559998631477356},{"id":"https://openalex.org/C2776434776","wikidata":"https://www.wikidata.org/wiki/Q19246213","display_name":"Domain adaptation","level":3,"score":0.2689000070095062},{"id":"https://openalex.org/C22367795","wikidata":"https://www.wikidata.org/wiki/Q7625208","display_name":"Structured prediction","level":2,"score":0.26579999923706055},{"id":"https://openalex.org/C159694833","wikidata":"https://www.wikidata.org/wiki/Q2321565","display_name":"Iterative method","level":2,"score":0.2646999955177307},{"id":"https://openalex.org/C207685749","wikidata":"https://www.wikidata.org/wiki/Q2088941","display_name":"Domain knowledge","level":2,"score":0.2603999972343445},{"id":"https://openalex.org/C149364088","wikidata":"https://www.wikidata.org/wiki/Q185917","display_name":"Translation (biology)","level":4,"score":0.2596000134944916}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.29293","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.29293","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.29293","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.29293","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Effective":[0],"training-time":[1],"guidance":[2],"is":[3],"central":[4],"to":[5],"multi-agent":[6],"reinforcement":[7],"learning":[8,103,170],"(MARL),":[9],"yet":[10,48],"remains":[11],"difficult":[12],"in":[13],"sparse-reward":[14,159],"settings":[15],"where":[16],"weak":[17],"supervision":[18],"limits":[19],"coordination":[20,105],"and":[21,24,96,104,110,125,140,169],"policy":[22],"improvement,":[23],"existing":[25,49],"methods":[26,51],"often":[27],"require":[28],"substantial":[29],"domain":[30],"expertise":[31],"or":[32,56],"manual":[33],"design":[34],"effort.":[35],"Large":[36],"language":[37],"models":[38],"(LLMs)":[39],"provide":[40],"a":[41,98,114],"promising":[42],"alternative":[43],"for":[44,59,81],"flexible":[45],"learning-signal":[46,78],"design,":[47],"LLM-based":[50],"remain":[52],"largely":[53],"single-agent-oriented,":[54],"one-shot,":[55],"weakly":[57],"validated":[58,146],"the":[60,123,133,151],"evolving":[61],"training":[62,135],"dynamics":[63],"of":[64,153],"cooperative":[65,160],"MARL.":[66,82],"To":[67],"address":[68],"these":[69],"limitations,":[70],"we":[71],"propose":[72],"LLM-ALSO,":[73],"an":[74],"iterative":[75,93],"LLM-driven":[76],"adaptive":[77],"optimization":[79],"framework":[80],"Rather":[83],"than":[84],"directly":[85],"deploying":[86],"LLM-generated":[87,155],"rewards,":[88],"LLM-ALSO":[89,143,165],"decomposes":[90],"adaptation":[91],"into":[92,148],"diagnosis,":[94,124],"proposal,":[95],"validation:":[97],"Critic":[99],"LLM":[100,116],"diagnoses":[101],"stage-specific":[102],"failures":[106],"from":[107],"sparse-return":[108],"metrics":[109],"compact":[111],"behavior":[112],"evidence,":[113],"Generator":[115],"proposes":[117],"candidate":[118],"reward-shaping":[119],"configurations":[120],"conditioned":[121],"on":[122,158],"branch-validation":[126],"feedback":[127],"refines":[128],"candidates":[129],"before":[130],"they":[131],"affect":[132],"main":[134],"trajectory.":[136],"Through":[137],"short-horizon":[138],"validation":[139],"stage-aware":[141],"adaptation,":[142],"promotes":[144],"only":[145],"updates":[147],"training,":[149],"reducing":[150],"risk":[152],"unreliable":[154],"modifications.":[156],"Experiments":[157],"MARL":[161],"tasks":[162],"show":[163],"that":[164],"improves":[166],"sparse-evaluation":[167],"performance":[168],"efficiency.":[171]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-30T00:00:00"}
