{"id":"https://openalex.org/W7113896486","doi":"https://doi.org/10.1109/lcsys.2025.3642767","title":"Training Task Reasoning LLM Agents for Multi-Turn Task Planning via Single-Turn Reinforcement Learning","display_name":"Training Task Reasoning LLM Agents for Multi-Turn Task Planning via Single-Turn Reinforcement Learning","publication_year":2025,"publication_date":"2025-01-01","ids":{"openalex":"https://openalex.org/W7113896486","doi":"https://doi.org/10.1109/lcsys.2025.3642767"},"language":null,"primary_location":{"id":"doi:10.1109/lcsys.2025.3642767","is_oa":false,"landing_page_url":"https://doi.org/10.1109/lcsys.2025.3642767","pdf_url":null,"source":{"id":"https://openalex.org/S4306422535","display_name":"IEEE Control Systems Letters","issn_l":"2475-1456","issn":["2475-1456"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319808","host_organization_name":"Institute of Electrical and Electronics Engineers","host_organization_lineage":["https://openalex.org/P4310319808"],"host_organization_lineage_names":["Institute of Electrical and Electronics Engineers"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Control Systems Letters","raw_type":"journal-article"},"type":"article","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":null,"display_name":"Hanjiang Hu","orcid":"https://orcid.org/0000-0002-5698-5887"},"institutions":[{"id":"https://openalex.org/I4210159266","display_name":"Mitsubishi Electric (United States)","ror":"https://ror.org/053jnhe44","country_code":"US","type":"company","lineage":["https://openalex.org/I1306287861","https://openalex.org/I4210133125","https://openalex.org/I4210159266"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Hanjiang Hu","raw_affiliation_strings":["Mitsubishi Electric Research Laboratories, Cambridge, MA, USA"],"raw_orcid":"https://orcid.org/0000-0002-5698-5887","affiliations":[{"raw_affiliation_string":"Mitsubishi Electric Research Laboratories, Cambridge, MA, USA","institution_ids":["https://openalex.org/I4210159266"]}]},{"author_position":"middle","author":{"id":null,"display_name":"Changliu Liu","orcid":"https://orcid.org/0000-0002-3767-5517"},"institutions":[{"id":"https://openalex.org/I74973139","display_name":"Carnegie Mellon University","ror":"https://ror.org/05x2bcf33","country_code":"US","type":"education","lineage":["https://openalex.org/I74973139"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Changliu Liu","raw_affiliation_strings":["Robotics Institute, Carnegie Mellon University, Pittsburgh, PA, USA"],"raw_orcid":"https://orcid.org/0000-0002-3767-5517","affiliations":[{"raw_affiliation_string":"Robotics Institute, Carnegie Mellon University, Pittsburgh, PA, USA","institution_ids":["https://openalex.org/I74973139"]}]},{"author_position":"middle","author":{"id":null,"display_name":"Na Li","orcid":"https://orcid.org/0000-0001-9545-3050"},"institutions":[{"id":"https://openalex.org/I4210159266","display_name":"Mitsubishi Electric (United States)","ror":"https://ror.org/053jnhe44","country_code":"US","type":"company","lineage":["https://openalex.org/I1306287861","https://openalex.org/I4210133125","https://openalex.org/I4210159266"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Na Li","raw_affiliation_strings":["Mitsubishi Electric Research Laboratories, Cambridge, MA, USA"],"raw_orcid":"https://orcid.org/0000-0001-9545-3050","affiliations":[{"raw_affiliation_string":"Mitsubishi Electric Research Laboratories, Cambridge, MA, USA","institution_ids":["https://openalex.org/I4210159266"]}]},{"author_position":"last","author":{"id":null,"display_name":"Yebin Wang","orcid":"https://orcid.org/0000-0001-7209-7866"},"institutions":[{"id":"https://openalex.org/I4210159266","display_name":"Mitsubishi Electric (United States)","ror":"https://ror.org/053jnhe44","country_code":"US","type":"company","lineage":["https://openalex.org/I1306287861","https://openalex.org/I4210133125","https://openalex.org/I4210159266"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Yebin Wang","raw_affiliation_strings":["Mitsubishi Electric Research Laboratories, Cambridge, MA, USA"],"raw_orcid":"https://orcid.org/0000-0001-7209-7866","affiliations":[{"raw_affiliation_string":"Mitsubishi Electric Research Laboratories, Cambridge, MA, USA","institution_ids":["https://openalex.org/I4210159266"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.72858905,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":"9","issue":null,"first_page":"2879","last_page":"2884"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.29919999837875366,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.29919999837875366,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.24539999663829803,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.1371999979019165,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7724999785423279},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.765999972820282},{"id":"https://openalex.org/keywords/benchmark","display_name":"Benchmark (surveying)","score":0.6449999809265137},{"id":"https://openalex.org/keywords/baseline","display_name":"Baseline (sea)","score":0.5702000260353088},{"id":"https://openalex.org/keywords/generalization","display_name":"Generalization","score":0.5551000237464905},{"id":"https://openalex.org/keywords/overhead","display_name":"Overhead (engineering)","score":0.4772000014781952}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7724999785423279},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.765999972820282},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7245000004768372},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6639000177383423},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.6449999809265137},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5820000171661377},{"id":"https://openalex.org/C12725497","wikidata":"https://www.wikidata.org/wiki/Q810247","display_name":"Baseline (sea)","level":2,"score":0.5702000260353088},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.5551000237464905},{"id":"https://openalex.org/C2779960059","wikidata":"https://www.wikidata.org/wiki/Q7113681","display_name":"Overhead (engineering)","level":2,"score":0.4772000014781952},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.46399998664855957},{"id":"https://openalex.org/C28006648","wikidata":"https://www.wikidata.org/wiki/Q6934509","display_name":"Multi-task learning","level":3,"score":0.44440001249313354},{"id":"https://openalex.org/C2777211547","wikidata":"https://www.wikidata.org/wiki/Q17141490","display_name":"Training (meteorology)","level":2,"score":0.28279998898506165},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2718000113964081},{"id":"https://openalex.org/C13687954","wikidata":"https://www.wikidata.org/wiki/Q4826847","display_name":"Autonomous agent","level":2,"score":0.25780001282691956}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/lcsys.2025.3642767","is_oa":false,"landing_page_url":"https://doi.org/10.1109/lcsys.2025.3642767","pdf_url":null,"source":{"id":"https://openalex.org/S4306422535","display_name":"IEEE Control Systems Letters","issn_l":"2475-1456","issn":["2475-1456"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319808","host_organization_name":"Institute of Electrical and Electronics Engineers","host_organization_lineage":["https://openalex.org/P4310319808"],"host_organization_lineage_names":["Institute of Electrical and Electronics Engineers"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Control Systems Letters","raw_type":"journal-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":2,"referenced_works":["https://openalex.org/W4402672014","https://openalex.org/W4403883066"],"related_works":[],"abstract_inverted_index":{"Large":[0],"Language":[1],"Models":[2],"(LLMs)":[3],"have":[4],"demonstrated":[5],"remarkable":[6],"capabilities":[7],"in":[8,51,104],"knowledge":[9],"acquisition,":[10],"reasoning,":[11],"and":[12,44,86],"tool":[13],"use,":[14],"making":[15],"them":[16],"promising":[17],"candidates":[18],"for":[19,27,162],"autonomous":[20],"agent":[21],"applications.":[22],"However,":[23],"training":[24],"LLM":[25],"agents":[26],"complex":[28,131],"multi-turn":[29,52,66,110],"task":[30,67,71,101,132],"planning":[31,68,133,164],"faces":[32],"significant":[33],"challenges,":[34],"including":[35],"sparse":[36],"episode-wise":[37],"rewards,":[38],"credit":[39],"assignment":[40],"across":[41],"long":[42],"horizons,":[43],"the":[45,109,114,120,130],"computational":[46],"overhead":[47],"of":[48,108,160],"reinforcement":[49],"learning":[50],"interaction":[53],"settings.":[54],"To":[55],"this":[56,58],"end,":[57],"paper":[59],"introduces":[60],"a":[61,105],"novel":[62],"approach":[63],"that":[64,96,136],"transforms":[65],"into":[69],"single-turn":[70,100,143],"reasoning":[72,102],"problems,":[73],"enabling":[74],"efficient":[75],"policy":[76],"optimization":[77],"through":[78],"Group":[79],"Relative":[80],"Policy":[81],"Optimization":[82],"(GRPO)":[83],"with":[84,124,142,157],"dense":[85],"verifiable":[87],"reward":[88],"from":[89],"expert":[90],"trajectories.":[91],"Our":[92],"theoretical":[93],"analysis":[94],"shows":[95],"GRPO":[97,144],"improvement":[98],"on":[99,129],"results":[103],"lower":[106],"bound":[107],"success":[111,158],"probability":[112],"under":[113],"minimal":[115],"turns,":[116],"as":[117,119],"well":[118],"generalization":[121],"to":[122,149,154],"subtasks":[123],"shorter":[125],"horizons.":[126],"Experimental":[127],"evaluation":[128],"benchmark":[134],"demonstrates":[135],"our":[137],"1.5B":[138],"parameter":[139],"model":[140],"trained":[141],"achieves":[145],"superior":[146],"performance":[147],"compared":[148],"larger":[150],"baseline":[151],"models":[152],"up":[153],"14B":[155],"parameters,":[156],"rates":[159],"70%":[161],"long-horizon":[163],"tasks.":[165]},"counts_by_year":[],"updated_date":"2025-12-30T23:08:21.542490","created_date":"2025-12-11T00:00:00"}
