{"id":"https://openalex.org/W7160600533","doi":"https://doi.org/10.48550/arxiv.2605.06642","title":"StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction","display_name":"StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction","publication_year":2026,"publication_date":"2026-05-07","ids":{"openalex":"https://openalex.org/W7160600533","doi":"https://doi.org/10.48550/arxiv.2605.06642"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.06642","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.06642","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.06642","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5120706712","display_name":"Xiangyuan Xue","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xue, Xiangyuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135715274","display_name":"Yifan Zhou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhou, Yifan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135638848","display_name":"ZiDong Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Zidong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134096870","display_name":"Shengji Tang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tang, Shengji","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135708686","display_name":"Philip Torr","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Torr, Philip","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135645670","display_name":"Wanli Ouyang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ouyang, Wanli","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135679000","display_name":"Lei Bai","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bai, Lei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5135671150","display_name":"Zhenfei Yin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yin, Zhenfei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.542900025844574,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.542900025844574,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.13249999284744263,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.06800000369548798,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.75},{"id":"https://openalex.org/keywords/trajectory","display_name":"Trajectory","score":0.7152000069618225},{"id":"https://openalex.org/keywords/abstraction","display_name":"Abstraction","score":0.7057999968528748},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.6444000005722046},{"id":"https://openalex.org/keywords/sample","display_name":"Sample (material)","score":0.5059000253677368},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.47920000553131104},{"id":"https://openalex.org/keywords/train","display_name":"Train","score":0.42399999499320984},{"id":"https://openalex.org/keywords/simple","display_name":"Simple (philosophy)","score":0.4088999927043915}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.75},{"id":"https://openalex.org/C13662910","wikidata":"https://www.wikidata.org/wiki/Q193139","display_name":"Trajectory","level":2,"score":0.7152000069618225},{"id":"https://openalex.org/C124304363","wikidata":"https://www.wikidata.org/wiki/Q673661","display_name":"Abstraction","level":2,"score":0.7057999968528748},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7026000022888184},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.6444000005722046},{"id":"https://openalex.org/C198531522","wikidata":"https://www.wikidata.org/wiki/Q485146","display_name":"Sample (material)","level":2,"score":0.5059000253677368},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.47920000553131104},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.46860000491142273},{"id":"https://openalex.org/C190839683","wikidata":"https://www.wikidata.org/wiki/Q2448197","display_name":"Train","level":2,"score":0.42399999499320984},{"id":"https://openalex.org/C2780586882","wikidata":"https://www.wikidata.org/wiki/Q7520643","display_name":"Simple (philosophy)","level":2,"score":0.4088999927043915},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3822000026702881},{"id":"https://openalex.org/C2778445095","wikidata":"https://www.wikidata.org/wiki/Q18354077","display_name":"Sample complexity","level":2,"score":0.37070000171661377},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.3402999937534332},{"id":"https://openalex.org/C2779436431","wikidata":"https://www.wikidata.org/wiki/Q30672407","display_name":"Policy learning","level":2,"score":0.3151000142097473},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.3116999864578247},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.3061999976634979},{"id":"https://openalex.org/C12298181","wikidata":"https://www.wikidata.org/wiki/Q7246814","display_name":"Proactive learning","level":5,"score":0.2870999872684479},{"id":"https://openalex.org/C47932503","wikidata":"https://www.wikidata.org/wiki/Q5395689","display_name":"Error-driven learning","level":3,"score":0.27630001306533813},{"id":"https://openalex.org/C173246807","wikidata":"https://www.wikidata.org/wiki/Q7833062","display_name":"Trajectory optimization","level":3,"score":0.26809999346733093},{"id":"https://openalex.org/C2777552389","wikidata":"https://www.wikidata.org/wiki/Q1962728","display_name":"Course (navigation)","level":2,"score":0.2662000060081482},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.25459998846054077}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.06642","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.06642","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.06642","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.06642","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","score":0.7776567339897156,"id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Large":[0],"language":[1],"models":[2],"(LLMs)":[3],"are":[4,22],"increasingly":[5],"used":[6],"as":[7],"interactive":[8],"agents,":[9],"but":[10],"optimizing":[11],"them":[12],"for":[13],"long-horizon":[14],"decision":[15],"making":[16],"remains":[17],"difficult":[18],"because":[19],"current":[20],"methods":[21],"largely":[23],"purely":[24],"reactive,":[25],"which":[26],"weakens":[27],"both":[28,109],"exploration":[29],"and":[30,75,79,95,102,112,126],"credit":[31],"assignment":[32],"over":[33,115],"extended":[34],"trajectories.":[35],"In":[36],"this":[37],"work,":[38],"we":[39],"present":[40],"Strategic":[41],"Trajectory":[42],"Abstraction":[43],"(StraTA),":[44],"a":[45,61,84,134],"simple":[46],"framework":[47],"that":[48,73,105],"introduces":[49],"an":[50],"explicit":[51],"trajectory-level":[52],"strategy":[53,63,77,93],"into":[54],"agentic":[55],"reinforcement":[56],"learning":[57],"(RL).":[58],"StraTA":[59,106,118,132],"samples":[60],"compact":[62],"from":[64],"the":[65],"initial":[66],"task":[67],"state,":[68],"conditions":[69],"subsequent":[70],"actions":[71],"on":[72,99,124,128],"strategy,":[74],"trains":[76],"generation":[78],"action":[80],"execution":[81],"jointly":[82],"with":[83],"hierarchical":[85],"GRPO-style":[86],"rollout":[87,94],"design,":[88],"further":[89],"enhanced":[90],"by":[91],"diverse":[92],"critical":[96],"self-judgment.":[97],"Experiments":[98],"ALFWorld,":[100],"WebShop,":[101],"SciWorld":[103],"show":[104],"consistently":[107],"improves":[108],"sample":[110],"efficiency":[111],"final":[113],"performance":[114],"strong":[116],"baselines.":[117],"reaches":[119],"success":[120],"rates":[121],"of":[122],"93.1%":[123],"ALFWorld":[125],"84.2%":[127],"WebShop.":[129],"On":[130],"SciWorld,":[131],"attains":[133],"63.5%":[135],"overall":[136],"score,":[137],"outperforming":[138],"frontier":[139],"closed-source":[140],"models.":[141]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-05-09T00:00:00"}
