{"id":"https://openalex.org/W7161154181","doi":"https://doi.org/10.48550/arxiv.2605.13217","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","display_name":"GAGPO: Generalized Advantage Grouped Policy Optimization","publication_year":2026,"publication_date":"2026-05-13","ids":{"openalex":"https://openalex.org/W7161154181","doi":"https://doi.org/10.48550/arxiv.2605.13217"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.13217","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.13217","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.13217","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5087395604","display_name":"Siyuan Zhu","orcid":"https://orcid.org/0000-0002-0470-2523"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhu, Siyuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136110128","display_name":"Chao Yu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yu, Chao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5124054088","display_name":"Rongxin Yang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yang, Rongxin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136174371","display_name":"Zongkai Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Zongkai","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136143864","display_name":"Jinjun Hu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Hu, Jinjun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136091624","display_name":"Qiwen Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Qiwen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5136181152","display_name":"Yibo Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Yibo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.625,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.625,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.0681999996304512,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.049300000071525574,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7925000190734863},{"id":"https://openalex.org/keywords/normalization","display_name":"Normalization (sociology)","score":0.5419999957084656},{"id":"https://openalex.org/keywords/proxy","display_name":"Proxy (statistics)","score":0.45649999380111694},{"id":"https://openalex.org/keywords/outcome","display_name":"Outcome (game theory)","score":0.43290001153945923},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.4185999929904938},{"id":"https://openalex.org/keywords/optimization-problem","display_name":"Optimization problem","score":0.3783999979496002},{"id":"https://openalex.org/keywords/temporal-difference-learning","display_name":"Temporal difference learning","score":0.37540000677108765}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7925000190734863},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6527000069618225},{"id":"https://openalex.org/C136886441","wikidata":"https://www.wikidata.org/wiki/Q926129","display_name":"Normalization (sociology)","level":2,"score":0.5419999957084656},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.504800021648407},{"id":"https://openalex.org/C2780148112","wikidata":"https://www.wikidata.org/wiki/Q1432581","display_name":"Proxy (statistics)","level":2,"score":0.45649999380111694},{"id":"https://openalex.org/C148220186","wikidata":"https://www.wikidata.org/wiki/Q7111912","display_name":"Outcome (game theory)","level":2,"score":0.43290001153945923},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.42149999737739563},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.4185999929904938},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.3783999979496002},{"id":"https://openalex.org/C196340769","wikidata":"https://www.wikidata.org/wiki/Q7698910","display_name":"Temporal difference learning","level":3,"score":0.37540000677108765},{"id":"https://openalex.org/C2776291640","wikidata":"https://www.wikidata.org/wiki/Q2912517","display_name":"Value (mathematics)","level":2,"score":0.3528999984264374},{"id":"https://openalex.org/C136197465","wikidata":"https://www.wikidata.org/wiki/Q1729295","display_name":"Variety (cybernetics)","level":2,"score":0.32670000195503235},{"id":"https://openalex.org/C204323151","wikidata":"https://www.wikidata.org/wiki/Q905424","display_name":"Range (aeronautics)","level":2,"score":0.3070000112056732},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.30379998683929443},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.29260000586509705},{"id":"https://openalex.org/C2780586882","wikidata":"https://www.wikidata.org/wiki/Q7520643","display_name":"Simple (philosophy)","level":2,"score":0.2777000069618225},{"id":"https://openalex.org/C2908647359","wikidata":"https://www.wikidata.org/wiki/Q2625603","display_name":"Population","level":2,"score":0.2743000090122223}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.13217","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.13217","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.13217","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.13217","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.5582811832427979,"id":"https://metadata.un.org/sdg/16","display_name":"Peace, Justice and strong institutions"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1,81,145],"has":[2],"become":[3],"a":[4,20,49,78,91,164],"powerful":[5],"paradigm":[6],"for":[7,83,169],"post-training":[8],"large":[9],"language":[10],"model":[11],"agents,":[12],"yet":[13,166],"credit":[14,87],"assignment":[15],"in":[16],"multi-turn":[17,132,170],"environments":[18],"remains":[19,66],"challenge.":[21],"Agents":[22],"often":[23],"receive":[24],"sparse,":[25],"trajectory-level":[26],"rewards":[27],"only":[28],"at":[29],"the":[30],"end":[31],"of":[32],"an":[33,67,120],"episode,":[34],"making":[35],"it":[36,101],"difficult":[37],"to":[38,44,55,102],"determine":[39],"which":[40],"intermediate":[41],"actions":[42],"contributed":[43],"success":[45],"or":[46],"failure.":[47],"As":[48],"result,":[50],"propagating":[51,108],"delayed":[52],"outcomes":[53],"back":[54],"individual":[56],"decision":[57],"steps":[58],"without":[59],"relying":[60],"on":[61,135],"costly":[62],"auxiliary":[63],"value":[64,94],"models":[65],"open":[68],"problem.":[69],"We":[70],"propose":[71],"Generalized":[72],"Advantage":[73],"Grouped":[74],"Policy":[75],"Optimization":[76],"(GAGPO),":[77],"critic-free":[79],"reinforcement":[80,144,172],"method":[82],"precise,":[84],"step-aligned":[85],"temporal":[86,105],"assignment.":[88],"GAGPO":[89,124,141,162],"constructs":[90],"non-parametric":[92],"grouped":[93],"proxy":[95],"from":[96,131],"sampled":[97],"rollouts":[98],"and":[99,119,137,156],"uses":[100],"compute":[103],"TD/GAE-style":[104],"advantages,":[106],"recursively":[107],"outcome":[109],"supervision":[110],"backward":[111],"through":[112],"time.":[113],"Combined":[114],"with":[115],"group-wise":[116],"advantage":[117],"normalization":[118],"action-level":[121],"importance":[122],"ratio,":[123],"extracts":[125],"stable,":[126],"localized":[127],"optimization":[128,158],"signals":[129],"directly":[130],"trajectories.":[133],"Experiments":[134],"ALFWorld":[136],"WebShop":[138],"show":[139],"that":[140,161],"outperforms":[142],"strong":[143],"baselines.":[146],"Further":[147],"analyses":[148],"demonstrate":[149],"faster":[150],"early-stage":[151],"learning,":[152],"improved":[153],"interaction":[154],"efficiency,":[155],"smoother":[157],"dynamics,":[159],"suggesting":[160],"offers":[163],"simple":[165],"effective":[167],"framework":[168],"agentic":[171],"learning.":[173]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-15T00:00:00"}
