{"id":"https://openalex.org/W7163674903","doi":"https://doi.org/10.48550/arxiv.2606.05885","title":"When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training","display_name":"When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training","publication_year":2026,"publication_date":"2026-06-04","ids":{"openalex":"https://openalex.org/W7163674903","doi":"https://doi.org/10.48550/arxiv.2606.05885"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.05885","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.05885","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.05885","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5135407126","display_name":"Yuanfan Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Yuanfan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137937037","display_name":"Qi Zhou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhou, Qi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5014942974","display_name":"Wenjing Duan","orcid":"https://orcid.org/0000-0001-6300-0073"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Duan, Wenjing","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5137943116","display_name":"Lu Chen","orcid":"https://orcid.org/0009-0002-8561-1646"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Lu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9419000148773193,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9419000148773193,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.006800000090152025,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.004399999976158142,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/training","display_name":"Training (meteorology)","score":0.623199999332428},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6215000152587891},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.5110999941825867},{"id":"https://openalex.org/keywords/q-learning","display_name":"Q-learning","score":0.3400000035762787},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.3370000123977661},{"id":"https://openalex.org/keywords/policy-learning","display_name":"Policy learning","score":0.3294999897480011}],"concepts":[{"id":"https://openalex.org/C2777211547","wikidata":"https://www.wikidata.org/wiki/Q17141490","display_name":"Training (meteorology)","level":2,"score":0.623199999332428},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6215000152587891},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5764999985694885},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.5110999941825867},{"id":"https://openalex.org/C162324750","wikidata":"https://www.wikidata.org/wiki/Q8134","display_name":"Economics","level":0,"score":0.4115000069141388},{"id":"https://openalex.org/C162118730","wikidata":"https://www.wikidata.org/wiki/Q1128453","display_name":"Actuarial science","level":1,"score":0.376800000667572},{"id":"https://openalex.org/C144133560","wikidata":"https://www.wikidata.org/wiki/Q4830453","display_name":"Business","level":0,"score":0.3698999881744385},{"id":"https://openalex.org/C175444787","wikidata":"https://www.wikidata.org/wiki/Q39072","display_name":"Microeconomics","level":1,"score":0.3621000051498413},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.35339999198913574},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.3400000035762787},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.3370000123977661},{"id":"https://openalex.org/C2779436431","wikidata":"https://www.wikidata.org/wiki/Q30672407","display_name":"Policy learning","level":2,"score":0.3294999897480011},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3273000121116638},{"id":"https://openalex.org/C109986646","wikidata":"https://www.wikidata.org/wiki/Q546113","display_name":"Public policy","level":2,"score":0.3246999979019165},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.3158999979496002},{"id":"https://openalex.org/C10138342","wikidata":"https://www.wikidata.org/wiki/Q43015","display_name":"Finance","level":1,"score":0.31470000743865967},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.3073999881744385},{"id":"https://openalex.org/C112930515","wikidata":"https://www.wikidata.org/wiki/Q4389547","display_name":"Risk analysis (engineering)","level":1,"score":0.29809999465942383},{"id":"https://openalex.org/C149782125","wikidata":"https://www.wikidata.org/wiki/Q160039","display_name":"Econometrics","level":1,"score":0.288100004196167},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.28189998865127563},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.26969999074935913},{"id":"https://openalex.org/C2993078247","wikidata":"https://www.wikidata.org/wiki/Q182076","display_name":"Bank credit","level":2,"score":0.26969999074935913},{"id":"https://openalex.org/C2778137410","wikidata":"https://www.wikidata.org/wiki/Q2732820","display_name":"Government (linguistics)","level":2,"score":0.2529999911785126}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.05885","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.05885","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.05885","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.05885","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16","score":0.46725594997406006}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Long-horizon":[0],"LLM":[1],"agents":[2],"require":[3],"reinforcement":[4],"learning":[5],"methods":[6,21],"that":[7,39,78,120],"can":[8,43],"assign":[9],"credit":[10,42,81],"to":[11],"intermediate":[12],"decisions":[13],"under":[14,47],"sparse":[15],"and":[16,63,96,115],"delayed":[17],"rewards.":[18],"Recent":[19],"group-based":[20],"such":[22,40],"as":[23],"GiGPO":[24,127],"improve":[25],"over":[26],"GRPO":[27],"by":[28,93,109,128],"constructing":[29],"step-level":[30,80],"advantages":[31],"at":[32],"repeated":[33],"anchor":[34,61,106],"states.":[35],"However,":[36],"we":[37],"show":[38,119],"dense":[41],"be":[44],"statistically":[45],"unreliable:":[46],"limited":[48],"rollouts,":[49],"rare":[50],"but":[51],"lucky":[52],"actions":[53,95],"may":[54],"receive":[55],"overly":[56],"large":[57],"advantages,":[58],"producing":[59],"divergent":[60],"bias":[62],"late-stage":[64],"training":[65],"oscillation.":[66],"We":[67],"propose":[68],"Evidence-Calibrated":[69,87],"Policy":[70],"Optimization":[71],"(ECPO),":[72],"a":[73],"critic-free":[74],"policy":[75,83],"optimization":[76],"algorithm":[77],"calibrates":[79],"before":[82],"updates.":[84],"ECPO":[85,121],"combines":[86],"Action":[88],"Advantage,":[89],"which":[90,104],"groups":[91],"rollouts":[92],"canonical":[94],"shrinks":[97],"low-count":[98],"estimates,":[99],"with":[100,117,134],"Variance-Gated":[101],"Credit":[102],"Weighting,":[103],"suppresses":[105],"states":[107],"dominated":[108],"within-action":[110],"noise.":[111],"Experiments":[112],"on":[113,132],"ALFWorld":[114],"WebShop":[116],"Qwen2.5-1.5B/7B":[118],"consistently":[122],"outperforms":[123],"strong":[124],"baselines,":[125],"improving":[126],"+5.2/+7.3":[129],"success":[130],"points":[131],"ALFWorld/WebShop":[133],"Qwen2.5-1.5B":[135],"while":[136],"adding":[137],"only":[138],"0.1%":[139],"additional":[140],"advantage-computation":[141],"overhead.":[142]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-06-06T00:00:00"}
