{"id":"https://openalex.org/W7168239641","doi":"https://doi.org/10.48550/arxiv.2607.10169","title":"Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization","display_name":"Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization","publication_year":2026,"publication_date":"2026-07-11","ids":{"openalex":"https://openalex.org/W7168239641","doi":"https://doi.org/10.48550/arxiv.2607.10169"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2607.10169","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.10169","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2607.10169","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5140720288","display_name":"Zhicheng Cai","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cai, Zhicheng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140730335","display_name":"Xinyuan Guo","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Guo, Xinyuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140716586","display_name":"Hanlin Wu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wu, Hanlin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140712622","display_name":"Mingxuan Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Mingxuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140740257","display_name":"Wei-Ying Ma","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ma, Wei-Ying","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140610680","display_name":"Ya-Qin Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Ya-Qin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5140714182","display_name":"Hao Zhou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhou, Hao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9275000095367432,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9275000095367432,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.011699999682605267,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.0052999998442828655,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/euclidean-geometry","display_name":"Euclidean geometry","score":0.6700000166893005},{"id":"https://openalex.org/keywords/heuristic","display_name":"Heuristic","score":0.6252999901771545},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.45989999175071716},{"id":"https://openalex.org/keywords/isometric-exercise","display_name":"Isometric exercise","score":0.4302999973297119},{"id":"https://openalex.org/keywords/work","display_name":"Work (physics)","score":0.3758000135421753},{"id":"https://openalex.org/keywords/riemannian-geometry","display_name":"Riemannian geometry","score":0.37119999527931213}],"concepts":[{"id":"https://openalex.org/C129782007","wikidata":"https://www.wikidata.org/wiki/Q162886","display_name":"Euclidean geometry","level":2,"score":0.6700000166893005},{"id":"https://openalex.org/C173801870","wikidata":"https://www.wikidata.org/wiki/Q201413","display_name":"Heuristic","level":2,"score":0.6252999901771545},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.4943999946117401},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.45989999175071716},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.4546999931335449},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.44670000672340393},{"id":"https://openalex.org/C103486182","wikidata":"https://www.wikidata.org/wiki/Q1216236","display_name":"Isometric exercise","level":2,"score":0.4302999973297119},{"id":"https://openalex.org/C18762648","wikidata":"https://www.wikidata.org/wiki/Q42213","display_name":"Work (physics)","level":2,"score":0.3758000135421753},{"id":"https://openalex.org/C181104567","wikidata":"https://www.wikidata.org/wiki/Q761383","display_name":"Riemannian geometry","level":2,"score":0.37119999527931213},{"id":"https://openalex.org/C120174047","wikidata":"https://www.wikidata.org/wiki/Q847073","display_name":"Euclidean distance","level":2,"score":0.37059998512268066},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.33180001378059387},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.2985999882221222},{"id":"https://openalex.org/C28826006","wikidata":"https://www.wikidata.org/wiki/Q33521","display_name":"Applied mathematics","level":1,"score":0.28380000591278076},{"id":"https://openalex.org/C192939610","wikidata":"https://www.wikidata.org/wiki/Q188444","display_name":"Differential geometry","level":2,"score":0.27720001339912415},{"id":"https://openalex.org/C136119220","wikidata":"https://www.wikidata.org/wiki/Q1000660","display_name":"Algebra over a field","level":2,"score":0.267300009727478}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2607.10169","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.10169","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2607.10169","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.10169","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1],"(RL)":[2],"has":[3],"become":[4],"a":[5,119],"dominant":[6],"paradigm":[7],"for":[8],"enhancing":[9],"LLMs'":[10],"reasoning":[11],"capabilities.":[12],"However,":[13],"RL":[14,135],"algorithms":[15,136],"with":[16,59],"PPO-Clip":[17],"are":[18],"inherently":[19],"limited":[20],"by":[21],"exploration":[22,110],"collapse.":[23],"Subsequent":[24],"works":[25],"remain":[26],"primarily":[27],"heuristic":[28],"and":[29,111],"fail":[30],"to":[31,142],"identify":[32],"the":[33,42,60,64,105],"essential":[34],"cause":[35],"of":[36,45],"PPO-Clip's":[37],"failure.":[38],"This":[39,68],"work":[40],"reveals":[41],"fundamental":[43],"flaw":[44],"PPO-Clip:":[46],"it":[47],"implicitly":[48],"measures":[49],"policy":[50,65,102],"discrepancy":[51],"using":[52],"Euclidean":[53],"metric,":[54],"which":[55,99,123],"is":[56],"theoretically":[57],"inconsistent":[58],"intrinsic":[61],"geometry":[62],"on":[63,104,147],"Riemannian":[66,94,106],"manifold.":[67],"geometric":[69,90],"mismatch":[70],"results":[71],"in":[72,76,81],"overly":[73],"conservative":[74],"updates":[75,103],"low-probability":[77],"regions":[78],"while":[79],"aggressive":[80],"high-probability":[82],"regions,":[83],"ultimately":[84],"collapsing":[85],"exploration.":[86],"To":[87],"correct":[88],"this":[89],"flaw,":[91],"we":[92],"propose":[93],"Isometric":[95],"Policy":[96],"Optimization":[97],"(RIPO),":[98],"guarantees":[100],"isometric":[101],"manifold,":[107],"effectively":[108],"balancing":[109],"exploitation.":[112],"We":[113],"further":[114],"show":[115],"that":[116,129],"RIPO":[117,130],"achieves":[118],"favorable":[120],"bias-variance":[121],"trade-off,":[122],"stabilizes":[124],"optimization.":[125],"Extensive":[126],"experiments":[127],"demonstrate":[128],"significantly":[131],"surpasses":[132],"existing":[133],"LLM":[134],"across":[137],"seven":[138],"competition-level":[139],"benchmarks":[140],"(up":[141],"60%":[143],"improvement":[144],"over":[145],"GRPO":[146],"AIME24).":[148]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-07-15T00:00:00"}
