{"id":"https://openalex.org/W7159690661","doi":"https://doi.org/10.48550/arxiv.2604.27998","title":"Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning","display_name":"Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning","publication_year":2026,"publication_date":"2026-04-30","ids":{"openalex":"https://openalex.org/W7159690661","doi":"https://doi.org/10.48550/arxiv.2604.27998"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.27998","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.27998","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.27998","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5134967475","display_name":"Jingcheng Deng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Deng, Jingcheng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134935977","display_name":"Zihao Wei","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wei, Zihao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134968085","display_name":"Liang Pang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Pang, Liang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134930454","display_name":"Junhong Wu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wu, Junhong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134938151","display_name":"Shicheng Xu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xu, Shicheng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134958491","display_name":"Zenghao Duan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Duan, Zenghao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5134986988","display_name":"Huawei Shen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shen, Huawei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.4456999897956848,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.4456999897956848,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.11389999836683273,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.05570000037550926,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/initialization","display_name":"Initialization","score":0.5925999879837036},{"id":"https://openalex.org/keywords/latent-variable","display_name":"Latent variable","score":0.5672000050544739},{"id":"https://openalex.org/keywords/latent-class-model","display_name":"Latent class model","score":0.5139999985694885},{"id":"https://openalex.org/keywords/focus","display_name":"Focus (optics)","score":0.48739999532699585},{"id":"https://openalex.org/keywords/latent-variable-model","display_name":"Latent variable model","score":0.42899999022483826},{"id":"https://openalex.org/keywords/mixture-model","display_name":"Mixture model","score":0.4027999937534332},{"id":"https://openalex.org/keywords/bayesian-probability","display_name":"Bayesian probability","score":0.30140000581741333}],"concepts":[{"id":"https://openalex.org/C114466953","wikidata":"https://www.wikidata.org/wiki/Q6034165","display_name":"Initialization","level":2,"score":0.5925999879837036},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.589900016784668},{"id":"https://openalex.org/C51167844","wikidata":"https://www.wikidata.org/wiki/Q4422623","display_name":"Latent variable","level":2,"score":0.5672000050544739},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.531000018119812},{"id":"https://openalex.org/C70727504","wikidata":"https://www.wikidata.org/wiki/Q1806878","display_name":"Latent class model","level":2,"score":0.5139999985694885},{"id":"https://openalex.org/C192209626","wikidata":"https://www.wikidata.org/wiki/Q190909","display_name":"Focus (optics)","level":2,"score":0.48739999532699585},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4587000012397766},{"id":"https://openalex.org/C65965080","wikidata":"https://www.wikidata.org/wiki/Q1806885","display_name":"Latent variable model","level":3,"score":0.42899999022483826},{"id":"https://openalex.org/C61224824","wikidata":"https://www.wikidata.org/wiki/Q2260434","display_name":"Mixture model","level":2,"score":0.4027999937534332},{"id":"https://openalex.org/C107673813","wikidata":"https://www.wikidata.org/wiki/Q812534","display_name":"Bayesian probability","level":2,"score":0.30140000581741333},{"id":"https://openalex.org/C20162079","wikidata":"https://www.wikidata.org/wiki/Q1151406","display_name":"Case-based reasoning","level":2,"score":0.28049999475479126},{"id":"https://openalex.org/C177769412","wikidata":"https://www.wikidata.org/wiki/Q278090","display_name":"Prior probability","level":3,"score":0.2694000005722046},{"id":"https://openalex.org/C140779682","wikidata":"https://www.wikidata.org/wiki/Q210868","display_name":"Sampling (signal processing)","level":3,"score":0.2612000107765198},{"id":"https://openalex.org/C2778572836","wikidata":"https://www.wikidata.org/wiki/Q380933","display_name":"Space (punctuation)","level":2,"score":0.25940001010894775},{"id":"https://openalex.org/C89288958","wikidata":"https://www.wikidata.org/wiki/Q7301504","display_name":"Reasoning system","level":2,"score":0.25839999318122864},{"id":"https://openalex.org/C112933361","wikidata":"https://www.wikidata.org/wiki/Q2845258","display_name":"Probabilistic latent semantic analysis","level":2,"score":0.25429999828338623},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.25049999356269836}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.27998","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.27998","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.27998","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.27998","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.42058971524238586,"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Latent":[0],"reasoning":[1,9,13,20,25,62,67,181],"offers":[2],"a":[3],"more":[4],"efficient":[5,203],"alternative":[6],"to":[7,60],"explicit":[8,169],"by":[10,160,171],"compressing":[11],"intermediate":[12],"into":[14],"continuous":[15],"representations":[16],"and":[17,32,54,73,106,137,148,167,202],"substantially":[18],"shortening":[19],"chains.":[21,182],"However,":[22],"existing":[23],"latent":[24,36,61,66,84,94,107,115,158,204],"methods":[26],"mainly":[27],"focus":[28],"on":[29,164,174],"supervised":[30],"learning,":[31],"reinforcement":[33],"learning":[34],"in":[35],"space":[37],"remains":[38],"highly":[39],"unstable.":[40],"We":[41],"study":[42],"this":[43],"problem":[44],"through":[45],"the":[46,70,74,92],"lens":[47],"of":[48,82],"Group":[49],"Relative":[50],"Policy":[51],"Optimization":[52],"(GRPO),":[53],"show":[55],"that":[56],"directly":[57],"adapting":[58],"GRPO":[59,170],"is":[63],"fundamentally":[64],"non-trivial:":[65],"changes":[68],"both":[69],"probability":[71],"density":[72],"sampling":[75],"mechanism,":[76],"causing":[77],"three":[78],"coupled":[79],"bottlenecks:":[80],"absence":[81],"intrinsic":[83],"manifolds,":[85],"where":[86,98,110],"unconstrained":[87],"exploration":[88],"pushes":[89],"rollouts":[90],"off":[91],"valid":[93],"manifold;":[95],"exploration-optimization":[96],"misalignment,":[97],"trajectory-level":[99],"rewards":[100],"can":[101,117],"induce":[102],"incorrect":[103],"token-level":[104],"updates;":[105],"mixture":[108],"non-closure,":[109],"jointly":[111],"reinforcing":[112],"multiple":[113],"correct":[114],"paths":[116],"produce":[118],"an":[119,197],"invalid":[120],"averaged":[121],"state.":[122],"To":[123],"address":[124],"them,":[125],"we":[126],"propose":[127],"\\textbf{Latent-GRPO},":[128],"which":[129],"combines":[130],"invalid-sample":[131],"advantage":[132],"masking,":[133],"one-sided":[134],"noise":[135],"sampling,":[136],"optimal":[138],"correct-path":[139],"first-token":[140],"selection.":[141],"Across":[142],"four":[143,149],"low-difficulty":[144,165],"benchmarks":[145,151],"(e.g.,":[146,152],"GSM8K-Aug)":[147],"high-difficulty":[150,175],"AIME),":[153],"Latent-GRPO":[154,195],"improves":[155],"over":[156],"its":[157],"initialization":[159],"7.86":[161],"Pass@1":[162],"points":[163,173],"tasks":[166,176],"surpasses":[168],"4.27":[172],"while":[177],"using":[178],"3--4$\\times$":[179],"shorter":[180],"It":[183],"also":[184],"achieves":[185],"stronger":[186],"pass@$k$":[187],"performance":[188],"under":[189],"Gumbel":[190],"sampling.":[191],"These":[192],"results":[193],"establish":[194],"as":[196],"effective":[198],"approach":[199],"for":[200],"stable":[201],"reasoning.":[205]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-02T00:00:00"}
