{"id":"https://openalex.org/W7127130696","doi":"https://doi.org/10.48550/arxiv.2601.22582","title":"MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning","display_name":"MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning","publication_year":2026,"publication_date":"2026-01-30","ids":{"openalex":"https://openalex.org/W7127130696","doi":"https://doi.org/10.48550/arxiv.2601.22582"},"language":null,"primary_location":{"id":"pmh:doi:10.48550/arxiv.2601.22582","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"type":"article","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":null,"any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5082196231","display_name":"Youngeun Kim","orcid":"https://orcid.org/0000-0002-3542-7720"},"institutions":[],"countries":[],"is_corresponding":true,"raw_author_name":"Kim, Youngeun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":["https://openalex.org/A5082196231"],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.11802037,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.46889999508857727,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.46889999508857727,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12535","display_name":"Machine Learning and Data Classification","score":0.09529999643564224,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.05660000070929527,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/baseline","display_name":"Baseline (sea)","score":0.6419000029563904},{"id":"https://openalex.org/keywords/outlier","display_name":"Outlier","score":0.6207000017166138},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.54830002784729},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.49390000104904175},{"id":"https://openalex.org/keywords/range","display_name":"Range (aeronautics)","score":0.48240000009536743},{"id":"https://openalex.org/keywords/ranging","display_name":"Ranging","score":0.4535999894142151},{"id":"https://openalex.org/keywords/sign","display_name":"Sign (mathematics)","score":0.39750000834465027},{"id":"https://openalex.org/keywords/code","display_name":"Code (set theory)","score":0.39480000734329224}],"concepts":[{"id":"https://openalex.org/C12725497","wikidata":"https://www.wikidata.org/wiki/Q810247","display_name":"Baseline (sea)","level":2,"score":0.6419000029563904},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6291999816894531},{"id":"https://openalex.org/C79337645","wikidata":"https://www.wikidata.org/wiki/Q779824","display_name":"Outlier","level":2,"score":0.6207000017166138},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.54830002784729},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.49390000104904175},{"id":"https://openalex.org/C204323151","wikidata":"https://www.wikidata.org/wiki/Q905424","display_name":"Range (aeronautics)","level":2,"score":0.48240000009536743},{"id":"https://openalex.org/C115051666","wikidata":"https://www.wikidata.org/wiki/Q6522493","display_name":"Ranging","level":2,"score":0.4535999894142151},{"id":"https://openalex.org/C139676723","wikidata":"https://www.wikidata.org/wiki/Q1193832","display_name":"Sign (mathematics)","level":2,"score":0.39750000834465027},{"id":"https://openalex.org/C2776760102","wikidata":"https://www.wikidata.org/wiki/Q5139990","display_name":"Code (set theory)","level":3,"score":0.39480000734329224},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.37880000472068787},{"id":"https://openalex.org/C2780586882","wikidata":"https://www.wikidata.org/wiki/Q7520643","display_name":"Simple (philosophy)","level":2,"score":0.37549999356269836},{"id":"https://openalex.org/C149629883","wikidata":"https://www.wikidata.org/wiki/Q660926","display_name":"Fraction (chemistry)","level":2,"score":0.35749998688697815},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.3411000072956085},{"id":"https://openalex.org/C105795698","wikidata":"https://www.wikidata.org/wiki/Q12483","display_name":"Statistics","level":1,"score":0.33649998903274536},{"id":"https://openalex.org/C2781311116","wikidata":"https://www.wikidata.org/wiki/Q83306","display_name":"Group (periodic table)","level":2,"score":0.3312999904155731},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.329800009727478},{"id":"https://openalex.org/C22679943","wikidata":"https://www.wikidata.org/wiki/Q159375","display_name":"Standard deviation","level":2,"score":0.32679998874664307},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.31360000371932983},{"id":"https://openalex.org/C2164484","wikidata":"https://www.wikidata.org/wiki/Q5170150","display_name":"Core (optical fiber)","level":2,"score":0.2872999906539917},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.2847999930381775},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.27799999713897705},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.2766000032424927},{"id":"https://openalex.org/C61797465","wikidata":"https://www.wikidata.org/wiki/Q1188986","display_name":"Term (time)","level":2,"score":0.27250000834465027},{"id":"https://openalex.org/C151201525","wikidata":"https://www.wikidata.org/wiki/Q177239","display_name":"Limit (mathematics)","level":2,"score":0.2721000015735626},{"id":"https://openalex.org/C739882","wikidata":"https://www.wikidata.org/wiki/Q3560506","display_name":"Anomaly detection","level":2,"score":0.25459998846054077},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.2531999945640564}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:doi:10.48550/arxiv.2601.22582","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},{"id":"doi:10.48550/arxiv.2601.22582","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2601.22582","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:doi:10.48550/arxiv.2601.22582","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Group-relative":[0],"policy":[1],"optimization":[2],"methods":[3,173],"train":[4],"language":[5],"models":[6,179],"by":[7,125],"generating":[8],"multiple":[9],"rollouts":[10,48],"per":[11,157],"prompt":[12,158],"and":[13,54,73,122,140,174,180,188,200],"normalizing":[14],"rewards":[15,100],"with":[16,88],"a":[17,71,89,175],"shared":[18,40],"mean":[19,86],"reward":[20],"baseline.":[21],"In":[22],"resource-constrained":[23],"settings":[24],"where":[25,46],"the":[26,39,55,85,92,102,105,127,138,152,162,192,196],"rollout":[27,110,117,148],"budget":[28],"is":[29,58,82,94,137,206],"small,":[30],"accuracy":[31,190],"often":[32],"degrades.":[33],"We":[34,113],"find":[35],"that":[36],"noise":[37],"in":[38,191],"baseline":[41,87],"induces":[42],"advantage":[43,52],"sign":[44,106],"flips,":[45],"some":[47],"receive":[49],"an":[50,131],"incorrect":[51],"sign,":[53],"update":[56,164],"direction":[57],"reversed.":[59],"To":[60],"address":[61],"this,":[62],"we":[63,144],"propose":[64],"Median-Centered":[65],"Group":[66],"Relative":[67],"Policy":[68],"Optimization":[69],"(MC-GRPO),":[70],"simple":[72],"effective":[74],"solution":[75],"for":[76,118],"small-rollout":[77],"training.":[78,169],"Our":[79],"main":[80],"idea":[81],"to":[83,98,202],"replace":[84],"median":[90,93,119,139],"baseline:":[91],"far":[95],"less":[96],"sensitive":[97],"outlier":[99],"than":[101],"mean,":[103],"mitigating":[104],"flips":[107],"under":[108],"small":[109],"size":[111],"(G).":[112],"generate":[114],"one":[115,135],"additional":[116],"reference":[120],"(G+1),":[121],"compute":[123],"advantages":[124],"using":[126],"group":[128],"median.":[129],"With":[130],"odd-sized":[132],"group,":[133],"exactly":[134],"completion":[136],"receives":[141],"zero":[142],"advantage,":[143],"exclude":[145],"this":[146,182],"pivot":[147],"from":[149],"backpropagation":[150],"so":[151],"number":[153],"of":[154,166,178],"gradient-contributing":[155],"samples":[156],"remains":[159],"G,":[160],"preserving":[161],"core":[163],"cost":[165],"standard":[167],"G-rollout":[168],"Across":[170],"various":[171],"GRPO-family":[172],"wide":[176],"range":[177],"scales,":[181],"median-centered":[183],"training":[184],"consistently":[185],"improves":[186],"stability":[187],"final":[189],"low-rollout":[193],"regime,":[194],"reducing":[195],"gap":[197],"between":[198],"G=2":[199],"G=8":[201],"within":[203],"1%.":[204],"Code":[205],"available":[207],"at":[208],"https://github.com/lotusroot-kim/MC-GRPO":[209]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-02-03T00:00:00"}
