{"id":"https://openalex.org/W7136405378","doi":"https://doi.org/10.48550/arxiv.2603.13134","title":"When Right Meets Wrong: Bilateral Context Conditioning with Reward-Confidence Correction for GRPO","display_name":"When Right Meets Wrong: Bilateral Context Conditioning with Reward-Confidence Correction for GRPO","publication_year":2026,"publication_date":"2026-03-13","ids":{"openalex":"https://openalex.org/W7136405378","doi":"https://doi.org/10.48550/arxiv.2603.13134"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.13134","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.13134","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.13134","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5129578868","display_name":"Yu Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Yu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5129598382","display_name":"Tian Lan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lan, Tian","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5129582835","display_name":"Zhengling Qi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Qi, Zhengling","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.5525000095367432,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.5525000095367432,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.045899998396635056,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.03709999844431877,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/margin","display_name":"Margin (machine learning)","score":0.6646000146865845},{"id":"https://openalex.org/keywords/context","display_name":"Context (archaeology)","score":0.633400022983551},{"id":"https://openalex.org/keywords/covariance","display_name":"Covariance","score":0.47269999980926514},{"id":"https://openalex.org/keywords/contrast","display_name":"Contrast (vision)","score":0.4593999981880188},{"id":"https://openalex.org/keywords/sampling","display_name":"Sampling (signal processing)","score":0.4002000093460083},{"id":"https://openalex.org/keywords/baseline","display_name":"Baseline (sea)","score":0.37689998745918274},{"id":"https://openalex.org/keywords/encoding","display_name":"Encoding (memory)","score":0.35690000653266907},{"id":"https://openalex.org/keywords/sample","display_name":"Sample (material)","score":0.3553999960422516}],"concepts":[{"id":"https://openalex.org/C774472","wikidata":"https://www.wikidata.org/wiki/Q6760393","display_name":"Margin (machine learning)","level":2,"score":0.6646000146865845},{"id":"https://openalex.org/C2779343474","wikidata":"https://www.wikidata.org/wiki/Q3109175","display_name":"Context (archaeology)","level":2,"score":0.633400022983551},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6132000088691711},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5453000068664551},{"id":"https://openalex.org/C178650346","wikidata":"https://www.wikidata.org/wiki/Q201984","display_name":"Covariance","level":2,"score":0.47269999980926514},{"id":"https://openalex.org/C2776502983","wikidata":"https://www.wikidata.org/wiki/Q690182","display_name":"Contrast (vision)","level":2,"score":0.4593999981880188},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4507000148296356},{"id":"https://openalex.org/C140779682","wikidata":"https://www.wikidata.org/wiki/Q210868","display_name":"Sampling (signal processing)","level":3,"score":0.4002000093460083},{"id":"https://openalex.org/C12725497","wikidata":"https://www.wikidata.org/wiki/Q810247","display_name":"Baseline (sea)","level":2,"score":0.37689998745918274},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.35690000653266907},{"id":"https://openalex.org/C198531522","wikidata":"https://www.wikidata.org/wiki/Q485146","display_name":"Sample (material)","level":2,"score":0.3553999960422516},{"id":"https://openalex.org/C45262634","wikidata":"https://www.wikidata.org/wiki/Q5159291","display_name":"Conditioning","level":2,"score":0.3544999957084656},{"id":"https://openalex.org/C2776760102","wikidata":"https://www.wikidata.org/wiki/Q5139990","display_name":"Code (set theory)","level":3,"score":0.3497999906539917},{"id":"https://openalex.org/C2781311116","wikidata":"https://www.wikidata.org/wiki/Q83306","display_name":"Group (periodic table)","level":2,"score":0.31940001249313354},{"id":"https://openalex.org/C2778112365","wikidata":"https://www.wikidata.org/wiki/Q3511065","display_name":"Sequence (biology)","level":2,"score":0.28850001096725464},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.28760001063346863},{"id":"https://openalex.org/C43126263","wikidata":"https://www.wikidata.org/wiki/Q128751","display_name":"Source code","level":2,"score":0.28610000014305115},{"id":"https://openalex.org/C196083921","wikidata":"https://www.wikidata.org/wiki/Q7915758","display_name":"Variance (accounting)","level":2,"score":0.28139999508857727},{"id":"https://openalex.org/C20162079","wikidata":"https://www.wikidata.org/wiki/Q1151406","display_name":"Case-based reasoning","level":2,"score":0.26510000228881836},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.2517000138759613}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.13134","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.13134","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.13134","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.13134","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16","score":0.5108917355537415}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Group":[0],"Relative":[1],"Policy":[2],"Optimization":[3],"(GRPO)":[4],"has":[5],"emerged":[6],"as":[7,27],"an":[8,28],"effective":[9],"method":[10],"for":[11],"training":[12,141],"reasoning":[13,66,121,182],"models.":[14],"While":[15],"it":[16],"computes":[17],"advantages":[18],"based":[19],"on":[20,73,101,180],"group":[21],"mean,":[22],"GRPO":[23,85,149,177],"treats":[24],"each":[25],"output":[26],"independent":[29],"sample":[30],"during":[31,123],"the":[32,40,49,54,84,89,92,114,124,145,155,159],"optimization":[33],"and":[34,45,97,119,171,190],"overlooks":[35],"a":[36,77,110,127],"vital":[37],"structural":[38],"signal:":[39],"natural":[41],"contrast":[42],"between":[43,91],"correct":[44,96],"incorrect":[46,98],"solutions":[47],"within":[48],"same":[50],"group,":[51],"thus":[52],"ignoring":[53],"rich,":[55],"comparative":[56],"data":[57],"that":[58,83,112],"could":[59],"be":[60,173],"leveraged":[61],"by":[62,142],"explicitly":[63],"pitting":[64],"successful":[65,118],"traces":[67,122],"against":[68],"failed":[69,120],"ones.":[70],"To":[71],"capitalize":[72],"this,":[74],"we":[75,104],"present":[76],"contrastive":[78],"reformulation":[79],"of":[80,95,158],"GRPO,":[81],"showing":[82],"objective":[86],"implicitly":[87],"maximizes":[88],"margin":[90],"policy":[93],"ratios":[94],"samples.":[99,132],"Building":[100],"this":[102],"insight,":[103],"propose":[105],"Bilateral":[106],"Context":[107],"Conditioning":[108],"(BICC),":[109],"mechanism":[111],"allows":[113],"model":[115],"to":[116,139,175],"cross-reference":[117],"optimization,":[125],"enabling":[126],"direct":[128],"information":[129],"flow":[130],"across":[131,187],"We":[133],"further":[134],"introduce":[135],"Reward-Confidence":[136],"Correction":[137],"(RCC)":[138],"stabilize":[140],"dynamically":[143],"adjusts":[144],"advantage":[146],"baseline":[147],"in":[148],"using":[150],"reward-confidence":[151],"covariance":[152],"derived":[153],"from":[154],"first-order":[156],"approximation":[157],"variance-minimizing":[160],"estimator.":[161],"Both":[162],"mechanisms":[163],"require":[164],"no":[165],"additional":[166],"sampling":[167],"or":[168],"auxiliary":[169],"models":[170,189],"can":[172],"adapted":[174],"all":[176],"variants.":[178],"Experiments":[179],"mathematical":[181],"benchmarks":[183],"demonstrate":[184],"consistent":[185],"improvements":[186],"comprehensive":[188],"algorithms.":[191],"Code":[192],"is":[193],"available":[194],"at":[195],"\\href{https://github.com/Skylanding/BiCC}{https://github.com/Skylanding/BiCC}.":[196]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-03-17T00:00:00"}
