{"id":"https://openalex.org/W7162067857","doi":"https://doi.org/10.48550/arxiv.2605.22620","title":"Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework","display_name":"Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework","publication_year":2026,"publication_date":"2026-05-21","ids":{"openalex":"https://openalex.org/W7162067857","doi":"https://doi.org/10.48550/arxiv.2605.22620"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.22620","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.22620","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.22620","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5136766750","display_name":"Shourov Joarder","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Joarder, Shourov","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136804425","display_name":"Diganta Sikdar","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sikdar, Diganta","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5047323605","display_name":"Ahsan Habib Akash","orcid":"https://orcid.org/0009-0009-2498-8029"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Akash, Ahsan Habib","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136790422","display_name":"Binod Bhattarai","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bhattarai, Binod","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5136742854","display_name":"Prashnna Gyawali","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Gyawali, Prashnna","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.18449999392032623,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.18449999392032623,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.1826999932527542,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.1657000035047531,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5936999917030334},{"id":"https://openalex.org/keywords/entropy","display_name":"Entropy (arrow of time)","score":0.5364999771118164},{"id":"https://openalex.org/keywords/robustness","display_name":"Robustness (evolution)","score":0.4699999988079071},{"id":"https://openalex.org/keywords/cluster-analysis","display_name":"Cluster analysis","score":0.4652000069618225},{"id":"https://openalex.org/keywords/scalability","display_name":"Scalability","score":0.43320000171661377},{"id":"https://openalex.org/keywords/unsupervised-learning","display_name":"Unsupervised learning","score":0.4262000024318695},{"id":"https://openalex.org/keywords/normalization","display_name":"Normalization (sociology)","score":0.4253000020980835},{"id":"https://openalex.org/keywords/security-token","display_name":"Security token","score":0.3646000027656555},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.34790000319480896}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.734000027179718},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6650999784469604},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.6227999925613403},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5936999917030334},{"id":"https://openalex.org/C106301342","wikidata":"https://www.wikidata.org/wiki/Q4117933","display_name":"Entropy (arrow of time)","level":2,"score":0.5364999771118164},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.4699999988079071},{"id":"https://openalex.org/C73555534","wikidata":"https://www.wikidata.org/wiki/Q622825","display_name":"Cluster analysis","level":2,"score":0.4652000069618225},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.43320000171661377},{"id":"https://openalex.org/C8038995","wikidata":"https://www.wikidata.org/wiki/Q1152135","display_name":"Unsupervised learning","level":2,"score":0.4262000024318695},{"id":"https://openalex.org/C136886441","wikidata":"https://www.wikidata.org/wiki/Q926129","display_name":"Normalization (sociology)","level":2,"score":0.4253000020980835},{"id":"https://openalex.org/C48145219","wikidata":"https://www.wikidata.org/wiki/Q1335365","display_name":"Security token","level":2,"score":0.3646000027656555},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.34790000319480896},{"id":"https://openalex.org/C85847156","wikidata":"https://www.wikidata.org/wiki/Q59015987","display_name":"Verifiable secret sharing","level":3,"score":0.33489999175071716},{"id":"https://openalex.org/C179518139","wikidata":"https://www.wikidata.org/wiki/Q5140297","display_name":"Coding (social sciences)","level":2,"score":0.3021000027656555},{"id":"https://openalex.org/C520049643","wikidata":"https://www.wikidata.org/wiki/Q189760","display_name":"Voting","level":3,"score":0.2924000024795532},{"id":"https://openalex.org/C177212765","wikidata":"https://www.wikidata.org/wiki/Q627335","display_name":"Workflow","level":2,"score":0.2842000126838684},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.28110000491142273},{"id":"https://openalex.org/C2781067378","wikidata":"https://www.wikidata.org/wiki/Q17027399","display_name":"Interpretability","level":2,"score":0.28049999475479126},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.27630001306533813},{"id":"https://openalex.org/C171752962","wikidata":"https://www.wikidata.org/wiki/Q255166","display_name":"Kullback\u2013Leibler divergence","level":2,"score":0.26809999346733093},{"id":"https://openalex.org/C136389625","wikidata":"https://www.wikidata.org/wiki/Q334384","display_name":"Supervised learning","level":3,"score":0.263700008392334},{"id":"https://openalex.org/C22367795","wikidata":"https://www.wikidata.org/wiki/Q7625208","display_name":"Structured prediction","level":2,"score":0.25690001249313354},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.25679999589920044},{"id":"https://openalex.org/C81790035","wikidata":"https://www.wikidata.org/wiki/Q847158","display_name":"Jackknife resampling","level":3,"score":0.2524999976158142}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.22620","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.22620","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.22620","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.22620","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Decent work and economic growth","id":"https://metadata.un.org/sdg/8","score":0.648784339427948}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0,26],"learning":[1,27],"with":[2,167],"verifiable":[3],"rewards":[4],"(RLVR)":[5],"has":[6,32],"substantially":[7],"improved":[8],"the":[9,44,78],"reasoning":[10,68,136,174],"ability":[11],"of":[12],"LLMs,":[13],"but":[14],"often":[15],"depends":[16],"on":[17,53,89,97,177],"external":[18,178],"supervision":[19],"from":[20,28,43],"human":[21],"annotations":[22],"or":[23],"gold-standard":[24],"solutions.":[25],"internal":[29,56,164],"feedback":[30],"(RLIF)":[31],"recently":[33],"emerged":[34],"as":[35],"a":[36,54,72,93],"scalable":[37],"unsupervised":[38,148],"alternative,":[39],"using":[40],"signals":[41,103],"extracted":[42],"model":[45],"itself.":[46],"However,":[47],"existing":[48],"RLIF":[49,74],"methods":[50],"typically":[51],"rely":[52],"single":[55],"reward,":[57],"which":[58,118],"can":[59,170],"lead":[60],"to":[61,109,155],"reward":[62,87,95],"hacking,":[63],"entropy":[64,126],"collapse,":[65],"and":[66,92,130,137,144],"degraded":[67],"structure.":[69],"We":[70,113],"propose":[71],"multi-reward":[73],"framework":[75],"that":[76,162],"decomposes":[77],"training":[79],"signal":[80],"into":[81],"two":[82],"complementary":[83,163],"components:":[84],"an":[85],"answer-level":[86],"based":[88,96],"cluster":[90],"voting":[91],"completion-level":[94],"token-wise":[98],"self-certainty.":[99],"To":[100],"combine":[101],"these":[102],"robustly,":[104],"we":[105],"apply":[106],"GDPO-based":[107],"normalization":[108],"reduce":[110],"reward-scale":[111],"imbalance.":[112],"further":[114],"introduce":[115],"KL-Cov":[116],"regularization,":[117,169],"targets":[119],"low-entropy":[120],"token":[121],"distributions":[122],"responsible":[123],"for":[124],"disproportionate":[125],"reduction,":[127],"preserving":[128],"exploration":[129],"preventing":[131],"late-stage":[132],"collapse.":[133],"Across":[134],"mathematical":[135],"code-generation":[138],"benchmarks,":[139],"our":[140],"method":[141],"improves":[142],"stability":[143],"robustness":[145],"over":[146],"prior":[147],"RL":[149],"approaches,":[150],"while":[151],"achieving":[152],"performance":[153],"close":[154],"supervised":[156],"RLVR":[157],"methods.":[158],"These":[159],"results":[160],"show":[161],"rewards,":[165],"combined":[166],"targeted":[168],"support":[171],"stable":[172],"long-horizon":[173],"without":[175],"relying":[176],"ground-truth":[179],"supervision.":[180],"Code":[181],"will":[182],"be":[183],"released":[184],"soon.":[185]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-23T00:00:00"}
