{"id":"https://openalex.org/W7160283619","doi":"https://doi.org/10.48550/arxiv.2605.02073","title":"Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning","display_name":"Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning","publication_year":2026,"publication_date":"2026-05-03","ids":{"openalex":"https://openalex.org/W7160283619","doi":"https://doi.org/10.48550/arxiv.2605.02073"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.02073","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.02073","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.02073","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5135418333","display_name":"Arash Ahmadi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ahmadi, Arash","raw_affiliation_strings":["Mike"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Mike","institution_ids":[]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128194497","display_name":"Sarah Sharif","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sharif, Sarah","raw_affiliation_strings":["Mike"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Mike","institution_ids":[]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135384743","display_name":"Yaser","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yaser","raw_affiliation_strings":["Mike"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Mike","institution_ids":[]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5135340635","display_name":"Banad","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Banad","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.241799995303154,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.241799995303154,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.08320000022649765,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10181","display_name":"Natural Language Processing Techniques","score":0.07660000026226044,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/mcnemars-test","display_name":"McNemar's test","score":0.6797999739646912},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6601999998092651},{"id":"https://openalex.org/keywords/benchmark","display_name":"Benchmark (surveying)","score":0.5523999929428101},{"id":"https://openalex.org/keywords/pairwise-comparison","display_name":"Pairwise comparison","score":0.48510000109672546},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.4535999894142151},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.4296000003814697},{"id":"https://openalex.org/keywords/base","display_name":"Base (topology)","score":0.38499999046325684},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.3361000120639801},{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.3303999900817871}],"concepts":[{"id":"https://openalex.org/C186282968","wikidata":"https://www.wikidata.org/wiki/Q1434261","display_name":"McNemar's test","level":2,"score":0.6797999739646912},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6601999998092651},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6308000087738037},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5952000021934509},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.5523999929428101},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4950999915599823},{"id":"https://openalex.org/C184898388","wikidata":"https://www.wikidata.org/wiki/Q1435712","display_name":"Pairwise comparison","level":2,"score":0.48510000109672546},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.4535999894142151},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.4296000003814697},{"id":"https://openalex.org/C42058472","wikidata":"https://www.wikidata.org/wiki/Q810214","display_name":"Base (topology)","level":2,"score":0.38499999046325684},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.3361000120639801},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.3303999900817871},{"id":"https://openalex.org/C45942800","wikidata":"https://www.wikidata.org/wiki/Q245652","display_name":"Ensemble learning","level":2,"score":0.32089999318122864},{"id":"https://openalex.org/C112313634","wikidata":"https://www.wikidata.org/wiki/Q7886648","display_name":"Complement (music)","level":5,"score":0.31520000100135803},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.30379998683929443},{"id":"https://openalex.org/C2776502983","wikidata":"https://www.wikidata.org/wiki/Q690182","display_name":"Contrast (vision)","level":2,"score":0.3034000098705292},{"id":"https://openalex.org/C2779525943","wikidata":"https://www.wikidata.org/wiki/Q1187300","display_name":"Grammaticality","level":3,"score":0.29600000381469727},{"id":"https://openalex.org/C12725497","wikidata":"https://www.wikidata.org/wiki/Q810247","display_name":"Baseline (sea)","level":2,"score":0.2946999967098236},{"id":"https://openalex.org/C103278499","wikidata":"https://www.wikidata.org/wiki/Q254465","display_name":"Similarity (geometry)","level":3,"score":0.2912999987602234},{"id":"https://openalex.org/C2778915421","wikidata":"https://www.wikidata.org/wiki/Q3643177","display_name":"Performance improvement","level":2,"score":0.27799999713897705},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.26980000734329224},{"id":"https://openalex.org/C2779843651","wikidata":"https://www.wikidata.org/wiki/Q7390335","display_name":"SIGNAL (programming language)","level":2,"score":0.26980000734329224},{"id":"https://openalex.org/C139807058","wikidata":"https://www.wikidata.org/wiki/Q352374","display_name":"Adaptation (eye)","level":2,"score":0.2696000039577484},{"id":"https://openalex.org/C94966114","wikidata":"https://www.wikidata.org/wiki/Q29256","display_name":"Black box","level":2,"score":0.262800008058548},{"id":"https://openalex.org/C89611455","wikidata":"https://www.wikidata.org/wiki/Q6804646","display_name":"Mechanism (biology)","level":2,"score":0.25049999356269836}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.02073","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.02073","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.02073","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.02073","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Mathematical":[0],"reasoning":[1,20],"is":[2,12,62,69,76],"a":[3,13,44,88,105,194,200],"key":[4],"benchmark":[5],"for":[6,17],"large":[7,23],"language":[8,24,90],"models.":[9],"Reinforcement":[10],"learning":[11],"standard":[14],"post-training":[15],"mechanism":[16],"improving":[18],"the":[19,31,34,49,66,73,77,118,132,140,161,228,248,252,260],"capabilities":[21],"of":[22,33,56,60,135,172,227,233,255],"models,":[25],"yet":[26],"performance":[27],"remains":[28],"sensitive":[29],"to":[30,155,241],"design":[32,80],"reward":[35,50,74,83,164],"function":[36],"that":[37,47,247],"drives":[38,259],"policy":[39],"optimization.":[40,57],"This":[41],"paper":[42],"introduces":[43],"search-driven":[45],"framework":[46],"treats":[48],"specification":[51,75],"itself":[52],"as":[53],"an":[54],"object":[55],"The":[58,146,177],"setting":[59],"interest":[61],"one":[63],"in":[64,152,157],"which":[65,245],"base":[67,107],"model":[68,108],"held":[70],"fixed":[71],"and":[72,113,160,189],"primary":[78],"remaining":[79],"lever.":[81],"Candidate":[82],"functions":[84],"are":[85,127,175,217],"generated":[86],"by":[87,115],"frontier":[89],"model,":[91],"validated":[92],"automatically,":[93],"screened":[94],"through":[95],"500-step":[96],"Group":[97],"Relative":[98],"Policy":[99],"Optimization":[100],"(GRPO)":[101],"training":[102],"runs":[103],"on":[104,117],"Llama-3.2-3B-Instruct":[106],"with":[109,210],"Low-Rank":[110],"Adaptation":[111],"(LoRA),":[112],"ranked":[114],"F1":[116,148,166,181,197,232,242],"GSM8K":[119],"test":[120],"set.":[121],"Ranked":[122],"summaries":[123],"from":[124,150],"prior":[125],"rounds":[126],"then":[128],"fed":[129],"back":[130],"into":[131],"next":[133],"round":[134],"generation.":[136],"Over":[137],"five":[138],"rounds,":[139],"search":[141],"produces":[142],"50":[143],"candidate":[144],"rewards.":[145],"mean":[147],"rises":[149],"0.596":[151],"Round":[153,158],"1":[154],"0.632":[156],"5,":[159],"top":[162],"individual":[163],"reaches":[165],"=":[167,182,205,222,243],"0.787.":[168],"Seven":[169],"ensemble":[170,179,230],"configurations":[171,216],"top-ranked":[173],"rewards":[174],"evaluated.":[176],"best":[178,229],"achieves":[180],"0.795":[183],"(95%":[184],"bootstrap":[185],"CI":[186],"[0.756,":[187],"0.832])":[188],"accuracy":[190],"0.660":[191],"[0.635,":[192],"0.686],":[193],"0.19":[195],"absolute":[196],"gain":[198],"over":[199],"base-rewards-only":[201],"GRPO":[202],"baseline":[203],"(F1":[204],"0.609).":[206],"Pairwise":[207],"McNemar":[208],"tests":[209],"Bonferroni":[211],"correction":[212],"show":[213],"all":[214],"five-or-more-reward":[215],"statistically":[218],"indistinguishable":[219],"at":[220],"\u03b1":[221],"0.05/21.":[223],"A":[224,235],"three-seed":[225],"re-training":[226],"yields":[231],"0.785.":[234],"randomly":[236],"drawn":[237],"5-reward":[238],"control":[239],"collapses":[240],"0.047,":[244],"shows":[246],"ranked-feedback":[249],"loop,":[250],"not":[251],"additive":[253],"signal":[254],"having":[256],"more":[257],"rewards,":[258],"gain.":[261]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-06T00:00:00"}
