{"id":"https://openalex.org/W7166817623","doi":"https://doi.org/10.18653/v1/2026.acl-long.1406","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","display_name":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166817623","doi":"https://doi.org/10.18653/v1/2026.acl-long.1406"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.acl-long.1406","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.1406","pdf_url":"https://aclanthology.org/2026.acl-long.1406.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.acl-long.1406.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139765760","display_name":"Yuhang Wu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yuhang Wu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5028086891","display_name":"Xiangqing Shen","orcid":"https://orcid.org/0000-0002-9825-7853"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xiangqing Shen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139736611","display_name":"Fanfan Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Fanfan Wang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5021000274","display_name":"Cangqi Zhou","orcid":"https://orcid.org/0000-0003-0528-8202"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cangqi Zhou","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139744620","display_name":"Zhen Wu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhen Wu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5126482404","display_name":"Xinyu Dai","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xinyu Dai","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139788790","display_name":"Rui Xia","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Rui Xia","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.80708054,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"30474","last_page":"30490"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.12620000541210175,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.12620000541210175,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10142","display_name":"Formal Methods in Verification","score":0.024900000542402267,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12808","display_name":"Ferroelectric and Negative Capacitance Devices","score":0.0203000009059906,"subfield":{"id":"https://openalex.org/subfields/2208","display_name":"Electrical and Electronic Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.44350001215934753},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.3452000021934509},{"id":"https://openalex.org/keywords/control-theory","display_name":"Control theory (sociology)","score":0.3384000062942505},{"id":"https://openalex.org/keywords/noise","display_name":"Noise (video)","score":0.33149999380111694},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.31349998712539673},{"id":"https://openalex.org/keywords/control-system","display_name":"Control system","score":0.30379998683929443}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5828999876976013},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.44350001215934753},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.41359999775886536},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.3452000021934509},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.3384000062942505},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.33149999380111694},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.31349998712539673},{"id":"https://openalex.org/C17500928","wikidata":"https://www.wikidata.org/wiki/Q959968","display_name":"Control system","level":2,"score":0.30379998683929443},{"id":"https://openalex.org/C133731056","wikidata":"https://www.wikidata.org/wiki/Q4917288","display_name":"Control engineering","level":1,"score":0.30250000953674316},{"id":"https://openalex.org/C3018651601","wikidata":"https://www.wikidata.org/wiki/Q183635","display_name":"Feedback control","level":2,"score":0.2953000068664551},{"id":"https://openalex.org/C127413603","wikidata":"https://www.wikidata.org/wiki/Q11023","display_name":"Engineering","level":0,"score":0.2856000065803528},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.2721000015735626},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.2644999921321869},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.2547000050544739}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.acl-long.1406","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.1406","pdf_url":"https://aclanthology.org/2026.acl-long.1406.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.acl-long.1406","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.1406","pdf_url":"https://aclanthology.org/2026.acl-long.1406.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[{"id":"https://openalex.org/G74079944","display_name":null,"funder_award_id":"62476134","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"}],"funders":[{"id":"https://openalex.org/F4320321001","display_name":"National Natural Science Foundation of China","ror":"https://ror.org/01h0zpd94"}],"has_content":{"grobid_xml":true,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166817623.pdf","grobid_xml":"https://content.openalex.org/works/W7166817623.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Rerankers":[0],"play":[1],"a":[2,35,73,89,115],"pivotal":[3],"role":[4],"in":[5,24],"refining":[6],"retrieval":[7,45],"results":[8],"for":[9,58,95,105],"Retrieval-Augmented":[10],"Generation.However,":[11],"current":[12],"reranking":[13,80,87],"models":[14],"are":[15],"typically":[16],"optimized":[17],"on":[18,120],"static":[19],"human":[20,107],"annotated":[21],"relevance":[22],"labels":[23],"isolation,":[25],"decoupled":[26],"from":[27],"the":[28,51,56,82,103,131,138],"downstream":[29],"generation":[30,84],"process.This":[31],"isolation":[32],"leads":[33],"to":[34,49,146],"fundamental":[36],"misalignment:":[37],"documents":[38],"identified":[39],"as":[40,88],"topically":[41],"relevant":[42],"by":[43,55],"information":[44],"metrics":[46],"often":[47],"fail":[48],"provide":[50],"actual":[52],"utility":[53,97],"required":[54],"LLM":[57,99],"precise":[59],"answer":[60],"generation.To":[61],"bridge":[62],"this":[63],"gap,":[64],"we":[65,112],"introduce":[66,114],"ReRanking":[67],"Preference":[68],"Optimization":[69],"(RRPO)":[70],"1":[71],",":[72],"reinforcement":[74],"learning":[75],"framework":[76],"that":[77,124],"directly":[78],"aligns":[79],"with":[81,153,165],"LLM's":[83],"quality.By":[85],"formulating":[86],"sequential":[90],"decision-making":[91],"process,":[92],"RRPO":[93,125],"optimizes":[94],"context":[96],"using":[98],"feedback,":[100],"thereby":[101],"eliminating":[102],"need":[104],"expensive":[106],"annotations.To":[108],"ensure":[109],"training":[110],"stability,":[111],"further":[113],"reference-anchored":[116],"deterministic":[117],"baseline.Extensive":[118],"experiments":[119],"knowledge-intensive":[121],"benchmarks":[122],"demonstrate":[123],"significantly":[126],"outperforms":[127],"strong":[128],"baselines,":[129],"including":[130],"powerful":[132],"list-wise":[133],"reranker":[134],"RankZephyr.Further":[135],"analysis":[136],"highlights":[137],"versatility":[139],"of":[140],"our":[141],"framework:":[142],"it":[143],"generalizes":[144],"seamlessly":[145],"diverse":[147],"readers":[148],"(e.g.,":[149],"GPT-4o),":[150],"integrates":[151],"orthogonally":[152],"query":[154],"expansion":[155],"modules":[156],"like":[157],"Query2Doc,":[158],"and":[159],"remains":[160],"robust":[161],"even":[162],"when":[163],"trained":[164],"noisy":[166],"supervisors.":[167]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-07-02T00:00:00"}
