{"id":"https://openalex.org/W7166803998","doi":"https://doi.org/10.18653/v1/2026.acl-long.1478","title":"The Retrieval Bottleneck: Scaling Laws for Reinforcement Learning in RAG","display_name":"The Retrieval Bottleneck: Scaling Laws for Reinforcement Learning in RAG","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166803998","doi":"https://doi.org/10.18653/v1/2026.acl-long.1478"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.acl-long.1478","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.1478","pdf_url":"https://aclanthology.org/2026.acl-long.1478.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.acl-long.1478.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139831059","display_name":"Shu Zhou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shu Zhou","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5113241687","display_name":"Jiajin Leng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jinman Leng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139732686","display_name":"Yufei Song","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yufei Song","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139776697","display_name":"Xin Eric Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xin Wang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5103120972","display_name":"Tao Fan","orcid":"https://orcid.org/0000-0001-9081-8233"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tao Fan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139793910","display_name":"Hao Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Hao Wang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.79364826,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"32045","last_page":"32069"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7451000213623047,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7451000213623047,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.02979999966919422,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T12288","display_name":"Optimization and Search Problems","score":0.022199999541044235,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.45739999413490295},{"id":"https://openalex.org/keywords/scaling-law","display_name":"Scaling law","score":0.3741999864578247},{"id":"https://openalex.org/keywords/noise","display_name":"Noise (video)","score":0.31040000915527344},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.3089999854564667},{"id":"https://openalex.org/keywords/scaling","display_name":"Scaling","score":0.30730000138282776}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5343000292778015},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.47350001335144043},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.45739999413490295},{"id":"https://openalex.org/C2988430800","wikidata":"https://www.wikidata.org/wiki/Q428971","display_name":"Scaling law","level":3,"score":0.3741999864578247},{"id":"https://openalex.org/C199539241","wikidata":"https://www.wikidata.org/wiki/Q7748","display_name":"Law","level":1,"score":0.34929999709129333},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.31040000915527344},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.3089999854564667},{"id":"https://openalex.org/C99844830","wikidata":"https://www.wikidata.org/wiki/Q102441924","display_name":"Scaling","level":2,"score":0.30730000138282776},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.3052999973297119},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.2904999852180481},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.2815000116825104},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.27970001101493835},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.2556000053882599}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.acl-long.1478","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.1478","pdf_url":"https://aclanthology.org/2026.acl-long.1478.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.acl-long.1478","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.1478","pdf_url":"https://aclanthology.org/2026.acl-long.1478.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/10","score":0.5305473208427429,"display_name":"Reduced inequalities"}],"awards":[{"id":"https://openalex.org/G267927631","display_name":null,"funder_award_id":"72574098","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"},{"id":"https://openalex.org/G6152536712","display_name":null,"funder_award_id":"010814370338","funder_id":"https://openalex.org/F4320335787","funder_display_name":"Fundamental Research Funds for the Central Universities"},{"id":"https://openalex.org/G6831034041","display_name":null,"funder_award_id":"72504122","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"},{"id":"https://openalex.org/G7694383859","display_name":null,"funder_award_id":"72074108","funder_id":"https://openalex.org/F4320324852","funder_display_name":"Nanjing University"},{"id":"https://openalex.org/G8524424817","display_name":"\u5173\u8054\u6570\u636e\u9a71\u52a8\u4e0b\u6211\u56fd\u975e\u9057\u6587\u672c\u7684\u8bed\u4e49\u89e3\u6790\u4e0e\u4eba\u6587\u8ba1\u7b97\u7814\u7a76","funder_award_id":"72074108","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"}],"funders":[{"id":"https://openalex.org/F4320321001","display_name":"National Natural Science Foundation of China","ror":"https://ror.org/01h0zpd94"},{"id":"https://openalex.org/F4320324852","display_name":"Nanjing University","ror":"https://ror.org/01rxvg760"},{"id":"https://openalex.org/F4320335787","display_name":"Fundamental Research Funds for the Central Universities","ror":null}],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166803998.pdf","grobid_xml":"https://content.openalex.org/works/W7166803998.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Scaling":[0],"laws":[1,64],"have":[2],"enabled":[3],"predictable":[4,165],"compute":[5,106],"allocation":[6],"for":[7,10,49,169],"pre-training":[8,170],"and":[9,23,37,60,122,144],"RL":[11,47,70,145],"in":[12,174],"reasoning":[13],"tasks.However,":[14],"research":[15],"on":[16,111,150,159],"retrieval":[17,35,67,82,89,119,151],"reinforcement":[18,38],"generation":[19],"(RAG)":[20],"remains":[21],"insufficient":[22],"there":[24],"is":[25],"a":[26],"lack":[27],"of":[28,31,46],"fundamental":[29],"understanding":[30],"the":[32,42,56,73,112,164],"interaction":[33],"between":[34],"quality":[36,83,120],"learning":[39],"computation.We":[40],"present":[41],"first":[43],"systematic":[44],"study":[45],"scaling":[48,63,166],"RAG":[50],"across":[51],"three":[52,79],"knowledgeintensive":[53],"benchmarks.We":[54],"introduce":[55],"Retrieval":[57],"Bottleneck":[58],"Hypothesis":[59],"derive":[61],"sigmoidal":[62],"showing":[65],"that":[66,114],"quality,":[68],"not":[69],"compute,":[71],"determines":[72],"asymptotic":[74],"performance":[75,158],"ceiling.Our":[76],"analysis":[77],"reveals":[78],"principles:":[80],"(1)":[81],"bounds":[84],"achievable":[85],"performance,":[86],"with":[87,108,128,142],"improving":[88],"yielding":[90],"larger":[91],"gains":[92],"than":[93,118],"algorithmic":[94],"innovations;":[95],"(2)":[96],"design":[97],"choices":[98],"(training":[99],"objectives,":[100],"rewards,":[101],"off-policy":[102],"methods)":[103],"primarily":[104],"modulate":[105],"efficiency,":[107],"secondary":[109],"effects":[110],"ceiling":[113],"are":[115],"substantially":[116],"smaller":[117],"improvements;":[121],"(3)":[123],"stable":[124],"configurations":[125],"enable":[126],"extrapolation":[127],"3.1%":[129],"error":[130],"at":[131],"4\u00d7":[132],"compute.We":[133],"further":[134],"uncover":[135],"RAG-specific":[136],"dynamics:":[137],"optimal":[138],"document":[139],"count":[140],"increases":[141],"training,":[143],"algorithm":[146],"effectiveness":[147],"depends":[148],"critically":[149],"quality.These":[152],"insights":[153],"yield":[154],"RAG-SCALERL,":[155],"achieving":[156],"strong":[157],"knowledge-intensive":[160],"benchmarks":[161],"while":[162],"providing":[163],"long":[167],"available":[168],"but":[171],"previously":[172],"absent":[173],"RAG-RL.":[175]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-07-02T00:00:00"}
