{"id":"https://openalex.org/W7166856391","doi":"https://doi.org/10.18653/v1/2026.acl-long.1321","title":"CURE: Critique-Driven Unified Reinforcement Learning for Test-Time Self-Improvement","display_name":"CURE: Critique-Driven Unified Reinforcement Learning for Test-Time Self-Improvement","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166856391","doi":"https://doi.org/10.18653/v1/2026.acl-long.1321"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.acl-long.1321","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.1321","pdf_url":"https://aclanthology.org/2026.acl-long.1321.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.acl-long.1321.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5047761999","display_name":"Guirong Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Guirong Chen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139765339","display_name":"Shuqi Ye","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shuqi Ye","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139719226","display_name":"Wenkai Yang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wenkai Yang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139758627","display_name":"Shiqi Shen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shiqi Shen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5000900477","display_name":"Guangyao Shen","orcid":"https://orcid.org/0000-0001-7530-332X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Guangyao Shen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139774595","display_name":"Yankai Lin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yankai Lin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.84559528,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"28632","last_page":"28653"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.38190001249313354,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.38190001249313354,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.16609999537467957,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.1388999968767166,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.41190001368522644},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.29350000619888306},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.28540000319480896},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.27880001068115234},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.26339998841285706}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5468000173568726},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.46790000796318054},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.41190001368522644},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.29350000619888306},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.28540000319480896},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.27880001068115234},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.26339998841285706},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.24959999322891235},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.24609999358654022},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.24330000579357147}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.acl-long.1321","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.1321","pdf_url":"https://aclanthology.org/2026.acl-long.1321.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.acl-long.1321","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.1321","pdf_url":"https://aclanthology.org/2026.acl-long.1321.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320321001","display_name":"National Natural Science Foundation of China","ror":"https://ror.org/01h0zpd94"}],"has_content":{"grobid_xml":true,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166856391.pdf","grobid_xml":"https://content.openalex.org/works/W7166856391.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"The":[0],"evolution":[1],"paradigm":[2],"of":[3],"Large":[4],"Language":[5],"Models":[6],"(LLMs)":[7],"is":[8],"shifting":[9],"from":[10],"scaling":[11,15],"training":[12],"compute":[13],"to":[14,36,51,114,146],"inference-time":[16],"compute.While":[17],"Reinforcement":[18],"Learning":[19],"with":[20,39],"Verifiable":[21],"Rewards":[22],"(RLVR)":[23],"has":[24],"become":[25],"a":[26,87,92],"key":[27],"engine":[28],"for":[29,45,74,95],"this":[30,53,78],"transition,":[31],"standard":[32,96],"approaches":[33],"often":[34],"fail":[35],"equip":[37],"models":[38],"the":[40,71,144],"autonomous":[41],"improvement":[42],"capabilities":[43],"required":[44],"test-time":[46],"scaling.Existing":[47],"critique-guided":[48],"methods":[49],"attempt":[50],"mitigate":[52,115],"by":[54,105],"leveraging":[55],"external":[56],"feedback":[57],"or":[58],"ground-truth":[59],"signals;":[60],"however,":[61],"these":[62],"dependencies":[63],"are":[64],"unavailable":[65],"at":[66],"test":[67],"time,":[68],"fundamentally":[69],"limiting":[70],"model's":[72],"capacity":[73],"continuous":[75],"self-improvement.To":[76],"bridge":[77],"gap,":[79],"we":[80],"propose":[81],"CURE":[82,102,129],"(Critique-driven":[83],"Unified":[84],"REinforcement":[85],"Learning),":[86],"framework":[88],"that":[89,128],"jointly":[90],"optimizes":[91],"single":[93],"policy":[94],"solving,":[97],"critiquing,":[98],"and":[99,123],"guided":[100],"re-exploration.Uniquely,":[101],"facilitates":[103],"re-exploration":[104],"generating":[106],"strategic":[107],"hints":[108],"while":[109],"discarding":[110],"initial":[111],"incorrect":[112],"solutions":[113],"anchoring":[116],"bias.Empirical":[117],"results":[118],"across":[119],"diverse":[120],"mathematical":[121],"reasoning":[122],"code":[124],"generation":[125],"benchmarks":[126],"demonstrate":[127],"not":[130],"only":[131],"maintains":[132],"competitive":[133],"single-turn":[134],"performance":[135],"but,":[136],"more":[137],"importantly,":[138],"unlocks":[139],"effective":[140],"inferencetime":[141],"scaling,":[142],"enabling":[143],"model":[145],"significantly":[147],"boost":[148],"accuracy":[149],"through":[150],"iterative":[151],"selfimprovement.":[152]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-07-02T00:00:00"}
