{"id":"https://openalex.org/W7166858380","doi":"https://doi.org/10.18653/v1/2026.findings-acl.1209","title":"Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward","display_name":"Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166858380","doi":"https://doi.org/10.18653/v1/2026.findings-acl.1209"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.findings-acl.1209","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.1209","pdf_url":"https://aclanthology.org/2026.findings-acl.1209.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.findings-acl.1209.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139784061","display_name":"Guanhua Huang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Guanhua Huang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5107517057","display_name":"Tingqiang Xu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tingqiang Xu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5047837484","display_name":"Mingze Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Mingze Wang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139844878","display_name":"Qi Yi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Qi Yi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5122963185","display_name":"Xue Gong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xue Gong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139818972","display_name":"Siheng Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Siheng Li","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139738163","display_name":"Ruibin Xiong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ruibin Xiong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139810238","display_name":"Kejiao Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kejiao Li","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139798638","display_name":"Yuhao Jiang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yuhao Jiang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139814021","display_name":"Bo Zhou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bo Zhou","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.8473652,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"24158","last_page":"24188"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8783000111579895,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8783000111579895,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.013500000350177288,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.011099999770522118,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5533000230789185},{"id":"https://openalex.org/keywords/verifiable-secret-sharing","display_name":"Verifiable secret sharing","score":0.46540001034736633},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.30790001153945923},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.30649998784065247},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.29019999504089355}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5958999991416931},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5533000230789185},{"id":"https://openalex.org/C85847156","wikidata":"https://www.wikidata.org/wiki/Q59015987","display_name":"Verifiable secret sharing","level":3,"score":0.46540001034736633},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4408999979496002},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.3174999952316284},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.30790001153945923},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.30649998784065247},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.29019999504089355},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.2793000042438507},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.27000001072883606},{"id":"https://openalex.org/C15744967","wikidata":"https://www.wikidata.org/wiki/Q9418","display_name":"Psychology","level":0,"score":0.26969999074935913},{"id":"https://openalex.org/C136197465","wikidata":"https://www.wikidata.org/wiki/Q1729295","display_name":"Variety (cybernetics)","level":2,"score":0.2687000036239624}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.findings-acl.1209","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.1209","pdf_url":"https://aclanthology.org/2026.findings-acl.1209.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.findings-acl.1209","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.1209","pdf_url":"https://aclanthology.org/2026.findings-acl.1209.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166858380.pdf","grobid_xml":"https://content.openalex.org/works/W7166858380.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"Learning":[1],"with":[2,170],"Verifiable":[3],"Rewards":[4],"(RLVR)":[5],"has":[6],"propelled":[7],"Large":[8],"Language":[9],"Models":[10],"in":[11,133,152,160],"complex":[12],"reasoning,":[13],"yet":[14],"its":[15],"scalability":[16],"is":[17,181],"often":[18],"hindered":[19],"by":[20,79],"a":[21,32,62],"training":[22,123,162],"bottleneck":[23],"where":[24,92,135],"performance":[25,151],"plateaus":[26],"as":[27],"policy":[28],"entropy":[29,47],"collapses,":[30],"signaling":[31],"loss":[33],"of":[34,68,112],"exploration.While":[35],"previous":[36],"methods":[37],"attempt":[38],"to":[39,177],"maintain":[40],"high":[41],"entropy,":[42],"we":[43,60,74,84],"argue":[44],"that":[45,118],"unselective":[46],"maximization":[48],"risks":[49],"amplifying":[50],"irrelevant":[51],"noise":[52,106],"rather":[53],"than":[54,98],"fostering":[55],"meaningful":[56],"exploration.In":[57],"this":[58],"paper,":[59],"identify":[61],"deeper":[63],"issue:":[64],"the":[65,89,103,110],"gradual":[66],"elimination":[67],"valuable":[69,114],"low-probability":[70,115],"exploratory":[71],"tokens,":[72],"which":[73],"term":[75],"reasoning":[76,93],"sparks,":[77],"driven":[78],"RLVR":[80],"over-penalization.To":[81],"address":[82],"this,":[83],"introduce":[85],"Low-probability":[86],"Regularization":[87],"(Lp-Reg).Leveraging":[88],"statistical":[90],"distinction":[91],"sparks":[94],"exhibit":[95],"higher":[96],"probabilities":[97],"noise,":[99],"Lp-Reg":[100,119,147],"filters":[101],"out":[102],"extremely":[104],"lowprobability":[105],"tokens":[107],"and":[108,155,168],"prevents":[109],"suppression":[111],"potentially":[113],"candidates.Experiments":[116],"demonstrate":[117],"enables":[120],"stable":[121],"on-policy":[122],"for":[124],"over":[125,143],"3,":[126],"000":[127],"steps":[128],"(81,204":[129],"GPU-hours),":[130],"sustaining":[131],"exploration":[132],"regimes":[134],"baselines":[136],"typically":[137],"collapse.Validated":[138],"across":[139,163],"extensive":[140],"evaluations":[141],"totaling":[142],"300,000":[144],"cumulative":[145],"GPUhours,":[146],"demonstrates":[148],"highly":[149],"competitive":[150],"off-policy":[153],"settings":[154],"consistently":[156],"achieves":[157],"state-of-the-art":[158],"results":[159],"onpolicy":[161],"diverse":[164],"model":[165],"families,":[166],"sizes,":[167],"domains,":[169],"relative":[171],"accuracy":[172],"improvements":[173],"ranging":[174],"from":[175],"3.06%":[176],"7.98%.\u2026":[178],"The":[179],"answer":[180],"2.":[182]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-07-02T00:00:00"}
