{"id":"https://openalex.org/W7155106531","doi":"https://doi.org/10.48550/arxiv.2604.16995","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","display_name":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","publication_year":2026,"publication_date":"2026-04-18","ids":{"openalex":"https://openalex.org/W7155106531","doi":"https://doi.org/10.48550/arxiv.2604.16995"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.16995","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.16995","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.16995","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5101231782","display_name":"Yifu Huo","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Huo, Yifu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134150063","display_name":"Chenglong Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Chenglong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5130216852","display_name":"Ziming Zhu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhu, Ziming","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134111884","display_name":"Shunjie Xing","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xing, Shunjie","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5101318537","display_name":"Peinan Feng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Feng, Peinan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5012126405","display_name":"Tongran Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Tongran","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134122135","display_name":"Qiaozhi He","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"He, Qiaozhi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5103267080","display_name":"Tianhua Zhou","orcid":"https://orcid.org/0009-0002-1362-3971"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhou, Tianhua","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134152916","display_name":"Xiaojia Chang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chang, Xiaojia","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134137047","display_name":"Jingbo Zhu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhu, Jingbo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134116273","display_name":"Zhengtao Yu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yu, Zhengtao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5134130404","display_name":"Tong Xiao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xiao, Tong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.2759000062942505,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.2759000062942505,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.10750000178813934,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12031","display_name":"Speech and dialogue systems","score":0.07259999960660934,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7268999814987183},{"id":"https://openalex.org/keywords/trajectory","display_name":"Trajectory","score":0.5145000219345093},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.4185999929904938},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.3125999867916107},{"id":"https://openalex.org/keywords/task-analysis","display_name":"Task analysis","score":0.2874999940395355}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7368000149726868},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7268999814987183},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5213000178337097},{"id":"https://openalex.org/C13662910","wikidata":"https://www.wikidata.org/wiki/Q193139","display_name":"Trajectory","level":2,"score":0.5145000219345093},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.4185999929904938},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.33719998598098755},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.3125999867916107},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.2874999940395355},{"id":"https://openalex.org/C187523126","wikidata":"https://www.wikidata.org/wiki/Q17098330","display_name":"Inverse dynamics","level":3,"score":0.26980000734329224},{"id":"https://openalex.org/C207467116","wikidata":"https://www.wikidata.org/wiki/Q4385666","display_name":"Inverse","level":2,"score":0.2687000036239624}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.16995","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.16995","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.16995","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.16995","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1,105,156],"(RL)":[2],"has":[3],"emerged":[4],"as":[5,111],"a":[6,55,66,95],"promising":[7],"paradigm":[8,97],"for":[9,41],"training":[10,20,96],"reasoning-oriented":[11,195],"models":[12],"by":[13],"leveraging":[14],"rule-based":[15],"reward":[16],"signals.":[17],"However,":[18],"RL":[19,80,101,155,182],"typically":[21],"tends":[22],"to":[23,116],"improve":[24,145],"single-sample":[25],"success":[26],"rates":[27],"(i.e.,":[28,44],"Pass@1)":[29],"while":[30],"offering":[31],"limited":[32],"exploration":[33,74,125,143,170,192],"of":[34,69,154,194],"diverse":[35],"reasoning":[36,135,174],"trajectories,":[37,71],"which":[38],"is":[39,62],"crucial":[40],"multi-sample":[42],"performance":[43,78],"Pass@k).":[45],"Our":[46,176],"preliminary":[47],"analysis":[48,153],"reveals":[49],"that":[50,98,138,179],"this":[51,84,87],"limitation":[52],"stems":[53],"from":[54],"fundamental":[56],"squeezing":[57],"effect,":[58],"whereby":[59],"probability":[60],"mass":[61],"excessively":[63],"concentrated":[64],"on":[65,131,164,168],"narrow":[67],"subset":[68],"high-reward":[70],"restricting":[72],"genuine":[73],"and":[75,113,144,158,183],"constraining":[76],"attainable":[77],"under":[79],"training.":[81],"To":[82],"address":[83],"issue,":[85],"in":[86,172],"work,":[88],"we":[89,150],"propose":[90],"Steering":[91],"Probability":[92],"Squeezing":[93],"(SPS),":[94],"interleaves":[99],"conventional":[100],"with":[102],"inverse":[103],"reinforcement":[104],"(IRL).":[106],"SPS":[107,139],"treats":[108],"on-policy":[109],"rollouts":[110],"demonstrations":[112],"employs":[114],"IRL":[115,184],"explicitly":[117],"reshape":[118],"the":[119,191],"induced":[120],"trajectory":[121],"distribution,":[122],"thereby":[123],"enhancing":[124],"without":[126],"introducing":[127],"external":[128],"supervision.":[129],"Experiments":[130],"five":[132],"commonly":[133],"used":[134],"benchmarks":[136],"demonstrate":[137],"can":[140],"enable":[141],"better":[142],"Pass@k.":[146],"Beyond":[147],"algorithmic":[148],"contributions,":[149],"provide":[151],"an":[152,160,186],"dynamics":[157],"identify":[159],"empirical":[161],"upper":[162],"bound":[163],"Pass@k,":[165],"shedding":[166],"light":[167],"intrinsic":[169],"limits":[171],"RL-based":[173],"models.":[175,198],"findings":[177],"suggest":[178],"alternating":[180],"between":[181],"offers":[185],"effective":[187],"pathway":[188],"toward":[189],"extending":[190],"capacity":[193],"large":[196],"language":[197]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-04-22T00:00:00"}
