{"id":"https://openalex.org/W7154182845","doi":"https://doi.org/10.48550/arxiv.2604.08905","title":"StaRPO: Stability-Augmented Reinforcement Policy Optimization","display_name":"StaRPO: Stability-Augmented Reinforcement Policy Optimization","publication_year":2026,"publication_date":"2026-04-10","ids":{"openalex":"https://openalex.org/W7154182845","doi":"https://doi.org/10.48550/arxiv.2604.08905"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.08905","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.08905","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.08905","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5133539870","display_name":"Jinghan Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Jinghan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5133489436","display_name":"Fengran Mo","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Mo, Fengran","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5133482024","display_name":"Tharindu Cyril Weerasooriya","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Weerasooriya, Tharindu Cyril","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5122893586","display_name":"Ruimin Dai","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Dai, Ruimin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5051640055","display_name":"X. Y. Han","orcid":"https://orcid.org/0000-0002-4605-4990"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Han, Xiaoyan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5133532213","display_name":"Yanjie Fu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Fu, Yanjie","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5133500688","display_name":"Dakuo Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Dakuo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5133513616","display_name":"Kunpeng Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Kunpeng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.39089998602867126,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.39089998602867126,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.2597000002861023,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.1177000030875206,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7081999778747559},{"id":"https://openalex.org/keywords/correctness","display_name":"Correctness","score":0.6970999836921692},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.6970000267028809},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.5770000219345093},{"id":"https://openalex.org/keywords/autocorrelation","display_name":"Autocorrelation","score":0.421099990606308},{"id":"https://openalex.org/keywords/path","display_name":"Path (computing)","score":0.4002000093460083}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7400000095367432},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7081999778747559},{"id":"https://openalex.org/C55439883","wikidata":"https://www.wikidata.org/wiki/Q360812","display_name":"Correctness","level":2,"score":0.6970999836921692},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.6970000267028809},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5992000102996826},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.5770000219345093},{"id":"https://openalex.org/C5297727","wikidata":"https://www.wikidata.org/wiki/Q786970","display_name":"Autocorrelation","level":2,"score":0.421099990606308},{"id":"https://openalex.org/C2777735758","wikidata":"https://www.wikidata.org/wiki/Q817765","display_name":"Path (computing)","level":2,"score":0.4002000093460083},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.391400009393692},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.38920000195503235},{"id":"https://openalex.org/C22367795","wikidata":"https://www.wikidata.org/wiki/Q7625208","display_name":"Structured prediction","level":2,"score":0.37070000171661377},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.32330000400543213},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.2802000045776367},{"id":"https://openalex.org/C20693621","wikidata":"https://www.wikidata.org/wiki/Q6667502","display_name":"Logical framework","level":2,"score":0.2667999863624573}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.08905","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.08905","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.08905","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.08905","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1,66],"(RL)":[2],"is":[3],"effective":[4],"in":[5,13],"enhancing":[6],"the":[7,32,37,41,74,86,104,123],"accuracy":[8,159],"of":[9,36,103,125],"large":[10],"language":[11],"models":[12,42],"complex":[14],"reasoning":[15,38,71,105,145],"tasks.":[16],"Existing":[17],"RL":[18],"policy":[19],"optimization":[20,75],"frameworks":[21],"rely":[22],"on":[23,138,143],"final-answer":[24,158],"correctness":[25],"as":[26],"feedback":[27],"signals":[28],"and":[29,46,95,118,128,154,160],"rarely":[30],"capture":[31],"internal":[33],"logical":[34,161],"structure":[35],"process.":[39],"Consequently,":[40],"would":[43],"generate":[44],"fluent":[45],"semantically":[47],"relevant":[48],"responses":[49],"but":[50],"logically":[51],"inconsistent,":[52],"structurally":[53],"erratic,":[54],"or":[55],"redundant.":[56],"To":[57],"this":[58],"end,":[59],"we":[60],"propose":[61],"StaRPO,":[62],"a":[63],"stability-augmented":[64],"reinforcement":[65],"framework":[67],"that":[68,148],"explicitly":[69],"incorporates":[70],"stability":[72,80,108],"into":[73,81],"objective.":[76],"Our":[77],"StaRPO":[78,149],"decomposes":[79],"two":[82,139],"computable":[83],"lightweight":[84],"metrics:":[85],"Autocorrelation":[87],"Function":[88],"(ACF)":[89],"to":[90,99,115],"evaluate":[91,100],"local":[92],"step-to-step":[93],"coherence,":[94],"Path":[96],"Efficiency":[97],"(PE)":[98],"global":[101],"goal-directedness":[102],"trajectory.":[106],"These":[107],"rewards":[109,114,130],"are":[110],"combined":[111],"with":[112,135],"task":[113],"provide":[116],"complementary":[117],"process-aware":[119],"feedback.":[120],"We":[121],"validate":[122],"effectiveness":[124],"using":[126],"ACF":[127],"PE":[129],"by":[131],"showing":[132],"their":[133],"correlation":[134],"logic":[136],"errors":[137],"backbone":[140],"models.":[141],"Experiments":[142],"four":[144],"benchmarks":[146],"show":[147],"consistently":[150],"outperforms":[151],"compared":[152],"baselines":[153],"can":[155],"enhance":[156],"both":[157],"stability.":[162]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-04-14T00:00:00"}
