{"id":"https://openalex.org/W7166839567","doi":"https://doi.org/10.48550/arxiv.2606.31377","title":"Stage-Transition Dense Reward Modeling for Reinforcement Learning","display_name":"Stage-Transition Dense Reward Modeling for Reinforcement Learning","publication_year":2026,"publication_date":"2026-06-30","ids":{"openalex":"https://openalex.org/W7166839567","doi":"https://doi.org/10.48550/arxiv.2606.31377"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.31377","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.31377","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.31377","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139809139","display_name":"Yang Yang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yang, Yang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5103052163","display_name":"Bingjie Chen","orcid":"https://orcid.org/0000-0001-7689-2146"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Bingjie","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139849047","display_name":"Zihan Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Zihan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139799391","display_name":"Yizhe Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Yizhe","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5094274818","display_name":"Guoping Pan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Pan, Guoping","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139755373","display_name":"Yi Cheng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cheng, Yi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139752045","display_name":"Houde Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Houde","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.7519999742507935,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.7519999742507935,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.19259999692440033,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.011900000274181366,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7426000237464905},{"id":"https://openalex.org/keywords/robustness","display_name":"Robustness (evolution)","score":0.6894999742507935},{"id":"https://openalex.org/keywords/object","display_name":"Object (grammar)","score":0.3467000126838684},{"id":"https://openalex.org/keywords/robot","display_name":"Robot","score":0.34630000591278076},{"id":"https://openalex.org/keywords/error-driven-learning","display_name":"Error-driven learning","score":0.3179999887943268},{"id":"https://openalex.org/keywords/noise","display_name":"Noise (video)","score":0.311599999666214},{"id":"https://openalex.org/keywords/active-vision","display_name":"Active vision","score":0.28630000352859497},{"id":"https://openalex.org/keywords/visual-feedback","display_name":"Visual feedback","score":0.28540000319480896}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7674000263214111},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7426000237464905},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.6894999742507935},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6169000267982483},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4763000011444092},{"id":"https://openalex.org/C2781238097","wikidata":"https://www.wikidata.org/wiki/Q175026","display_name":"Object (grammar)","level":2,"score":0.3467000126838684},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.34630000591278076},{"id":"https://openalex.org/C47932503","wikidata":"https://www.wikidata.org/wiki/Q5395689","display_name":"Error-driven learning","level":3,"score":0.3179999887943268},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.311599999666214},{"id":"https://openalex.org/C193611912","wikidata":"https://www.wikidata.org/wiki/Q4677596","display_name":"Active vision","level":2,"score":0.28630000352859497},{"id":"https://openalex.org/C3020716817","wikidata":"https://www.wikidata.org/wiki/Q4132092","display_name":"Visual feedback","level":2,"score":0.28540000319480896},{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.2833000123500824},{"id":"https://openalex.org/C2775960376","wikidata":"https://www.wikidata.org/wiki/Q1435859","display_name":"Grippers","level":2,"score":0.28209999203681946},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.2799000144004822},{"id":"https://openalex.org/C2776151529","wikidata":"https://www.wikidata.org/wiki/Q3045304","display_name":"Object detection","level":3,"score":0.27459999918937683},{"id":"https://openalex.org/C184337299","wikidata":"https://www.wikidata.org/wiki/Q1437428","display_name":"Semantics (computer science)","level":2,"score":0.2685999870300293},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2667999863624573},{"id":"https://openalex.org/C136389625","wikidata":"https://www.wikidata.org/wiki/Q334384","display_name":"Supervised learning","level":3,"score":0.26429998874664307},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.26249998807907104},{"id":"https://openalex.org/C199190896","wikidata":"https://www.wikidata.org/wiki/Q3509276","display_name":"Learning classifier system","level":3,"score":0.25589999556541443},{"id":"https://openalex.org/C198531522","wikidata":"https://www.wikidata.org/wiki/Q485146","display_name":"Sample (material)","level":2,"score":0.2513999938964844}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.31377","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.31377","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.31377","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.31377","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1,74],"for":[2,52,172],"long-horizon":[3],"robotic":[4],"manipulation":[5,122],"is":[6,20],"often":[7],"limited":[8],"by":[9],"sparse":[10],"and":[11,22,28,70,86,105,115,127,137,143,179],"delayed":[12],"rewards,":[13],"while":[14,167],"manually":[15],"designing":[16],"dense":[17,50,148],"shaping":[18],"signals":[19,75],"costly":[21],"brittle":[23],"to":[24,62,112,176],"changes":[25],"in":[26],"environments":[27],"object":[29],"configurations.":[30],"This":[31],"work":[32],"proposes":[33],"Stage-Transition":[34],"Dense":[35],"Reward":[36],"(STDR),":[37],"a":[38,64,106],"visual":[39,177],"reward-learning":[40],"framework":[41],"that":[42,82,91,131,158],"converts":[43],"unstructured":[44],"expert":[45],"videos":[46],"into":[47],"logically":[48],"grounded":[49],"rewards":[51,149,163,171],"training":[53],"RL":[54],"agents":[55],"from":[56,68],"scratch.":[57],"STDR":[58,132,159],"leverages":[59],"semantic":[60],"understanding":[61],"infer":[63],"task's":[65],"stage":[66],"structure":[67],"demonstrations,":[69],"delivers":[71],"two":[72],"complementary":[73],"during":[76],"online":[77],"training:":[78],"(i)":[79],"stage-transition":[80],"feedback":[81,90],"provides":[83],"goal-directed":[84],"reward,":[85],"(ii)":[87],"within-stage":[88],"progress":[89],"supplies":[92],"fine-grained":[93],"guidance":[94],"toward":[95],"completing":[96],"each":[97],"stage.":[98],"Furthermore,":[99],"an":[100],"out-of-distribution":[101],"(OOD)":[102],"detection":[103],"mechanism":[104],"grasping":[107],"regulation":[108],"module":[109],"are":[110],"integrated":[111],"enhance":[113],"robustness":[114,175],"prevent":[116],"reward":[117,181],"hacking.":[118],"Experiments":[119],"on":[120,150,164],"14":[121],"tasks":[123],"across":[124,183],"MetaWorld,":[125],"ManiSkill,":[126],"Franka":[128],"Kitchen":[129],"show":[130],"consistently":[133],"improves":[134],"sample":[135],"efficiency":[136],"success":[138],"rates":[139],"over":[140],"multiple":[141],"baselines,":[142],"matches":[144],"or":[145],"surpasses":[146],"handcrafted":[147],"several":[151],"challenging":[152],"tasks.":[153],"Real-robot":[154],"evaluations":[155],"further":[156],"indicate":[157],"assigns":[160],"stable,":[161],"progress-aligned":[162],"successful":[165],"executions":[166],"producing":[168],"appropriately":[169],"low":[170],"failures,":[173],"suggesting":[174],"noise":[178],"better-calibrated":[180],"assignment":[182],"settings.":[184]},"counts_by_year":[],"updated_date":"2026-07-02T06:18:51.028212","created_date":"2026-07-02T00:00:00"}
