{"id":"https://openalex.org/W7166733872","doi":"https://doi.org/10.48550/arxiv.2606.28955","title":"Modification-Considering Value Learning for Reward Hacking Mitigation in RL","display_name":"Modification-Considering Value Learning for Reward Hacking Mitigation in RL","publication_year":2026,"publication_date":"2026-06-27","ids":{"openalex":"https://openalex.org/W7166733872","doi":"https://doi.org/10.48550/arxiv.2606.28955"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.28955","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.28955","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.28955","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139650839","display_name":"Evgenii Opryshko","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Opryshko, Evgenii","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5004302727","display_name":"Umangi Jain","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jain, Umangi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139713573","display_name":"Igor Gilitschenski","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Gilitschenski, Igor","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.626800000667572,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.626800000667572,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.1128000020980835,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10639","display_name":"Advanced Software Engineering Methodologies","score":0.04639999940991402,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/hacker","display_name":"Hacker","score":0.7929999828338623},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7534000277519226},{"id":"https://openalex.org/keywords/exploit","display_name":"Exploit","score":0.71670001745224},{"id":"https://openalex.org/keywords/value","display_name":"Value (mathematics)","score":0.49970000982284546},{"id":"https://openalex.org/keywords/estimator","display_name":"Estimator","score":0.490200012922287},{"id":"https://openalex.org/keywords/mode","display_name":"Mode (computer interface)","score":0.45879998803138733}],"concepts":[{"id":"https://openalex.org/C86844869","wikidata":"https://www.wikidata.org/wiki/Q2798820","display_name":"Hacker","level":2,"score":0.7929999828338623},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7534000277519226},{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.71670001745224},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6284999847412109},{"id":"https://openalex.org/C2776291640","wikidata":"https://www.wikidata.org/wiki/Q2912517","display_name":"Value (mathematics)","level":2,"score":0.49970000982284546},{"id":"https://openalex.org/C185429906","wikidata":"https://www.wikidata.org/wiki/Q1130160","display_name":"Estimator","level":2,"score":0.490200012922287},{"id":"https://openalex.org/C48677424","wikidata":"https://www.wikidata.org/wiki/Q6888088","display_name":"Mode (computer interface)","level":2,"score":0.45879998803138733},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4041999876499176},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.32989999651908875},{"id":"https://openalex.org/C136389625","wikidata":"https://www.wikidata.org/wiki/Q334384","display_name":"Supervised learning","level":3,"score":0.30390000343322754},{"id":"https://openalex.org/C2777211547","wikidata":"https://www.wikidata.org/wiki/Q17141490","display_name":"Training (meteorology)","level":2,"score":0.2985999882221222},{"id":"https://openalex.org/C38652104","wikidata":"https://www.wikidata.org/wiki/Q3510521","display_name":"Computer security","level":1,"score":0.2919999957084656},{"id":"https://openalex.org/C194232998","wikidata":"https://www.wikidata.org/wiki/Q1606712","display_name":"Transition (genetics)","level":3,"score":0.2856999933719635},{"id":"https://openalex.org/C112930515","wikidata":"https://www.wikidata.org/wiki/Q4389547","display_name":"Risk analysis (engineering)","level":1,"score":0.2786000072956085},{"id":"https://openalex.org/C10431821","wikidata":"https://www.wikidata.org/wiki/Q6510174","display_name":"Learning effect","level":2,"score":0.2705000042915344},{"id":"https://openalex.org/C109359841","wikidata":"https://www.wikidata.org/wiki/Q728944","display_name":"Inclusion (mineral)","level":2,"score":0.26820001006126404},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.26269999146461487}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.28955","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.28955","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.28955","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.28955","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/10","display_name":"Reduced inequalities","score":0.490193635225296}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1],"agents":[2],"can":[3],"exploit":[4],"misspecified":[5],"reward":[6,24,110,162],"signals":[7],"to":[8,33,166],"achieve":[9],"high":[10],"apparent":[11],"returns":[12],"while":[13,164],"failing":[14],"on":[15],"the":[16,58,91,125,168],"intended":[17,169],"objective,":[18],"a":[19,36,41,80,102,108],"failure":[20],"mode":[21],"known":[22,37],"as":[23,79],"hacking.":[25],"Existing":[26],"practical":[27],"defenses":[28],"typically":[29],"constrain":[30],"policy":[31],"updates":[32],"stay":[34],"near":[35],"safe":[38,136],"reference,":[39],"creating":[40],"tension":[42],"between":[43],"suppressing":[44],"hacking":[45,158,163],"and":[46,74,93,98,112,137,139,144,150],"permitting":[47],"legitimate":[48],"improvement.":[49],"We":[50,127],"propose":[51],"Modification-Considering":[52],"Value":[53],"Learning":[54],"(MCVL),":[55],"which":[56,131],"operationalizes":[57],"theoretical":[59],"idea":[60],"of":[61],"current":[62],"utility":[63],"optimization":[64],"for":[65],"standard":[66],"value-based":[67],"RL.":[68],"MCVL":[69,141,160],"wraps":[70],"an":[71],"off-policy":[72],"learner":[73],"treats":[75],"each":[76],"incoming":[77],"transition":[78,92,116],"candidate":[81],"modification:":[82],"it":[83],"forecasts":[84],"two":[85],"training":[86],"paths,":[87],"one":[88,94],"that":[89,95],"includes":[90],"does":[96,122],"not,":[97],"scores":[99],"both":[100,135],"with":[101,142,156],"frozen":[103],"bootstrapped-return":[104],"estimator":[105],"derived":[106],"from":[107],"learned":[109],"model":[111],"value":[113],"function.":[114],"The":[115],"is":[117,134],"admitted":[118],"only":[119],"if":[120],"inclusion":[121],"not":[123],"decrease":[124],"score.":[126],"formalize":[128],"conditions":[129],"under":[130],"this":[132],"filtering":[133],"permissive,":[138],"instantiate":[140],"DDQN":[143],"TD3.":[145],"Across":[146],"four":[147],"safety-relevant":[148],"gridworlds":[149],"three":[151],"modified":[152],"MuJoCo":[153],"continuous-control":[154],"tasks":[155],"diverse":[157],"mechanisms,":[159],"mitigates":[161],"continuing":[165],"improve":[167],"objective.":[170],"Project":[171],"website:":[172],"ktolnos.github.io/mcvl/.":[173]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-07-01T00:00:00"}
