{"id":"https://openalex.org/W7134830274","doi":"https://doi.org/10.48550/arxiv.2603.06621","title":"Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models","display_name":"Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models","publication_year":2026,"publication_date":"2026-02-20","ids":{"openalex":"https://openalex.org/W7134830274","doi":"https://doi.org/10.48550/arxiv.2603.06621"},"language":null,"primary_location":{"id":"pmh:doi:10.48550/arxiv.2603.06621","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"type":"article","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":null,"any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5128685536","display_name":"Rishabh Tiwari","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tiwari, Rishabh","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128667717","display_name":"Aditya Tomar","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tomar, Aditya","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128662303","display_name":"Udbhav Bamba","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bamba, Udbhav","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5124754274","display_name":"Monishwaran Maheswaran","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Maheswaran, Monishwaran","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128688211","display_name":"Heng Yang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yang, Heng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128673471","display_name":"Michael W. Mahoney","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Mahoney, Michael W.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128650847","display_name":"Kurt Keutzer","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Keutzer, Kurt","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5125889929","display_name":"Amir Gholami","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Gholami, Amir","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.28985671,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.9542999863624573,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.9542999863624573,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.006599999964237213,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11424","display_name":"Security and Verification in Computing","score":0.005200000014156103,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/adversarial-system","display_name":"Adversarial system","score":0.8569999933242798},{"id":"https://openalex.org/keywords/robustness","display_name":"Robustness (evolution)","score":0.6180999875068665},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.45750001072883606},{"id":"https://openalex.org/keywords/fluency","display_name":"Fluency","score":0.43810001015663147},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.3379000127315521},{"id":"https://openalex.org/keywords/curiosity","display_name":"Curiosity","score":0.2915000021457672}],"concepts":[{"id":"https://openalex.org/C37736160","wikidata":"https://www.wikidata.org/wiki/Q1801315","display_name":"Adversarial system","level":2,"score":0.8569999933242798},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7501999735832214},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.6180999875068665},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5741000175476074},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5550000071525574},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.45750001072883606},{"id":"https://openalex.org/C2777413886","wikidata":"https://www.wikidata.org/wiki/Q3276013","display_name":"Fluency","level":2,"score":0.43810001015663147},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.3379000127315521},{"id":"https://openalex.org/C33435437","wikidata":"https://www.wikidata.org/wiki/Q366791","display_name":"Curiosity","level":2,"score":0.2915000021457672},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.28220000863075256},{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.2581999897956848},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.2533999979496002}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:doi:10.48550/arxiv.2603.06621","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},{"id":"doi:10.48550/arxiv.2603.06621","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.06621","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:doi:10.48550/arxiv.2603.06621","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"sustainable_development_goals":[{"score":0.4507710635662079,"id":"https://metadata.un.org/sdg/16","display_name":"Peace, Justice and strong institutions"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Process":[0],"Reward":[1],"Models":[2],"(PRMs)":[3],"are":[4,19,168],"rapidly":[5],"becoming":[6],"the":[7,96],"backbone":[8],"of":[9,63,119],"LLM":[10],"reasoning":[11,138],"pipelines,":[12],"yet":[13,60],"we":[14,29],"demonstrate":[15],"that":[16,35,77,129,144],"state-of-the-art":[17],"PRMs":[18,131],"systematically":[20],"exploitable":[21,90],"under":[22],"adversarial":[23,38],"optimization":[24,75],"pressure.":[25],"To":[26],"address":[27],"this,":[28],"introduce":[30],"a":[31,48,155],"three-tiered":[32],"diagnostic":[33,156],"framework":[34],"applies":[36],"increasing":[37],"pressure":[39],"to":[40,53,123,158],"quantify":[41],"these":[42],"vulnerabilities.":[43],"Static":[44],"perturbation":[45],"analysis":[46],"uncovers":[47],"fluency-logic":[49],"dissociation:":[50],"high":[51],"invariance":[52],"surface-level":[54],"style":[55],"changes":[56,58],"reward":[57,86,93,120],"$&lt;$0.1,":[59],"inconsistent":[61],"detection":[62],"logically-corrupted":[64],"reasoning,":[65],"with":[66,85,117],"different":[67,71],"models":[68],"failing":[69],"on":[70,82,102],"attack":[72],"types.":[73],"Adversarial":[74],"demonstrates":[76],"gradient-based":[78],"attacks":[79],"inflate":[80],"rewards":[81,108],"invalid":[83],"trajectories,":[84],"landscapes":[87],"exhibiting":[88],"wide,":[89],"peaks.":[91],"RL-induced":[92],"hacking":[94],"exposes":[95],"critical":[97],"failure":[98],"mode:":[99],"policies":[100],"trained":[101],"AIME":[103],"problems":[104],"achieve":[105],"near-perfect":[106],"PRM":[107],"($&gt;$0.9),":[109],"while":[110],"ground-truth":[111],"accuracy":[112],"remains":[113],"low":[114],"(below":[115],"4%),":[116],"43%":[118],"gains":[121],"attributable":[122],"stylistic":[124],"shortcuts.":[125],"These":[126],"findings":[127],"reveal":[128],"current":[130],"function":[132],"as":[133,148],"fluency":[134],"detectors":[135],"rather":[136],"than":[137],"verifiers,":[139],"creating":[140],"systematic":[141],"blind":[142],"spots":[143],"undermine":[145],"their":[146],"use":[147],"training":[149],"signals.":[150],"We":[151],"release":[152],"PRM-BiasBench":[153],"and":[154,166],"toolkit":[157],"enable":[159],"robustness":[160],"evaluation":[161],"before":[162],"deployment.":[163],"The":[164],"code":[165],"dataset":[167],"available":[169],"at":[170],"https://github.com/SqueezeAILab/reward-under-attack.":[171]},"counts_by_year":[],"updated_date":"2026-07-15T18:14:33.161393","created_date":"2026-03-11T00:00:00"}
