{"id":"https://openalex.org/W4416035250","doi":"https://doi.org/10.18653/v1/2025.findings-emnlp.253","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","display_name":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","publication_year":2025,"publication_date":"2025-01-01","ids":{"openalex":"https://openalex.org/W4416035250","doi":"https://doi.org/10.18653/v1/2025.findings-emnlp.253"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2025.findings-emnlp.253","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2025.findings-emnlp.253","pdf_url":"https://aclanthology.org/2025.findings-emnlp.253.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: EMNLP 2025","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2025.findings-emnlp.253.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5000095574","display_name":"Zhaohui Yang","orcid":"https://orcid.org/0000-0003-1105-8841"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhaohui Yang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5062194042","display_name":"Chenghua He","orcid":"https://orcid.org/0000-0001-9895-5072"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chenghua He","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5064189829","display_name":"Xiaowen Shi","orcid":"https://orcid.org/0000-0001-6532-4522"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xiaowen Shi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5108126327","display_name":"Shihong Deng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shihong Deng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5004618782","display_name":"Linjing Li","orcid":"https://orcid.org/0000-0002-8737-099X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Linjing Li","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5083652259","display_name":"Qiyue Yin","orcid":"https://orcid.org/0000-0002-3442-6275"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Qiyue Yin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5011852301","display_name":"Daxin Jiang","orcid":"https://orcid.org/0000-0003-3687-7499"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Daxin Jiang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.30153474,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"4711","last_page":"4728"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11902","display_name":"Intelligent Tutoring Systems and Adaptive Learning","score":0.1307000070810318,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11902","display_name":"Intelligent Tutoring Systems and Adaptive Learning","score":0.1307000070810318,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10315","display_name":"Decision-Making and Behavioral Economics","score":0.09120000153779984,"subfield":{"id":"https://openalex.org/subfields/1800","display_name":"General Decision Sciences"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T10906","display_name":"AI-based Problem Solving and Planning","score":0.05209999904036522,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.6244999766349792},{"id":"https://openalex.org/keywords/reflection","display_name":"Reflection (computer programming)","score":0.359499990940094},{"id":"https://openalex.org/keywords/mathematical-model","display_name":"Mathematical model","score":0.29190000891685486},{"id":"https://openalex.org/keywords/qualitative-reasoning","display_name":"Qualitative reasoning","score":0.26910001039505005}],"concepts":[{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.6244999766349792},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5555999875068665},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4496999979019165},{"id":"https://openalex.org/C65682993","wikidata":"https://www.wikidata.org/wiki/Q1056451","display_name":"Reflection (computer programming)","level":2,"score":0.359499990940094},{"id":"https://openalex.org/C15744967","wikidata":"https://www.wikidata.org/wiki/Q9418","display_name":"Psychology","level":0,"score":0.2964000105857849},{"id":"https://openalex.org/C188147891","wikidata":"https://www.wikidata.org/wiki/Q147638","display_name":"Cognitive science","level":1,"score":0.2953000068664551},{"id":"https://openalex.org/C76969082","wikidata":"https://www.wikidata.org/wiki/Q486902","display_name":"Mathematical model","level":2,"score":0.29190000891685486},{"id":"https://openalex.org/C83725634","wikidata":"https://www.wikidata.org/wiki/Q7268699","display_name":"Qualitative reasoning","level":2,"score":0.26910001039505005},{"id":"https://openalex.org/C180747234","wikidata":"https://www.wikidata.org/wiki/Q23373","display_name":"Cognitive psychology","level":1,"score":0.260699987411499},{"id":"https://openalex.org/C18762648","wikidata":"https://www.wikidata.org/wiki/Q42213","display_name":"Work (physics)","level":2,"score":0.25}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2025.findings-emnlp.253","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2025.findings-emnlp.253","pdf_url":"https://aclanthology.org/2025.findings-emnlp.253.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: EMNLP 2025","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2025.findings-emnlp.253","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2025.findings-emnlp.253","pdf_url":"https://aclanthology.org/2025.findings-emnlp.253.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: EMNLP 2025","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320321133","display_name":"Chinese Academy of Sciences","ror":"https://ror.org/034t30j35"}],"has_content":{"grobid_xml":true,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W4416035250.pdf","grobid_xml":"https://content.openalex.org/works/W4416035250.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Many":[0],"studies":[1],"focus":[2,27],"on":[3,29,122,161],"data":[4,75,134,192],"annotation":[5,76,183,186],"techniques":[6],"for":[7,78,128],"training":[8],"effective":[9,116],"PRMs.However,":[10],"current":[11],"methods":[12,45],"encounter":[13],"a":[14,73,138],"significant":[15],"issue":[16],"when":[17],"applied":[18],"to":[19,26,82,113,136,154,179,203],"long":[20,55,85],"CoT":[21,86],"reasoning":[22,59,66,87,120],"processes:":[23],"they":[24],"tend":[25],"solely":[28],"the":[30,47,84,91,102,205],"first":[31],"incorrect":[32,96],"step":[33,148],"and":[34,50,95,107,119,141,147,158,176,207],"all":[35,40],"preceding":[36],"steps,":[37],"assuming":[38],"that":[39,89,152],"subsequent":[41],"steps":[42,60,97],"are":[43],"incorrect.These":[44],"overlook":[46],"unique":[48],"self-correction":[49,117],"reflection":[51,92],"mechanisms":[52],"inherent":[53],"in":[54],"CoT,":[56],"where":[57],"correct":[58,94],"may":[61],"still":[62],"occur":[63],"after":[64],"initial":[65],"mistakes.To":[67],"address":[68],"this":[69],"issue,":[70],"we":[71,100,130],"propose":[72],"novel":[74],"method":[77],"PRMs":[79,157,159],"specifically":[80],"designed":[81],"score":[83],"process.Given":[88],"under":[90],"pattern,":[93],"often":[98],"alternate,":[99],"introduce":[101],"concepts":[103],"of":[104,209],"Error":[105,108],"Propagation":[106],"Cessation,":[109],"enhancing":[110],"PRMs'":[111],"ability":[112],"identify":[114],"both":[115,145],"behaviors":[118],"based":[121],"erroneous":[123],"steps.Leveraging":[124],"an":[125],"LLM-based":[126],"judger":[127],"annotation,":[129],"collect":[131],"1.7":[132],"million":[133],"samples":[135],"train":[137],"7B":[139],"PRM":[140,165],"evaluate":[142],"it":[143],"at":[144],"solution":[146],"levels.Experimental":[149],"results":[150],"demonstrate":[151,204],"compared":[153],"existing":[155],"open-source":[156,162],"trained":[160],"datasets,":[163],"our":[164,185,210],"achieves":[166,190],"superior":[167,197],"performance":[168],"across":[169],"various":[170],"metrics,":[171],"including":[172],"search":[173],"guidance,":[174],"BoN,":[175],"F1":[177],"scores.Compared":[178],"widely":[180],"used":[181],"MC-based":[182],"methods,":[184],"approach":[187],"not":[188],"only":[189],"higher":[191],"efficiency":[193],"but":[194],"also":[195,201],"delivers":[196],"performance.Detailed":[198],"analysis":[199],"is":[200],"conducted":[202],"stability":[206],"generalizability":[208],"method.":[211]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-11-08T00:00:00"}
