{"id":"https://openalex.org/W4416252124","doi":"https://doi.org/10.1109/ijcnn64981.2025.11227254","title":"RFPO: Enhancing Mathematical Reasoning of Large Language Models with Fine-Grained Preference Optimization","display_name":"RFPO: Enhancing Mathematical Reasoning of Large Language Models with Fine-Grained Preference Optimization","publication_year":2025,"publication_date":"2025-06-30","ids":{"openalex":"https://openalex.org/W4416252124","doi":"https://doi.org/10.1109/ijcnn64981.2025.11227254"},"language":null,"primary_location":{"id":"doi:10.1109/ijcnn64981.2025.11227254","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ijcnn64981.2025.11227254","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5050423562","display_name":"Fei Gao","orcid":"https://orcid.org/0000-0002-1546-4364"},"institutions":[{"id":"https://openalex.org/I139759216","display_name":"Beijing University of Posts and Telecommunications","ror":"https://ror.org/04w9fbh59","country_code":"CN","type":"education","lineage":["https://openalex.org/I139759216"]}],"countries":["CN"],"is_corresponding":true,"raw_author_name":"Fei Gao","raw_affiliation_strings":["Beijing University of Posts and Telecommunications,School of Artificial Intelligence,Beijing,China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Beijing University of Posts and Telecommunications,School of Artificial Intelligence,Beijing,China","institution_ids":["https://openalex.org/I139759216"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":["https://openalex.org/A5050423562"],"corresponding_institution_ids":["https://openalex.org/I139759216"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.41018498,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"8"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11596","display_name":"Constraint Satisfaction and Optimization","score":0.3684000074863434,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11596","display_name":"Constraint Satisfaction and Optimization","score":0.3684000074863434,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10181","display_name":"Natural Language Processing Techniques","score":0.13940000534057617,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.10809999704360962,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/preference","display_name":"Preference","score":0.7337999939918518},{"id":"https://openalex.org/keywords/preference-learning","display_name":"Preference learning","score":0.5562999844551086},{"id":"https://openalex.org/keywords/context","display_name":"Context (archaeology)","score":0.5442000031471252},{"id":"https://openalex.org/keywords/focus","display_name":"Focus (optics)","score":0.4113999903202057},{"id":"https://openalex.org/keywords/security-token","display_name":"Security token","score":0.40799999237060547},{"id":"https://openalex.org/keywords/optimization-problem","display_name":"Optimization problem","score":0.3249000012874603}],"concepts":[{"id":"https://openalex.org/C2781249084","wikidata":"https://www.wikidata.org/wiki/Q908656","display_name":"Preference","level":2,"score":0.7337999939918518},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6902999877929688},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6173999905586243},{"id":"https://openalex.org/C181204326","wikidata":"https://www.wikidata.org/wiki/Q7239820","display_name":"Preference learning","level":3,"score":0.5562999844551086},{"id":"https://openalex.org/C2779343474","wikidata":"https://www.wikidata.org/wiki/Q3109175","display_name":"Context (archaeology)","level":2,"score":0.5442000031471252},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5062000155448914},{"id":"https://openalex.org/C192209626","wikidata":"https://www.wikidata.org/wiki/Q190909","display_name":"Focus (optics)","level":2,"score":0.4113999903202057},{"id":"https://openalex.org/C48145219","wikidata":"https://www.wikidata.org/wiki/Q1335365","display_name":"Security token","level":2,"score":0.40799999237060547},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.3249000012874603},{"id":"https://openalex.org/C111335779","wikidata":"https://www.wikidata.org/wiki/Q3454686","display_name":"Reduction (mathematics)","level":2,"score":0.2962000072002411},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.2727999985218048},{"id":"https://openalex.org/C183322885","wikidata":"https://www.wikidata.org/wiki/Q17007702","display_name":"Context model","level":3,"score":0.2671999931335449},{"id":"https://openalex.org/C2777868144","wikidata":"https://www.wikidata.org/wiki/Q7239817","display_name":"Preference elicitation","level":3,"score":0.25360000133514404}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/ijcnn64981.2025.11227254","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ijcnn64981.2025.11227254","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":10,"referenced_works":["https://openalex.org/W2087347434","https://openalex.org/W2165181820","https://openalex.org/W2763110165","https://openalex.org/W4385570088","https://openalex.org/W4402670301","https://openalex.org/W4402671688","https://openalex.org/W4402671689","https://openalex.org/W4404781623","https://openalex.org/W4404782689","https://openalex.org/W4415795501"],"related_works":[],"abstract_inverted_index":{"The":[0],"Direct":[1],"Preference":[2],"Optimization":[3],"(DPO)":[4],"method":[5,91,162],"and":[6,36,50,75,177],"its":[7],"various":[8],"variants":[9],"have":[10],"recently":[11],"been":[12],"shown":[13],"to":[14,54,73,106,110,117],"perform":[15],"well":[16],"on":[17,25,30,65,148,173,217],"general":[18],"instruction":[19],"tuning":[20],"tasks.":[21],"These":[22],"methods":[23],"focus":[24],"optimizing":[26],"models":[27],"directly":[28],"based":[29],"preference":[31,89,135,200],"feedback,":[32],"enabling":[33],"more":[34],"stable":[35],"efficient":[37],"learning.":[38],"However,":[39],"they":[40],"exhibit":[41],"limited":[42],"improvement":[43],"in":[44,57,169,208],"reasoning-intensive":[45],"tasks":[46],"such":[47],"as":[48,194,196],"GSM8K":[49,176,219],"may":[51],"even":[52],"lead":[53],"a":[55,84,108,204],"decrease":[56],"performance.":[58],"This":[59,132],"limitation":[60],"stems":[61],"from":[62],"DPO\u2019s":[63],"reliance":[64],"sample-level":[66,166],"supervision,":[67],"which":[68],"hinders":[69],"the":[70,115,120,126,130,140,164,175,191,211,218],"model\u2019s":[71],"ability":[72],"capture":[74],"differentiate":[76],"fine-grained":[77,98,104,161],"details.":[78],"In":[79],"this":[80],"work,":[81],"we":[82],"propose":[83],"novel":[85],"fine-grained,":[86],"reasoning":[87,150],"direct":[88],"optimization":[90,136],"called":[92],"RFPO.":[93],"Rather":[94],"than":[95],"specifically":[96],"generating":[97],"data,":[99],"RFPO":[100,216],"uses":[101],"an":[102],"improved":[103],"loss":[105],"assign":[107],"weight":[109],"each":[111],"token":[112],"adaptively,":[113],"allowing":[114],"model":[116,168,213],"autonomously":[118],"learn":[119],"significance":[121],"of":[122,129,143,153,171,193,199],"different":[123],"tokens":[124],"within":[125,139],"global":[127],"context":[128],"sentence.":[131],"approach":[133],"enhances":[134],"between":[137],"candidates":[138],"competitive":[141],"Chain":[142],"Thought":[144],"(CoT)":[145],"by":[146],"focusing":[147],"individual":[149],"steps":[151],"instead":[152],"holistically":[154],"evaluating":[155],"answers.":[156],"We":[157],"found":[158],"that":[159,190],"our":[160,187],"outperforms":[163],"original":[165],"optimized":[167],"terms":[170],"accuracy":[172],"both":[174],"MATH":[178],"datasets,":[179],"with":[180,215],"all":[181],"other":[182],"conditions":[183],"being":[184],"equal.":[185],"Furthermore,":[186],"findings":[188],"demonstrate":[189],"use":[192],"few":[195],"3,600":[197],"pairs":[198],"data":[201],"can":[202],"yield":[203],"nearly":[205],"3%":[206],"increase":[207],"precision":[209],"for":[210],"Llama3-8B-Instruct":[212],"aligned":[214],"dataset.":[220]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-11-14T00:00:00"}
