{"id":"https://openalex.org/W7138101841","doi":"https://doi.org/10.48550/arxiv.2603.13985","title":"Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Models","display_name":"Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Models","publication_year":2026,"publication_date":"2026-03-14","ids":{"openalex":"https://openalex.org/W7138101841","doi":"https://doi.org/10.48550/arxiv.2603.13985"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.13985","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.13985","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.13985","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5129689604","display_name":"Haitao Jiang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jiang, Haitao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5129703182","display_name":"Wenbo Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Wenbo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5129685009","display_name":"Jiarui Yao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yao, Jiarui","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5129708146","display_name":"Hengrui Cai","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cai, Hengrui","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5129648834","display_name":"Sheng H Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Sheng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5129733125","display_name":"Rui Song","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Song, Rui","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.2362000048160553,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.2362000048160553,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11636","display_name":"Artificial Intelligence in Healthcare and Education","score":0.20020000636577606,"subfield":{"id":"https://openalex.org/subfields/2718","display_name":"Health Informatics"},"field":{"id":"https://openalex.org/fields/27","display_name":"Medicine"},"domain":{"id":"https://openalex.org/domains/4","display_name":"Health Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.046300001442432404,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7396000027656555},{"id":"https://openalex.org/keywords/leverage","display_name":"Leverage (statistics)","score":0.684499979019165},{"id":"https://openalex.org/keywords/perspective","display_name":"Perspective (graphical)","score":0.5507000088691711},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.4869999885559082},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.4189000129699707},{"id":"https://openalex.org/keywords/empirical-research","display_name":"Empirical research","score":0.37940001487731934}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7396000027656555},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.714900016784668},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.684499979019165},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5968999862670898},{"id":"https://openalex.org/C12713177","wikidata":"https://www.wikidata.org/wiki/Q1900281","display_name":"Perspective (graphical)","level":2,"score":0.5507000088691711},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5131000280380249},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.4869999885559082},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.4189000129699707},{"id":"https://openalex.org/C120936955","wikidata":"https://www.wikidata.org/wiki/Q2155640","display_name":"Empirical research","level":2,"score":0.37940001487731934},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.350600004196167},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.32710000872612},{"id":"https://openalex.org/C136389625","wikidata":"https://www.wikidata.org/wiki/Q334384","display_name":"Supervised learning","level":3,"score":0.28040000796318054}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.13985","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.13985","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.13985","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.13985","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Pre-trained":[0],"Large":[1],"Language":[2],"Model":[3],"(LLM)":[4],"exhibits":[5],"broad":[6],"capabilities,":[7],"yet,":[8],"for":[9,175],"specific":[10],"tasks":[11],"or":[12,31],"domains":[13],"their":[14,79,90,106],"attainment":[15],"of":[16,75,114,163],"higher":[17],"accuracy":[18],"and":[19,43,49,59,67,83,97,102,134,141,154,165,171,181],"more":[20],"reliable":[21],"reasoning":[22],"generally":[23],"depends":[24],"on":[25,62,110],"post-training":[26,64,132],"through":[27],"Supervised":[28],"Fine-Tuning":[29],"(SFT)":[30],"Reinforcement":[32],"Learning":[33],"(RL).":[34],"Although":[35],"often":[36],"treated":[37],"as":[38],"distinct":[39],"methodologies,":[40,153],"recent":[41,115],"theoretical":[42,150],"empirical":[44,155],"developments":[45],"demonstrate":[46],"that":[47,94,104,138],"SFT":[48,66,96,164],"RL":[50,166],"are":[51],"closely":[52],"connected.":[53],"This":[54],"study":[55,158],"presents":[56],"a":[57,111,160,168],"comprehensive":[58],"unified":[60,169],"perspective":[61],"LLM":[63,183],"with":[65],"RL.":[68],"We":[69,86],"first":[70],"provide":[71],"an":[72],"in-depth":[73],"overview":[74],"both":[76],"techniques,":[77],"examining":[78],"objectives,":[80],"algorithmic":[81],"structures,":[82],"data":[84],"requirements.":[85],"then":[87],"systematically":[88],"analyze":[89],"interplay,":[91],"highlighting":[92],"frameworks":[93],"integrate":[95],"RL,":[98],"hybrid":[99,131],"training":[100],"pipelines,":[101],"methods":[103],"leverage":[105],"complementary":[107],"strengths.":[108],"Drawing":[109],"representative":[112],"set":[113],"application":[116],"studies":[117],"from":[118],"2023":[119],"to":[120],"2025,":[121],"we":[122],"identify":[123],"emerging":[124],"trends,":[125],"characterize":[126],"the":[127],"rapid":[128],"shift":[129],"toward":[130],"paradigms,":[133],"distill":[135],"key":[136],"takeaways":[137],"clarify":[139],"when":[140],"why":[142],"each":[143],"method":[144],"is":[145],"most":[146],"effective.":[147],"By":[148],"synthesizing":[149],"insights,":[151],"practical":[152],"evidence,":[156],"this":[157],"establishes":[159],"coherent":[161],"understanding":[162],"within":[167],"framework":[170],"outlines":[172],"promising":[173],"directions":[174],"future":[176],"research":[177],"in":[178],"scalable,":[179],"efficient,":[180],"generalizable":[182],"post-training.":[184]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-03-18T00:00:00"}
