{"id":"https://openalex.org/W7141466165","doi":"https://doi.org/10.48550/arxiv.2603.25108","title":"MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning","display_name":"MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning","publication_year":2026,"publication_date":"2026-03-26","ids":{"openalex":"https://openalex.org/W7141466165","doi":"https://doi.org/10.48550/arxiv.2603.25108"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.25108","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.25108","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.25108","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5130763823","display_name":"Chenglong Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Chenglong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5101231782","display_name":"Yifu Huo","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Huo, Yifu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5129956171","display_name":"Yang Gan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Gan, Yang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5130740659","display_name":"Qiaozhi He","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"He, Qiaozhi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5130719595","display_name":"Qi Meng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Meng, Qi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5130769305","display_name":"Bei Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Bei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5130727741","display_name":"Yan Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Yan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5130786903","display_name":"Junfu Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Junfu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5130772220","display_name":"Tianhua Zhou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhou, Tianhua","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5130757953","display_name":"Jingbo Zhu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhu, Jingbo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5130750277","display_name":"Tong Xiao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xiao, Tong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.7685999870300293,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.7685999870300293,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10667","display_name":"Emotion and Mood Recognition","score":0.042899999767541885,"subfield":{"id":"https://openalex.org/subfields/3205","display_name":"Experimental and Cognitive Psychology"},"field":{"id":"https://openalex.org/fields/32","display_name":"Psychology"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T10203","display_name":"Recommender Systems and Techniques","score":0.01489999983459711,"subfield":{"id":"https://openalex.org/subfields/1710","display_name":"Information Systems"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6811000108718872},{"id":"https://openalex.org/keywords/generative-grammar","display_name":"Generative grammar","score":0.6050999760627747},{"id":"https://openalex.org/keywords/discriminative-model","display_name":"Discriminative model","score":0.5760999917984009},{"id":"https://openalex.org/keywords/generalization","display_name":"Generalization","score":0.5503000020980835},{"id":"https://openalex.org/keywords/preference","display_name":"Preference","score":0.5013999938964844},{"id":"https://openalex.org/keywords/generative-model","display_name":"Generative model","score":0.4041999876499176}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7204999923706055},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6811000108718872},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6237000226974487},{"id":"https://openalex.org/C39890363","wikidata":"https://www.wikidata.org/wiki/Q36108","display_name":"Generative grammar","level":2,"score":0.6050999760627747},{"id":"https://openalex.org/C97931131","wikidata":"https://www.wikidata.org/wiki/Q5282087","display_name":"Discriminative model","level":2,"score":0.5760999917984009},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5539000034332275},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.5503000020980835},{"id":"https://openalex.org/C2781249084","wikidata":"https://www.wikidata.org/wiki/Q908656","display_name":"Preference","level":2,"score":0.5013999938964844},{"id":"https://openalex.org/C167966045","wikidata":"https://www.wikidata.org/wiki/Q5532625","display_name":"Generative model","level":3,"score":0.4041999876499176},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.399399995803833},{"id":"https://openalex.org/C2780660688","wikidata":"https://www.wikidata.org/wiki/Q25052564","display_name":"Multimodal learning","level":2,"score":0.3783999979496002},{"id":"https://openalex.org/C22367795","wikidata":"https://www.wikidata.org/wiki/Q7625208","display_name":"Structured prediction","level":2,"score":0.28189998865127563},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.2599000036716461},{"id":"https://openalex.org/C2778755073","wikidata":"https://www.wikidata.org/wiki/Q10858537","display_name":"Scale (ratio)","level":2,"score":0.25780001282691956},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.2515999972820282}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.25108","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.25108","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.25108","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.25108","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/10","display_name":"Reduced inequalities","score":0.7499290108680725}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Recent":[0],"advances":[1],"in":[2],"multimodal":[3,36,49,87,116,122,182],"reward":[4,37,101],"modeling":[5],"have":[6,25],"been":[7],"largely":[8],"driven":[9],"by":[10,96],"a":[11,72,99,128],"paradigm":[12,95],"shift":[13],"from":[14,30,104,166,173],"discriminative":[15],"to":[16,34,57,62,115,133,168,175],"generative":[17,150],"approaches.":[18],"Building":[19],"on":[20,47,170,177],"this":[21,68,113],"progress,":[22],"recent":[23],"studies":[24],"further":[26],"employed":[27],"reinforcement":[28],"learning":[29,98],"verifiable":[31],"rewards":[32],"(RLVR)":[33],"enhance":[35],"models":[38],"(MRMs).":[39],"Despite":[40],"their":[41,155],"success,":[42],"RLVR-based":[43,93,147],"training":[44,94,148],"typically":[45],"relies":[46],"labeled":[48],"preference":[50,107,135,183],"data,":[51,108],"which":[52,78],"are":[53],"costly":[54],"and":[55,109,120,152,161,172],"labor-intensive":[56],"obtain,":[58],"making":[59],"it":[60],"difficult":[61],"scale":[63],"MRM":[64],"training.":[65],"To":[66],"overcome":[67],"limitation,":[69],"we":[70,126],"propose":[71],"Multi-Stage":[73],"Reinforcement":[74],"Learning":[75],"(MSRL)":[76],"approach,":[77],"can":[79],"achieve":[80],"scalable":[81],"RL":[82],"for":[83],"MRMs":[84,151],"with":[85],"limited":[86],"data.":[88],"MSRL":[89,143],"replaces":[90],"the":[91,146],"conventional":[92],"first":[97],"generalizable":[100],"reasoning":[102],"capability":[103,114],"large-scale":[105],"textual":[106],"then":[110],"progressively":[111],"transferring":[112],"tasks":[117,164],"through":[118],"caption-based":[119],"fully":[121],"reinforcement-learning":[123],"stages.":[124],"Furthermore,":[125],"introduce":[127],"cross-modal":[129],"knowledge":[130],"distillation":[131],"approach":[132],"improve":[134],"generalization":[136],"within":[137],"MSRL.":[138],"Extensive":[139],"experiments":[140],"demonstrate":[141],"that":[142],"effectively":[144],"scales":[145],"of":[149],"substantially":[153],"improves":[154],"performance":[156],"across":[157],"both":[158],"visual":[159,162],"understanding":[160],"generation":[163],"(e.g.,":[165],"66.6%":[167],"75.9%":[169],"VL-RewardBench":[171],"70.2%":[174],"75.7%":[176],"GenAI-Bench),":[178],"without":[179],"requiring":[180],"additional":[181],"annotations.":[184],"Our":[185],"code":[186],"is":[187],"available":[188],"at:":[189],"https://github.com/wangclnlp/MSRL.":[190]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-03-28T00:00:00"}
