{"id":"https://openalex.org/W7160837493","doi":"https://doi.org/10.48550/arxiv.2605.07274","title":"Structured Role-Aware Policy Optimization for Multimodal Reasoning","display_name":"Structured Role-Aware Policy Optimization for Multimodal Reasoning","publication_year":2026,"publication_date":"2026-05-08","ids":{"openalex":"https://openalex.org/W7160837493","doi":"https://doi.org/10.48550/arxiv.2605.07274"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.07274","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.07274","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.07274","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5135876135","display_name":"Bingqing Jiang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jiang, Bingqing","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5135868242","display_name":"Difan Zou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zou, Difan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.9329000115394592,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.9329000115394592,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.009399999864399433,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.008100000210106373,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/consistency","display_name":"Consistency (knowledge bases)","score":0.6215999722480774},{"id":"https://openalex.org/keywords/perspective","display_name":"Perspective (graphical)","score":0.59579998254776},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5814999938011169},{"id":"https://openalex.org/keywords/perception","display_name":"Perception","score":0.5167999863624573},{"id":"https://openalex.org/keywords/security-token","display_name":"Security token","score":0.44110000133514404},{"id":"https://openalex.org/keywords/verifiable-secret-sharing","display_name":"Verifiable secret sharing","score":0.4255000054836273},{"id":"https://openalex.org/keywords/sequence","display_name":"Sequence (biology)","score":0.4212999939918518},{"id":"https://openalex.org/keywords/visual-reasoning","display_name":"Visual reasoning","score":0.4147999882698059}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7340999841690063},{"id":"https://openalex.org/C2776436953","wikidata":"https://www.wikidata.org/wiki/Q5163215","display_name":"Consistency (knowledge bases)","level":2,"score":0.6215999722480774},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6065999865531921},{"id":"https://openalex.org/C12713177","wikidata":"https://www.wikidata.org/wiki/Q1900281","display_name":"Perspective (graphical)","level":2,"score":0.59579998254776},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5814999938011169},{"id":"https://openalex.org/C26760741","wikidata":"https://www.wikidata.org/wiki/Q160402","display_name":"Perception","level":2,"score":0.5167999863624573},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4830000102519989},{"id":"https://openalex.org/C48145219","wikidata":"https://www.wikidata.org/wiki/Q1335365","display_name":"Security token","level":2,"score":0.44110000133514404},{"id":"https://openalex.org/C85847156","wikidata":"https://www.wikidata.org/wiki/Q59015987","display_name":"Verifiable secret sharing","level":3,"score":0.4255000054836273},{"id":"https://openalex.org/C2778112365","wikidata":"https://www.wikidata.org/wiki/Q3511065","display_name":"Sequence (biology)","level":2,"score":0.4212999939918518},{"id":"https://openalex.org/C2777508537","wikidata":"https://www.wikidata.org/wiki/Q7936620","display_name":"Visual reasoning","level":2,"score":0.4147999882698059},{"id":"https://openalex.org/C19768560","wikidata":"https://www.wikidata.org/wiki/Q320727","display_name":"Dependency (UML)","level":2,"score":0.3862999975681305},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.38580000400543213},{"id":"https://openalex.org/C22367795","wikidata":"https://www.wikidata.org/wiki/Q7625208","display_name":"Structured prediction","level":2,"score":0.36340001225471497},{"id":"https://openalex.org/C178253425","wikidata":"https://www.wikidata.org/wiki/Q162668","display_name":"Visual perception","level":3,"score":0.35429999232292175},{"id":"https://openalex.org/C189645446","wikidata":"https://www.wikidata.org/wiki/Q350865","display_name":"Mirroring","level":2,"score":0.3370000123977661},{"id":"https://openalex.org/C36464697","wikidata":"https://www.wikidata.org/wiki/Q451553","display_name":"Visualization","level":2,"score":0.3319999873638153},{"id":"https://openalex.org/C40506919","wikidata":"https://www.wikidata.org/wiki/Q7452469","display_name":"Sequence learning","level":2,"score":0.3179999887943268},{"id":"https://openalex.org/C2780910867","wikidata":"https://www.wikidata.org/wiki/Q1952416","display_name":"Multimodality","level":2,"score":0.2921999990940094},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.2791999876499176},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.2702000141143799},{"id":"https://openalex.org/C2780660688","wikidata":"https://www.wikidata.org/wiki/Q25052564","display_name":"Multimodal learning","level":2,"score":0.266400009393692}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.07274","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.07274","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.07274","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.07274","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1],"from":[2,72,98],"verifiable":[3],"rewards":[4,32],"(RLVR),":[5],"especially":[6],"with":[7,161],"Group":[8],"Relative":[9],"Policy":[10,109],"Optimization":[11,110],"(GRPO),":[12],"has":[13],"shown":[14],"strong":[15],"potential":[16],"for":[17,88,95,226],"improving":[18],"the":[19,37,44,73,114,124,162,187,215],"reasoning":[20,93,153,206],"capabilities":[21],"of":[22,47,75,217],"large":[23],"vision-language":[24],"models":[25,198],"(LVLMs).":[26],"However,":[27],"in":[28],"multimodal":[29,70,205,228],"reasoning,":[30,213],"final-answer":[31],"are":[33,83,139,155,168],"typically":[34],"assigned":[35],"at":[36],"sequence":[38],"level":[39],"and":[40,92,191],"do":[41],"not":[42],"distinguish":[43],"functional":[45],"roles":[46],"different":[48],"tokens,":[49],"making":[50],"it":[51],"difficult":[52],"to":[53,142,158],"determine":[54],"whether":[55],"a":[56,172],"correct":[57],"answer":[58],"is":[59],"supported":[60],"by":[61,132],"task-relevant":[62],"visual":[63,90,144,150],"evidence.":[64,100],"In":[65],"this":[66,103],"paper,":[67],"we":[68,105],"revisit":[69],"RLVR":[71],"perspective":[74],"role-aware":[76,119,224],"token-level":[77,120],"credit":[78,131,222],"assignment,":[79],"where":[80],"structured":[81],"responses":[82],"decomposed":[84],"into":[85,118],"perception":[86,137],"tokens":[87,94,138,154],"extracting":[89],"evidence":[91],"deriving":[96],"answers":[97],"that":[99,180,209],"Based":[101],"on":[102],"perspective,":[104],"propose":[106],"Structured":[107],"Role-aware":[108],"(SRPO),":[111],"which":[112],"refines":[113],"sequence-level":[115,221],"GRPO":[116,189],"advantage":[117],"advantages":[121],"without":[122,194],"changing":[123],"reward":[125,190,197],"function.":[126],"Specifically,":[127],"SRPO":[128,210],"assigns":[129],"role-specific":[130,166],"using":[133],"self-distilled":[134],"on-policy":[135],"contrasts:":[136],"emphasized":[140,156],"according":[141,157],"their":[143,159],"dependency":[145],"under":[146],"original":[147,188],"versus":[148],"corrupted":[149],"inputs,":[151],"while":[152,185],"consistency":[160],"generated":[163],"perception.":[164],"These":[165],"signals":[167],"further":[169],"unified":[170],"through":[171],"shared":[173],"trajectory-level":[174],"baseline,":[175],"yielding":[176],"positive":[177],"token":[178],"weights":[179],"adjust":[181],"relative":[182],"update":[183],"magnitudes":[184],"preserving":[186],"optimization":[192,225],"direction,":[193],"requiring":[195],"external":[196],"or":[199],"separate":[200],"teachers.":[201],"Experiments":[202],"across":[203],"diverse":[204],"benchmarks":[207],"show":[208],"improves":[211],"evidence-grounded":[212],"highlighting":[214],"importance":[216],"moving":[218],"beyond":[219],"uniform":[220],"toward":[223],"reliable":[227],"reasoning.":[229]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-05-12T00:00:00"}
