{"id":"https://openalex.org/W7160267005","doi":"https://doi.org/10.48550/arxiv.2605.01327","title":"Segment-Aligned Policy Optimization for Multi-Modal Reasoning","display_name":"Segment-Aligned Policy Optimization for Multi-Modal Reasoning","publication_year":2026,"publication_date":"2026-05-02","ids":{"openalex":"https://openalex.org/W7160267005","doi":"https://doi.org/10.48550/arxiv.2605.01327"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.01327","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.01327","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.01327","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5135396670","display_name":"Lei Gao","orcid":"https://orcid.org/0009-0004-1218-2566"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Gao, Lei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135349129","display_name":"Zhuoming Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Zhuoming","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135308614","display_name":"Mengxi Jia","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jia, Mengxi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135344778","display_name":"Jiakang Yuan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yuan, Jiakang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135331144","display_name":"Hongbo Sun","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sun, Hongbo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135341224","display_name":"Hao Sun","orcid":"https://orcid.org/0000-0002-1189-1430"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sun, Hao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5135352801","display_name":"Xuelong Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Xuelong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.4203000068664551,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.4203000068664551,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10181","display_name":"Natural Language Processing Techniques","score":0.14949999749660492,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.0640999972820282,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7771999835968018},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.6489999890327454},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.5490000247955322},{"id":"https://openalex.org/keywords/abstraction","display_name":"Abstraction","score":0.5293999910354614},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.4359000027179718},{"id":"https://openalex.org/keywords/granularity","display_name":"Granularity","score":0.4334000051021576},{"id":"https://openalex.org/keywords/markov-process","display_name":"Markov process","score":0.39010000228881836},{"id":"https://openalex.org/keywords/bridge","display_name":"Bridge (graph theory)","score":0.38769999146461487}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7771999835968018},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.718500018119812},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.6489999890327454},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6018000245094299},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.5490000247955322},{"id":"https://openalex.org/C124304363","wikidata":"https://www.wikidata.org/wiki/Q673661","display_name":"Abstraction","level":2,"score":0.5293999910354614},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.459199994802475},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.4359000027179718},{"id":"https://openalex.org/C177774035","wikidata":"https://www.wikidata.org/wiki/Q1246948","display_name":"Granularity","level":2,"score":0.4334000051021576},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.39010000228881836},{"id":"https://openalex.org/C100776233","wikidata":"https://www.wikidata.org/wiki/Q2532492","display_name":"Bridge (graph theory)","level":2,"score":0.38769999146461487},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.3409000039100647},{"id":"https://openalex.org/C83725634","wikidata":"https://www.wikidata.org/wiki/Q7268699","display_name":"Qualitative reasoning","level":2,"score":0.3343999981880188},{"id":"https://openalex.org/C2776291640","wikidata":"https://www.wikidata.org/wiki/Q2912517","display_name":"Value (mathematics)","level":2,"score":0.32019999623298645},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.3181000053882599},{"id":"https://openalex.org/C20162079","wikidata":"https://www.wikidata.org/wiki/Q1151406","display_name":"Case-based reasoning","level":2,"score":0.30329999327659607},{"id":"https://openalex.org/C184337299","wikidata":"https://www.wikidata.org/wiki/Q1437428","display_name":"Semantics (computer science)","level":2,"score":0.29739999771118164},{"id":"https://openalex.org/C140779682","wikidata":"https://www.wikidata.org/wiki/Q210868","display_name":"Sampling (signal processing)","level":3,"score":0.2851000130176544},{"id":"https://openalex.org/C86827895","wikidata":"https://www.wikidata.org/wiki/Q7098582","display_name":"Opportunistic reasoning","level":4,"score":0.2687000036239624},{"id":"https://openalex.org/C195324797","wikidata":"https://www.wikidata.org/wiki/Q33742","display_name":"Natural language","level":2,"score":0.2513999938964844},{"id":"https://openalex.org/C89288958","wikidata":"https://www.wikidata.org/wiki/Q7301504","display_name":"Reasoning system","level":2,"score":0.25029999017715454}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.01327","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.01327","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.01327","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.01327","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.6349647045135498,"display_name":"Gender equality","id":"https://metadata.un.org/sdg/5"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Existing":[0],"reinforcement":[1,59,144],"learning":[2,60,145],"approaches":[3],"for":[4,156],"Large":[5],"Language":[6],"Models":[7],"typically":[8],"perform":[9],"policy":[10,77,121,162],"optimization":[11,122,163],"at":[12],"the":[13,28,140,148,154],"granularity":[14],"of":[15,32,76,142,151],"individual":[16],"tokens":[17,69],"or":[18,70],"entire":[19],"response":[20],"sequences.":[21],"However,":[22],"such":[23],"formulations":[24],"often":[25],"misalign":[26],"with":[27,105,147],"natural":[29],"step-wise":[30,82],"structure":[31,150],"reasoning":[33,45,65,88,106,111,166],"processes,":[34],"leading":[35],"to":[36,174],"suboptimal":[37],"credit":[38],"assignment":[39],"and":[40,97,119,133,159,169],"unstable":[41],"training":[42,131],"in":[43,164],"multi-modal":[44],"tasks.":[46,167],"To":[47],"bridge":[48],"this":[49],"gap,":[50],"we":[51],"propose":[52],"Segment-Aligned":[53],"Policy":[54],"Optimization":[55],"(SAPO),":[56],"a":[57,81],"novel":[58],"paradigm":[61],"that":[62,101,114],"treats":[63],"coherent":[64],"steps,":[66],"rather":[67],"than":[68],"full":[71,176],"sequences":[72],"as":[73],"fundamental":[74],"units":[75],"update.":[78],"SAPO":[79,115],"introduces":[80],"Markov":[83],"decision":[84],"process":[85],"abstraction":[86],"over":[87],"segments,":[89],"accompanied":[90],"by":[91],"segment-level":[92],"value":[93,134],"estimation,":[94],"advantage":[95],"computation,":[96],"importance":[98,141],"sampling":[99],"mechanisms":[100],"are":[102],"semantically":[103,160],"aligned":[104],"boundaries.":[107],"Experiments":[108],"on":[109],"representative":[110],"benchmarks":[112],"demonstrate":[113],"consistently":[116],"outperforms":[117],"token-level":[118],"sequence-level":[120],"methods,":[123],"achieving":[124],"significant":[125],"accuracy":[126],"improvements":[127],"while":[128],"exhibiting":[129],"better":[130],"stability":[132],"estimation":[135],"consistency.":[136],"Our":[137],"work":[138],"underscores":[139],"aligning":[143],"updates":[146],"intrinsic":[149],"reasoning,":[152],"paving":[153],"way":[155],"more":[157],"efficient":[158],"grounded":[161],"complex":[165],"Codes":[168],"models":[170],"will":[171],"be":[172],"released":[173],"ensure":[175],"reproducibility.":[177]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-05-06T00:00:00"}
