{"id":"https://openalex.org/W7131419536","doi":"https://doi.org/10.48550/arxiv.2602.19372","title":"Seeing Farther and Smarter: Value-Guided Multi-Path Reflection for VLM Policy Optimization","display_name":"Seeing Farther and Smarter: Value-Guided Multi-Path Reflection for VLM Policy Optimization","publication_year":2026,"publication_date":"2026-02-22","ids":{"openalex":"https://openalex.org/W7131419536","doi":"https://doi.org/10.48550/arxiv.2602.19372"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2602.19372","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2602.19372","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2602.19372","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5126843090","display_name":"Yanting Yang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yang, Yanting","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5027837326","display_name":"Shenyuan Gao","orcid":"https://orcid.org/0009-0006-4763-9655"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Gao, Shenyuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5104255210","display_name":"Qingwen Bu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bu, Qingwen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5126780148","display_name":"Li Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Li","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5126816472","display_name":"Dimitris N. Metaxas","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Metaxas, Dimitris N.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.6814000010490417,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.6814000010490417,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.08330000191926956,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.051100000739097595,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.6732000112533569},{"id":"https://openalex.org/keywords/reflection","display_name":"Reflection (computer programming)","score":0.558899998664856},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.5439000129699707},{"id":"https://openalex.org/keywords/scalability","display_name":"Scalability","score":0.4666999876499176},{"id":"https://openalex.org/keywords/reduction","display_name":"Reduction (mathematics)","score":0.4496000111103058},{"id":"https://openalex.org/keywords/perspective","display_name":"Perspective (graphical)","score":0.44029998779296875},{"id":"https://openalex.org/keywords/computation","display_name":"Computation","score":0.41290000081062317},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.40790000557899475},{"id":"https://openalex.org/keywords/grasp","display_name":"GRASP","score":0.37299999594688416}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6880000233650208},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.6732000112533569},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5620999932289124},{"id":"https://openalex.org/C65682993","wikidata":"https://www.wikidata.org/wiki/Q1056451","display_name":"Reflection (computer programming)","level":2,"score":0.558899998664856},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.5439000129699707},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4731999933719635},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.4666999876499176},{"id":"https://openalex.org/C111335779","wikidata":"https://www.wikidata.org/wiki/Q3454686","display_name":"Reduction (mathematics)","level":2,"score":0.4496000111103058},{"id":"https://openalex.org/C12713177","wikidata":"https://www.wikidata.org/wiki/Q1900281","display_name":"Perspective (graphical)","level":2,"score":0.44029998779296875},{"id":"https://openalex.org/C45374587","wikidata":"https://www.wikidata.org/wiki/Q12525525","display_name":"Computation","level":2,"score":0.41290000081062317},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.40790000557899475},{"id":"https://openalex.org/C171268870","wikidata":"https://www.wikidata.org/wiki/Q1486676","display_name":"GRASP","level":2,"score":0.37299999594688416},{"id":"https://openalex.org/C94361409","wikidata":"https://www.wikidata.org/wiki/Q7882500","display_name":"Uncertainty reduction theory","level":2,"score":0.3617999851703644},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.3546999990940094},{"id":"https://openalex.org/C160234255","wikidata":"https://www.wikidata.org/wiki/Q812535","display_name":"Bayesian inference","level":3,"score":0.3352000117301941},{"id":"https://openalex.org/C2779843651","wikidata":"https://www.wikidata.org/wiki/Q7390335","display_name":"SIGNAL (programming language)","level":2,"score":0.31790000200271606},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.31209999322891235},{"id":"https://openalex.org/C22367795","wikidata":"https://www.wikidata.org/wiki/Q7625208","display_name":"Structured prediction","level":2,"score":0.29319998621940613},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.2890999913215637},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.2863999903202057},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.28519999980926514},{"id":"https://openalex.org/C4679612","wikidata":"https://www.wikidata.org/wiki/Q866298","display_name":"Aggregate (composite)","level":2,"score":0.28209999203681946},{"id":"https://openalex.org/C179518139","wikidata":"https://www.wikidata.org/wiki/Q5140297","display_name":"Coding (social sciences)","level":2,"score":0.2791999876499176},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.2766999900341034},{"id":"https://openalex.org/C57273362","wikidata":"https://www.wikidata.org/wiki/Q576722","display_name":"Decoding methods","level":2,"score":0.2703000009059906},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.259799987077713},{"id":"https://openalex.org/C107673813","wikidata":"https://www.wikidata.org/wiki/Q812534","display_name":"Bayesian probability","level":2,"score":0.2563000023365021},{"id":"https://openalex.org/C13687954","wikidata":"https://www.wikidata.org/wiki/Q4826847","display_name":"Autonomous agent","level":2,"score":0.2524000108242035},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.2506999969482422}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2602.19372","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2602.19372","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2602.19372","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2602.19372","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","score":0.82119220495224,"id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Solving":[0],"complex,":[1],"long-horizon":[2],"robotic":[3,194],"manipulation":[4,195],"tasks":[5,196],"requires":[6],"a":[7,26,66,82,96,127,169,198],"deep":[8],"understanding":[9],"of":[10,58,112,137],"physical":[11],"interactions,":[12],"reasoning":[13],"about":[14],"their":[15,156],"long-term":[16,158],"consequences,":[17],"and":[18,53,70,99,125,149],"precise":[19],"high-level":[20],"planning.":[21],"Vision-Language":[22],"Models":[23],"(VLMs)":[24],"offer":[25],"general":[27],"perceive-reason-act":[28],"framework":[29,86],"for":[30,103,175],"this":[31],"goal.":[32],"However,":[33],"previous":[34],"approaches":[35],"using":[36],"reflective":[37],"planning":[38],"to":[39,122,130,144,154,161],"guide":[40],"VLMs":[41],"in":[42,120,201],"correcting":[43],"actions":[44],"encounter":[45],"significant":[46],"limitations.":[47],"These":[48],"methods":[49],"rely":[50],"on":[51,190],"inefficient":[52],"often":[54],"inaccurate":[55],"implicit":[56],"learning":[57],"state-values":[59],"from":[60,72,91],"noisy":[61],"foresight":[62],"predictions,":[63],"evaluate":[64],"only":[65,185],"single":[67],"greedy":[68],"future,":[69],"suffer":[71],"substantial":[73],"inference":[74,210],"latency.":[75],"To":[76,132],"address":[77,133],"these":[78],"limitations,":[79],"we":[80,140,167],"propose":[81],"novel":[83],"test-time":[84],"computation":[85],"that":[87,173],"decouples":[88],"state":[89],"evaluation":[90],"action":[92,114,164],"generation.":[93,165],"This":[94],"provides":[95],"more":[97,162],"direct":[98,179],"fine-grained":[100],"supervisory":[101],"signal":[102],"robust":[104,163],"decision-making.":[105],"Our":[106],"method":[107],"explicitly":[108],"models":[109],"the":[110,123,134],"advantage":[111],"an":[113],"plan,":[115],"quantified":[116],"by":[117,212],"its":[118],"reduction":[119],"distance":[121],"goal,":[124],"uses":[126],"scalable":[128],"critic":[129],"estimate.":[131],"stochastic":[135],"nature":[136],"single-trajectory":[138],"evaluation,":[139],"employ":[141],"beam":[142],"search":[143],"explore":[145],"multiple":[146],"future":[147],"paths":[148],"aggregate":[150],"them":[151],"during":[152],"decoding":[153],"model":[155],"expected":[157],"returns,":[159],"leading":[160],"Additionally,":[166],"introduce":[168],"lightweight,":[170],"confidence-based":[171],"trigger":[172],"allows":[174],"early":[176],"exit":[177],"when":[178,186],"predictions":[180],"are":[181],"reliable,":[182],"invoking":[183],"reflection":[184],"necessary.":[187],"Extensive":[188],"experiments":[189],"diverse,":[191],"unseen":[192],"multi-stage":[193],"demonstrate":[197],"24.6%":[199],"improvement":[200],"success":[202],"rate":[203],"over":[204],"state-of-the-art":[205],"baselines,":[206],"while":[207],"significantly":[208],"reducing":[209],"time":[211],"56.5%.":[213]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-02-26T00:00:00"}
