{"id":"https://openalex.org/W7163671137","doi":"https://doi.org/10.48550/arxiv.2606.05468","title":"FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization","display_name":"FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization","publication_year":2026,"publication_date":"2026-06-03","ids":{"openalex":"https://openalex.org/W7163671137","doi":"https://doi.org/10.48550/arxiv.2606.05468"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.05468","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.05468","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.05468","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5137979349","display_name":"Yihao Wu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wu, Yihao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137965120","display_name":"He Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, He","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137935824","display_name":"Junbo Tan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tan, Junbo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137991280","display_name":"Xueqian Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Xueqian","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5137972496","display_name":"Zhengyou Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Zhengyou","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.675000011920929,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.675000011920929,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.13539999723434448,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.0421999990940094,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/teleoperation","display_name":"Teleoperation","score":0.6194000244140625},{"id":"https://openalex.org/keywords/interpolation","display_name":"Interpolation (computer graphics)","score":0.5641999840736389},{"id":"https://openalex.org/keywords/robot","display_name":"Robot","score":0.5360000133514404},{"id":"https://openalex.org/keywords/operator","display_name":"Operator (biology)","score":0.4884999990463257},{"id":"https://openalex.org/keywords/base","display_name":"Base (topology)","score":0.47589999437332153},{"id":"https://openalex.org/keywords/exploit","display_name":"Exploit","score":0.4758000075817108},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.43459999561309814},{"id":"https://openalex.org/keywords/head","display_name":"Head (geology)","score":0.42410001158714294},{"id":"https://openalex.org/keywords/control-theory","display_name":"Control theory (sociology)","score":0.33809998631477356}],"concepts":[{"id":"https://openalex.org/C161759796","wikidata":"https://www.wikidata.org/wiki/Q3982902","display_name":"Teleoperation","level":3,"score":0.6194000244140625},{"id":"https://openalex.org/C137800194","wikidata":"https://www.wikidata.org/wiki/Q11713455","display_name":"Interpolation (computer graphics)","level":3,"score":0.5641999840736389},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.5360000133514404},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5245000123977661},{"id":"https://openalex.org/C17020691","wikidata":"https://www.wikidata.org/wiki/Q139677","display_name":"Operator (biology)","level":5,"score":0.4884999990463257},{"id":"https://openalex.org/C42058472","wikidata":"https://www.wikidata.org/wiki/Q810214","display_name":"Base (topology)","level":2,"score":0.47589999437332153},{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.4758000075817108},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.43799999356269836},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.43799999356269836},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.4359999895095825},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.43459999561309814},{"id":"https://openalex.org/C2780312720","wikidata":"https://www.wikidata.org/wiki/Q5689100","display_name":"Head (geology)","level":2,"score":0.42410001158714294},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.33809998631477356},{"id":"https://openalex.org/C48677424","wikidata":"https://www.wikidata.org/wiki/Q6888088","display_name":"Mode (computer interface)","level":2,"score":0.3368000090122223},{"id":"https://openalex.org/C2781249084","wikidata":"https://www.wikidata.org/wiki/Q908656","display_name":"Preference","level":2,"score":0.3138999938964844},{"id":"https://openalex.org/C147764199","wikidata":"https://www.wikidata.org/wiki/Q6865248","display_name":"Minification","level":2,"score":0.3012999892234802},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.2962000072002411},{"id":"https://openalex.org/C2780440489","wikidata":"https://www.wikidata.org/wiki/Q5227278","display_name":"Data-driven","level":2,"score":0.2922999858856201},{"id":"https://openalex.org/C66283442","wikidata":"https://www.wikidata.org/wiki/Q1389268","display_name":"Failure mode and effects analysis","level":2,"score":0.2870999872684479},{"id":"https://openalex.org/C36503486","wikidata":"https://www.wikidata.org/wiki/Q11235244","display_name":"Domain (mathematical analysis)","level":2,"score":0.28119999170303345},{"id":"https://openalex.org/C44154836","wikidata":"https://www.wikidata.org/wiki/Q45045","display_name":"Simulation","level":1,"score":0.2727000117301941},{"id":"https://openalex.org/C61797465","wikidata":"https://www.wikidata.org/wiki/Q1188986","display_name":"Term (time)","level":2,"score":0.27140000462532043},{"id":"https://openalex.org/C2779795794","wikidata":"https://www.wikidata.org/wiki/Q7315343","display_name":"Reset (finance)","level":2,"score":0.26570001244544983},{"id":"https://openalex.org/C2778029271","wikidata":"https://www.wikidata.org/wiki/Q5421931","display_name":"Extension (predicate logic)","level":2,"score":0.25999999046325684},{"id":"https://openalex.org/C13662910","wikidata":"https://www.wikidata.org/wiki/Q193139","display_name":"Trajectory","level":2,"score":0.2563000023365021},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.2551000118255615},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.25029999017715454}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.05468","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.05468","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.05468","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.05468","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Post-training":[0],"Vision-Language-Action":[1],"(VLA)":[2],"models":[3],"into":[4,143],"policies":[5],"that":[6,86],"can":[7],"be":[8],"reliably":[9],"deployed":[10],"on":[11,121],"real":[12,123],"robots":[13],"remains":[14],"a":[15,46,64,78,108,122,126,130],"major":[16],"bottleneck.":[17],"SFT":[18],"and":[19,26,38,116,168],"DAgger":[20],"exploit":[21],"failure":[22,99],"signals":[23],"only":[24],"indirectly,":[25],"reward-based":[27],"RL":[28],"is":[29],"bottlenecked":[30],"by":[31],"the":[32,69,88,92,97,105,149,160,171],"difficulty":[33],"of":[34,39,73,91,101,173],"real-world":[35],"reward":[36],"design":[37],"training":[40],"reliable":[41],"critics.":[42],"We":[43],"present":[44],"FlowPRO,":[45],"reward-free":[47],"offline":[48],"reinforced":[49],"fine-tuning":[50],"framework":[51],"for":[52],"flow-matching":[53,70],"VLAs.":[54],"Algorithmically,":[55],"we":[56],"propose":[57],"RPRO":[58,76],"(Robotic":[59],"Flow-matching":[60],"Proximalized":[61],"Preference":[62],"Optimization),":[63],"preference-optimization":[65],"objective":[66],"tailored":[67],"to":[68],"action":[71],"head":[72],"VLA":[74],"models.":[75],"pairs":[77],"contrastive":[79],"optimizer":[80],"with":[81,135],"an":[82],"explicit":[83],"proximal":[84],"regularizer":[85],"anchors":[87],"absolute":[89],"magnitude":[90],"implicit":[93],"reward,":[94],"thereby":[95],"eliminating":[96],"reward-hacking":[98],"mode":[100],"plain":[102],"Flow-DPO.":[103],"On":[104,153],"data":[106],"side,":[107],"teleoperated":[109],"intervention-and-rollback":[110],"paradigm":[111],"produces":[112],"naturally":[113],"paired":[114],"positive":[115],"negative":[117],"trajectories":[118],"$(\u03c4^w,":[119],"\u03c4^l)$":[120],"robot":[124],"from":[125],"single":[127],"operator":[128],"action;":[129],"Smooth":[131],"Interpolation":[132],"procedure,":[133],"combined":[134],"batch":[136],"mixing,":[137],"then":[138],"converts":[139],"these":[140],"sparse":[141],"corrections":[142],"dense":[144],"per-state":[145],"supervision":[146],"while":[147],"preserving":[148],"base":[150],"policy's":[151],"capabilities.":[152],"four":[154,165],"long-horizon":[155],"bimanual":[156],"tasks,":[157],"FlowPRO":[158],"attains":[159],"highest":[161],"success":[162],"rate,":[163],"outperforming":[164],"representative":[166],"baselines,":[167],"ablations":[169],"confirm":[170],"contribution":[172],"each":[174],"loss":[175],"component.":[176]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-06-06T00:00:00"}
