{"id":"https://openalex.org/W7166730227","doi":"https://doi.org/10.48550/arxiv.2606.30376","title":"FlowAWR: Online Adaptive Flow Reinforcement via Advantage-Weighted Rectification","display_name":"FlowAWR: Online Adaptive Flow Reinforcement via Advantage-Weighted Rectification","publication_year":2026,"publication_date":"2026-06-29","ids":{"openalex":"https://openalex.org/W7166730227","doi":"https://doi.org/10.48550/arxiv.2606.30376"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.30376","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.30376","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.30376","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5005679397","display_name":"Zheming Fu","orcid":"https://orcid.org/0000-0002-8846-8198"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Fu, Zheming","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136450802","display_name":"Ruizhe He","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"He, Ruizhe","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5115604897","display_name":"Wei Shang","orcid":"https://orcid.org/0000-0001-6039-6041"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shang, Wei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139640337","display_name":"Xiaoxiao Ma","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ma, Xiaoxiao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139692437","display_name":"Lei Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Lei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139665949","display_name":"Chang Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Chang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5083298839","display_name":"Siming Fu","orcid":"https://orcid.org/0000-0003-3257-1011"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Fu, Siming","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.2215999960899353,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.2215999960899353,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10775","display_name":"Generative Adversarial Networks and Image Synthesis","score":0.20440000295639038,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.09740000218153,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/rectification","display_name":"Rectification","score":0.7232999801635742},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6535999774932861},{"id":"https://openalex.org/keywords/convergence","display_name":"Convergence (economics)","score":0.6449000239372253},{"id":"https://openalex.org/keywords/acceleration","display_name":"Acceleration","score":0.6119999885559082},{"id":"https://openalex.org/keywords/trajectory","display_name":"Trajectory","score":0.6046000123023987},{"id":"https://openalex.org/keywords/heuristic","display_name":"Heuristic","score":0.5874999761581421},{"id":"https://openalex.org/keywords/construct","display_name":"Construct (python library)","score":0.539900004863739},{"id":"https://openalex.org/keywords/field","display_name":"Field (mathematics)","score":0.46779999136924744},{"id":"https://openalex.org/keywords/flow","display_name":"Flow (mathematics)","score":0.4406000077724457},{"id":"https://openalex.org/keywords/trajectory-optimization","display_name":"Trajectory optimization","score":0.4058000147342682}],"concepts":[{"id":"https://openalex.org/C50942859","wikidata":"https://www.wikidata.org/wiki/Q4967193","display_name":"Rectification","level":3,"score":0.7232999801635742},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6535999774932861},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.6449000239372253},{"id":"https://openalex.org/C117896860","wikidata":"https://www.wikidata.org/wiki/Q11376","display_name":"Acceleration","level":2,"score":0.6119999885559082},{"id":"https://openalex.org/C13662910","wikidata":"https://www.wikidata.org/wiki/Q193139","display_name":"Trajectory","level":2,"score":0.6046000123023987},{"id":"https://openalex.org/C173801870","wikidata":"https://www.wikidata.org/wiki/Q201413","display_name":"Heuristic","level":2,"score":0.5874999761581421},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5449000000953674},{"id":"https://openalex.org/C2780801425","wikidata":"https://www.wikidata.org/wiki/Q5164392","display_name":"Construct (python library)","level":2,"score":0.539900004863739},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.5181999802589417},{"id":"https://openalex.org/C9652623","wikidata":"https://www.wikidata.org/wiki/Q190109","display_name":"Field (mathematics)","level":2,"score":0.46779999136924744},{"id":"https://openalex.org/C38349280","wikidata":"https://www.wikidata.org/wiki/Q1434290","display_name":"Flow (mathematics)","level":2,"score":0.4406000077724457},{"id":"https://openalex.org/C173246807","wikidata":"https://www.wikidata.org/wiki/Q7833062","display_name":"Trajectory optimization","level":3,"score":0.4058000147342682},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.4041999876499176},{"id":"https://openalex.org/C39890363","wikidata":"https://www.wikidata.org/wiki/Q36108","display_name":"Generative grammar","level":2,"score":0.39410001039505005},{"id":"https://openalex.org/C91188154","wikidata":"https://www.wikidata.org/wiki/Q186247","display_name":"Vector field","level":2,"score":0.3864000141620636},{"id":"https://openalex.org/C167966045","wikidata":"https://www.wikidata.org/wiki/Q5532625","display_name":"Generative model","level":3,"score":0.38510000705718994},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.36390000581741333},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.3467999994754791},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.3431999981403351},{"id":"https://openalex.org/C149672232","wikidata":"https://www.wikidata.org/wiki/Q337048","display_name":"Adaptive optimization","level":2,"score":0.3264000117778778},{"id":"https://openalex.org/C153258448","wikidata":"https://www.wikidata.org/wiki/Q1199743","display_name":"Gradient descent","level":3,"score":0.3264000117778778},{"id":"https://openalex.org/C198927703","wikidata":"https://www.wikidata.org/wiki/Q4373881","display_name":"Sequential quadratic programming","level":3,"score":0.3199000060558319},{"id":"https://openalex.org/C206688291","wikidata":"https://www.wikidata.org/wiki/Q7617819","display_name":"Stochastic gradient descent","level":3,"score":0.31279999017715454},{"id":"https://openalex.org/C55660270","wikidata":"https://www.wikidata.org/wiki/Q5164377","display_name":"Constrained optimization","level":2,"score":0.30329999327659607},{"id":"https://openalex.org/C137631369","wikidata":"https://www.wikidata.org/wiki/Q7617831","display_name":"Stochastic programming","level":2,"score":0.29580000042915344},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.289900004863739},{"id":"https://openalex.org/C194387892","wikidata":"https://www.wikidata.org/wiki/Q1747770","display_name":"Stochastic optimization","level":2,"score":0.28139999508857727},{"id":"https://openalex.org/C167879884","wikidata":"https://www.wikidata.org/wiki/Q727568","display_name":"Balanced flow","level":2,"score":0.2797999978065491},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.2761000096797943},{"id":"https://openalex.org/C108010975","wikidata":"https://www.wikidata.org/wiki/Q500094","display_name":"Pruning","level":2,"score":0.2757999897003174},{"id":"https://openalex.org/C37404715","wikidata":"https://www.wikidata.org/wiki/Q380679","display_name":"Dynamic programming","level":2,"score":0.2651999890804291},{"id":"https://openalex.org/C186394612","wikidata":"https://www.wikidata.org/wiki/Q7098942","display_name":"Optimal design","level":2,"score":0.2524000108242035}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.30376","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.30376","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.30376","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.30376","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Aligning":[0],"generative":[1,74],"flow":[2],"models":[3],"on":[4,23,118],"continuous":[5,73],"spaces":[6],"via":[7],"online":[8],"reinforcement":[9],"learning":[10],"is":[11],"constrained":[12],"by":[13],"intractable":[14],"trajectory":[15],"likelihoods.":[16],"Existing":[17],"density-approximated":[18],"policy":[19,75,90],"gradient":[20],"methods":[21],"rely":[22],"stochastic":[24],"SDE":[25],"samplers":[26],"to":[27,128],"construct":[28],"tractable":[29],"transition":[30],"kernels,":[31],"which":[32],"introduce":[33],"training-inference":[34],"inconsistencies":[35],"and":[36,112,149],"necessitates":[37],"Classifier-Free":[38],"Guidance":[39],"(CFG).":[40],"While":[41],"implicit":[42],"frameworks":[43],"such":[44],"as":[45,77],"DiffusionNFT":[46,133,148],"directly":[47],"optimize":[48],"forward-process":[49],"velocity":[50,84,100],"fields,":[51],"its":[52],"heuristic":[53],"fixed-magnitude":[54],"corrections":[55],"prevent":[56],"optimization":[57,76,111],"strength":[58],"from":[59,87],"relative":[60],"intra-group":[61],"quality.":[62],"We":[63],"propose":[64],"\\textit{Flow":[65],"Advantage-Weighted":[66],"Rectification}":[67],"(\\textbf{FlowAWR}),":[68],"a":[69,81,92,104,126,136],"paradigm":[70],"that":[71,102],"recasts":[72],"supervised":[78],"regression":[79],"toward":[80],"theoretically":[82],"optimal":[83,89,99],"field.":[85],"Starting":[86],"the":[88,98],"of":[91],"KL-constrained":[93],"reward":[94],"maximization,":[95],"FlowAWR":[96,120,159],"derives":[97],"field":[101],"admits":[103],"magnitude-aware,":[105],"advantage-weighted":[106],"rectification":[107],"form,":[108],"yielding":[109],"SDE-free":[110],"CFG-free":[113],"generation.":[114],"In":[115],"comparative":[116],"evaluations":[117],"SD3.5-Medium,":[119],"achieves":[121],"improved":[122],"alignment":[123],"performance":[124],"alongside":[125],"2$\\times$":[127],"5$\\times$":[129],"convergence":[130],"acceleration":[131],"over":[132],"(e.g.,":[134],"reaching":[135],"24.12":[137],"PickScore":[138],"in":[139,144,151],"1.2k":[140],"steps,":[141],"versus":[142],"23.82":[143],"2.0k":[145],"steps":[146,153],"for":[147,154],"23.50":[150],"$&gt;$4k":[152],"FlowGRPO).":[155],"Under":[156],"multi-reward":[157],"constraints,":[158],"sustains":[160],"generation":[161],"quality,":[162],"satisfying":[163],"structural":[164],"rules":[165],"while":[166],"maintaining":[167],"stable":[168],"out-of-domain":[169],"performance.":[170]},"counts_by_year":[],"updated_date":"2026-07-01T06:29:00.853634","created_date":"2026-07-01T00:00:00"}
