{"id":"https://openalex.org/W7136792976","doi":"https://doi.org/10.48550/arxiv.2603.12868","title":"Beyond Imitation: Reinforcement Learning Fine-Tuning for Adaptive Diffusion Navigation Policies","display_name":"Beyond Imitation: Reinforcement Learning Fine-Tuning for Adaptive Diffusion Navigation Policies","publication_year":2026,"publication_date":"2026-03-13","ids":{"openalex":"https://openalex.org/W7136792976","doi":"https://doi.org/10.48550/arxiv.2603.12868"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.12868","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.12868","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.12868","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5129449738","display_name":"Junhe Sheng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sheng, Junhe","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5041116745","display_name":"Ruofei Bai","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bai, Ruofei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5129507167","display_name":"Kuan Xu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xu, Kuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128116046","display_name":"Ruimeng Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Ruimeng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5129410359","display_name":"Jie Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Jie","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5129468090","display_name":"Shenghai Yuan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yuan, Shenghai","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5057104857","display_name":"Wei\u2010Yun Yau","orcid":"https://orcid.org/0000-0001-5709-9169"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yau, Wei-Yun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5129617468","display_name":"Lihua Xie","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xie, Lihua","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.4174000024795532,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.4174000024795532,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.13729999959468842,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10586","display_name":"Robotic Path Planning Algorithms","score":0.12129999697208405,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8579000234603882},{"id":"https://openalex.org/keywords/trajectory","display_name":"Trajectory","score":0.5945000052452087},{"id":"https://openalex.org/keywords/generalization","display_name":"Generalization","score":0.5728999972343445},{"id":"https://openalex.org/keywords/encoder","display_name":"Encoder","score":0.5260999798774719},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.5027999877929688},{"id":"https://openalex.org/keywords/pipeline","display_name":"Pipeline (software)","score":0.49480000138282776},{"id":"https://openalex.org/keywords/robot","display_name":"Robot","score":0.40869998931884766},{"id":"https://openalex.org/keywords/adaptability","display_name":"Adaptability","score":0.39809998869895935},{"id":"https://openalex.org/keywords/advanced-driver-assistance-systems","display_name":"Advanced driver assistance systems","score":0.3937999904155731},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.3698999881744385}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8579000234603882},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7358999848365784},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.597000002861023},{"id":"https://openalex.org/C13662910","wikidata":"https://www.wikidata.org/wiki/Q193139","display_name":"Trajectory","level":2,"score":0.5945000052452087},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.5728999972343445},{"id":"https://openalex.org/C118505674","wikidata":"https://www.wikidata.org/wiki/Q42586063","display_name":"Encoder","level":2,"score":0.5260999798774719},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.5027999877929688},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.49480000138282776},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4374000132083893},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.40869998931884766},{"id":"https://openalex.org/C177606310","wikidata":"https://www.wikidata.org/wiki/Q5674297","display_name":"Adaptability","level":2,"score":0.39809998869895935},{"id":"https://openalex.org/C87833898","wikidata":"https://www.wikidata.org/wiki/Q1060280","display_name":"Advanced driver assistance systems","level":2,"score":0.3937999904155731},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.3698999881744385},{"id":"https://openalex.org/C126388530","wikidata":"https://www.wikidata.org/wiki/Q1131737","display_name":"Imitation","level":2,"score":0.3555999994277954},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.3231000006198883},{"id":"https://openalex.org/C2776291640","wikidata":"https://www.wikidata.org/wiki/Q2912517","display_name":"Value (mathematics)","level":2,"score":0.31709998846054077},{"id":"https://openalex.org/C140779682","wikidata":"https://www.wikidata.org/wiki/Q210868","display_name":"Sampling (signal processing)","level":3,"score":0.30390000343322754},{"id":"https://openalex.org/C164660894","wikidata":"https://www.wikidata.org/wiki/Q2037833","display_name":"Piecewise","level":2,"score":0.3027999997138977},{"id":"https://openalex.org/C12713177","wikidata":"https://www.wikidata.org/wiki/Q1900281","display_name":"Perspective (graphical)","level":2,"score":0.2973000109195709},{"id":"https://openalex.org/C111335779","wikidata":"https://www.wikidata.org/wiki/Q3454686","display_name":"Reduction (mathematics)","level":2,"score":0.29649999737739563},{"id":"https://openalex.org/C52740198","wikidata":"https://www.wikidata.org/wiki/Q1539564","display_name":"Importance sampling","level":3,"score":0.29510000348091125},{"id":"https://openalex.org/C2778067643","wikidata":"https://www.wikidata.org/wiki/Q166507","display_name":"Interval (graph theory)","level":2,"score":0.2939000129699707},{"id":"https://openalex.org/C89249532","wikidata":"https://www.wikidata.org/wiki/Q7912758","display_name":"Value network","level":3,"score":0.27649998664855957},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.27320000529289246},{"id":"https://openalex.org/C207390915","wikidata":"https://www.wikidata.org/wiki/Q1230525","display_name":"Divergence (linguistics)","level":2,"score":0.2721000015735626},{"id":"https://openalex.org/C117619785","wikidata":"https://www.wikidata.org/wiki/Q6094414","display_name":"Iterative learning control","level":3,"score":0.27059999108314514},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.26829999685287476},{"id":"https://openalex.org/C61797465","wikidata":"https://www.wikidata.org/wiki/Q1188986","display_name":"Term (time)","level":2,"score":0.26739999651908875},{"id":"https://openalex.org/C44154836","wikidata":"https://www.wikidata.org/wiki/Q45045","display_name":"Simulation","level":1,"score":0.2621000111103058},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.2581999897956848},{"id":"https://openalex.org/C14646407","wikidata":"https://www.wikidata.org/wiki/Q1430750","display_name":"Bellman equation","level":2,"score":0.25540000200271606},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.2535000145435333},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.25200000405311584}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.12868","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.12868","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.12868","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.12868","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Diffusion-based":[0],"robot":[1],"navigation":[2],"policies":[3,60],"trained":[4],"on":[5,188],"large-scale":[6],"imitation":[7],"learning":[8,63,98],"datasets,":[9,40],"can":[10],"generate":[11],"multi-modal":[12],"trajectories":[13,129],"directly":[14],"from":[15,178,184],"the":[16,21,36,78,108,145,151,166,175,199],"robot's":[17],"visual":[18,146],"observations,":[19],"bypassing":[20],"traditional":[22],"localization-mapping-planning":[23],"pipeline":[24],"and":[25,41,55,87,116,148,155,182,209,220],"achieving":[26],"strong":[27],"zero-shot":[28,203],"generalization.":[29],"However,":[30],"their":[31,67],"performance":[32,212],"remains":[33],"constrained":[34],"by":[35],"coverage":[37],"of":[38,80,113],"offline":[39],"when":[42],"deployed":[43],"in":[44,169,213],"unseen":[45,189],"settings,":[46],"distribution":[47],"shift":[48],"often":[49],"leads":[50],"to":[51,180,186,204,223],"accumulated":[52],"trajectory":[53],"errors":[54],"safety-critical":[56],"failures.":[57],"Adapting":[58],"diffusion":[59,114],"with":[61],"reinforcement":[62,97],"is":[64],"challenging":[65],"because":[66],"iterative":[68],"denoising":[69],"structure":[70],"hinders":[71],"effective":[72],"gradient":[73],"backpropagation,":[74],"while":[75,140,191],"also":[76],"making":[77],"training":[79],"an":[81],"additional":[82],"value":[83,134],"network":[84],"computationally":[85],"expensive":[86],"less":[88],"stable.":[89],"To":[90,136],"address":[91],"these":[92],"issues,":[93],"we":[94,143],"propose":[95],"a":[96,132,205],"fine-tuning":[99],"framework":[100],"tailored":[101],"for":[102],"diffusion-based":[103],"navigation.":[104],"The":[105],"method":[106],"leverages":[107],"inherent":[109],"multi-trajectory":[110],"sampling":[111],"mechanism":[112],"models":[115],"adopts":[117],"Group":[118],"Relative":[119],"Policy":[120],"Optimization":[121],"(GRPO),":[122],"which":[123],"estimates":[124],"relative":[125],"advantages":[126],"across":[127],"sampled":[128],"without":[130],"requiring":[131],"separate":[133],"network.":[135],"preserve":[137],"pretrained":[138],"representations":[139],"enabling":[141],"adaptation,":[142],"freeze":[144],"encoder":[147],"selectively":[149],"update":[150],"higher":[152],"decoder":[153],"layers":[154],"action":[156],"head,":[157],"enhancing":[158],"safety-aware":[159],"behaviors":[160],"through":[161],"online":[162],"environmental":[163],"feedback.":[164],"On":[165],"PointGoal":[167],"task":[168],"Isaac":[170],"Sim,":[171],"our":[172],"approach":[173],"improves":[174],"Success":[176],"Rate":[177],"52.0%":[179],"58.7%":[181],"SPL":[183],"0.49":[185],"0.54":[187],"scenes,":[190],"reducing":[192],"collision":[193],"frequency.":[194],"Additional":[195],"experiments":[196],"show":[197],"that":[198],"fine-tuned":[200],"policy":[201],"transfers":[202],"real":[206],"quadruped":[207],"platform":[208],"maintains":[210],"stable":[211],"geometrically":[214],"out-of-distribution":[215],"environments,":[216],"suggesting":[217],"improved":[218],"adaptability":[219],"safe":[221],"generalization":[222],"new":[224],"domains.":[225]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-03-17T00:00:00"}
