{"id":"https://openalex.org/W7154603726","doi":"https://doi.org/10.48550/arxiv.2604.13733","title":"Vision-Language-Action Jump-Starting for Reinforcement Learning Robotic Agents","display_name":"Vision-Language-Action Jump-Starting for Reinforcement Learning Robotic Agents","publication_year":2026,"publication_date":"2026-04-15","ids":{"openalex":"https://openalex.org/W7154603726","doi":"https://doi.org/10.48550/arxiv.2604.13733"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.13733","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.13733","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.13733","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5107202253","display_name":"Angelo Moroncelli","orcid":"https://orcid.org/0009-0002-2100-5225"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Moroncelli, Angelo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5133757495","display_name":"Roberto Zanetti","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zanetti, Roberto","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5020694448","display_name":"Marco Maccarini","orcid":"https://orcid.org/0000-0002-9081-7377"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Maccarini, Marco","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5086291668","display_name":"Loris Roveda","orcid":"https://orcid.org/0000-0002-4427-536X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Roveda, Loris","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7379999756813049,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7379999756813049,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.1981000006198883,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.02419999986886978,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/leverage","display_name":"Leverage (statistics)","score":0.8133000135421753},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.807200014591217},{"id":"https://openalex.org/keywords/regularization","display_name":"Regularization (linguistics)","score":0.59579998254776},{"id":"https://openalex.org/keywords/transfer-of-learning","display_name":"Transfer of learning","score":0.38989999890327454},{"id":"https://openalex.org/keywords/imperfect","display_name":"Imperfect","score":0.38029998540878296},{"id":"https://openalex.org/keywords/scaling","display_name":"Scaling","score":0.3544999957084656},{"id":"https://openalex.org/keywords/automation","display_name":"Automation","score":0.30720001459121704}],"concepts":[{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.8133000135421753},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.807200014591217},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7279999852180481},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5971999764442444},{"id":"https://openalex.org/C2776135515","wikidata":"https://www.wikidata.org/wiki/Q17143721","display_name":"Regularization (linguistics)","level":2,"score":0.59579998254776},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.47859999537467957},{"id":"https://openalex.org/C150899416","wikidata":"https://www.wikidata.org/wiki/Q1820378","display_name":"Transfer of learning","level":2,"score":0.38989999890327454},{"id":"https://openalex.org/C2780310539","wikidata":"https://www.wikidata.org/wiki/Q12547192","display_name":"Imperfect","level":2,"score":0.38029998540878296},{"id":"https://openalex.org/C99844830","wikidata":"https://www.wikidata.org/wiki/Q102441924","display_name":"Scaling","level":2,"score":0.3544999957084656},{"id":"https://openalex.org/C115901376","wikidata":"https://www.wikidata.org/wiki/Q184199","display_name":"Automation","level":2,"score":0.30720001459121704},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2996000051498413},{"id":"https://openalex.org/C147764199","wikidata":"https://www.wikidata.org/wiki/Q6865248","display_name":"Minification","level":2,"score":0.2766999900341034},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.27639999985694885},{"id":"https://openalex.org/C34413123","wikidata":"https://www.wikidata.org/wiki/Q170978","display_name":"Robotics","level":3,"score":0.26980000734329224},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.25940001010894775},{"id":"https://openalex.org/C2781238097","wikidata":"https://www.wikidata.org/wiki/Q175026","display_name":"Object (grammar)","level":2,"score":0.2533000111579895}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.13733","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.13733","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.13733","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.13733","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1,76],"(RL)":[2],"enables":[3],"high-frequency,":[4,99],"closed-loop":[5],"control":[6,101],"for":[7],"robotic":[8],"manipulation,":[9],"but":[10,42],"scaling":[11],"to":[12,23,37,72,153],"long-horizon":[13],"tasks":[14],"with":[15,69,111,123],"sparse":[16,66],"or":[17,135],"imperfect":[18],"rewards":[19],"remains":[20],"difficult":[21],"due":[22],"inefficient":[24],"exploration":[25,74,91],"and":[26,51,75,92,146,156,177,181,195,217,224],"poor":[27],"credit":[28,94],"assignment.":[29],"Vision-Language-Action":[30,59],"(VLA)":[31],"models":[32],"leverage":[33],"large-scale":[34],"multimodal":[35],"pretraining":[36],"provide":[38],"generalist,":[39],"task-level":[40],"reasoning,":[41],"current":[43],"limitations":[44],"hinder":[45],"their":[46],"direct":[47],"use":[48],"in":[49,179,198,208],"fast":[50],"precise":[52],"manipulation.":[53],"In":[54],"this":[55],"paper,":[56],"we":[57],"propose":[58],"Jump-Starting":[60],"(VLAJS),":[61],"a":[62,112,183,186],"method":[63],"that":[64,88,116],"bridges":[65],"VLA":[67,124,141],"guidance":[68,125,142],"on-policy":[70],"RL":[71,120],"improve":[73,93],"efficiency.":[77],"VLAJS":[78,164,191],"treats":[79],"VLAs":[80],"as":[81],"transient":[82],"sources":[83],"of":[84,102],"high-level":[85],"action":[86],"suggestions":[87],"bias":[89],"early":[90,127],"assignment,":[95],"while":[96],"preserving":[97],"the":[98,119,151,159],"state-based":[100],"RL.":[103],"Our":[104],"approach":[105],"augments":[106],"Proximal":[107],"Policy":[108],"Optimization":[109],"(PPO)":[110],"directional":[113],"action-consistency":[114],"regularization":[115],"softly":[117],"aligns":[118],"agent's":[121],"actions":[122],"during":[126],"training,":[128],"without":[129],"enforcing":[130],"strict":[131],"imitation,":[132],"requiring":[133],"demonstrations,":[134],"relying":[136],"on":[137,165,185],"continuous":[138],"teacher":[139],"queries.":[140],"is":[143],"applied":[144],"sparsely":[145],"annealed":[147],"over":[148,206],"time,":[149],"allowing":[150],"agent":[152],"adapt":[154],"online":[155],"ultimately":[157],"surpass":[158],"guiding":[160],"policy.":[161],"We":[162],"evaluate":[163],"six":[166],"challenging":[167],"manipulation":[168],"tasks:":[169],"lifting,":[170],"pick-and-place,":[171],"peg":[172,174],"reorientation,":[173],"insertion,":[175],"poking,":[176],"pushing":[178],"simulation,":[180],"validate":[182],"subset":[184],"real":[187],"Franka":[188],"Panda":[189],"robot.":[190],"consistently":[192],"outperforms":[193],"PPO":[194],"distillation-style":[196],"baselines":[197],"sample":[199],"efficiency,":[200],"reducing":[201],"required":[202],"environment":[203],"interactions":[204],"by":[205],"50%":[207],"several":[209],"tasks.":[210],"Real-world":[211],"experiments":[212],"demonstrate":[213],"zero-shot":[214],"sim-to-real":[215],"transfer":[216],"robust":[218],"execution":[219],"under":[220],"clutter,":[221],"object":[222],"variation,":[223],"external":[225],"perturbations.":[226]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-04-17T00:00:00"}
