{"id":"https://openalex.org/W7164941308","doi":"https://doi.org/10.48550/arxiv.2606.15099","title":"Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models","display_name":"Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models","publication_year":2026,"publication_date":"2026-06-13","ids":{"openalex":"https://openalex.org/W7164941308","doi":"https://doi.org/10.48550/arxiv.2606.15099"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.15099","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.15099","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.15099","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5120403673","display_name":"Dianqiao Lei","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lei, Dianqiao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5010380116","display_name":"Lianlei Shan","orcid":"https://orcid.org/0000-0002-4648-8246"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shan, Lianlei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.9754999876022339,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.9754999876022339,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.0032999999821186066,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.0017999999690800905,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/unobservable","display_name":"Unobservable","score":0.6973999738693237},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.6370999813079834},{"id":"https://openalex.org/keywords/latent-variable","display_name":"Latent variable","score":0.5730999708175659},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.448199987411499},{"id":"https://openalex.org/keywords/sequence","display_name":"Sequence (biology)","score":0.43540000915527344},{"id":"https://openalex.org/keywords/perception","display_name":"Perception","score":0.4165000021457672},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.3889000117778778},{"id":"https://openalex.org/keywords/embodied-cognition","display_name":"Embodied cognition","score":0.3700999915599823},{"id":"https://openalex.org/keywords/opportunistic-reasoning","display_name":"Opportunistic reasoning","score":0.3700999915599823}],"concepts":[{"id":"https://openalex.org/C2780695315","wikidata":"https://www.wikidata.org/wiki/Q3799040","display_name":"Unobservable","level":2,"score":0.6973999738693237},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.678600013256073},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.6370999813079834},{"id":"https://openalex.org/C51167844","wikidata":"https://www.wikidata.org/wiki/Q4422623","display_name":"Latent variable","level":2,"score":0.5730999708175659},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.536300003528595},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.448199987411499},{"id":"https://openalex.org/C2778112365","wikidata":"https://www.wikidata.org/wiki/Q3511065","display_name":"Sequence (biology)","level":2,"score":0.43540000915527344},{"id":"https://openalex.org/C26760741","wikidata":"https://www.wikidata.org/wiki/Q160402","display_name":"Perception","level":2,"score":0.4165000021457672},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.3889000117778778},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.37880000472068787},{"id":"https://openalex.org/C86827895","wikidata":"https://www.wikidata.org/wiki/Q7098582","display_name":"Opportunistic reasoning","level":4,"score":0.3700999915599823},{"id":"https://openalex.org/C100609095","wikidata":"https://www.wikidata.org/wiki/Q1335050","display_name":"Embodied cognition","level":2,"score":0.3700999915599823},{"id":"https://openalex.org/C65965080","wikidata":"https://www.wikidata.org/wiki/Q1806885","display_name":"Latent variable model","level":3,"score":0.35030001401901245},{"id":"https://openalex.org/C100776233","wikidata":"https://www.wikidata.org/wiki/Q2532492","display_name":"Bridge (graph theory)","level":2,"score":0.31130000948905945},{"id":"https://openalex.org/C68339613","wikidata":"https://www.wikidata.org/wiki/Q1549489","display_name":"Speedup","level":2,"score":0.3086000084877014},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.30570000410079956},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.30309998989105225},{"id":"https://openalex.org/C137002209","wikidata":"https://www.wikidata.org/wiki/Q898521","display_name":"Hidden variable theory","level":3,"score":0.30239999294281006},{"id":"https://openalex.org/C49937458","wikidata":"https://www.wikidata.org/wiki/Q2599292","display_name":"Probabilistic logic","level":2,"score":0.28760001063346863},{"id":"https://openalex.org/C182365436","wikidata":"https://www.wikidata.org/wiki/Q50701","display_name":"Variable (mathematics)","level":2,"score":0.272599995136261},{"id":"https://openalex.org/C160234255","wikidata":"https://www.wikidata.org/wiki/Q812535","display_name":"Bayesian inference","level":3,"score":0.2662999927997589},{"id":"https://openalex.org/C89288958","wikidata":"https://www.wikidata.org/wiki/Q7301504","display_name":"Reasoning system","level":2,"score":0.2635999917984009},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.26350000500679016},{"id":"https://openalex.org/C139807058","wikidata":"https://www.wikidata.org/wiki/Q352374","display_name":"Adaptation (eye)","level":2,"score":0.2531999945640564},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.2526000142097473}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.15099","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.15099","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.15099","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.15099","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/16","score":0.702261745929718,"display_name":"Peace, Justice and strong institutions"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Existing":[0],"Vision-Language-Action":[1],"(VLA)":[2],"models":[3,48],"predominantly":[4],"rely":[5],"on":[6,115,128,151],"explicit":[7,61,141],"Chain-of-Thought":[8],"(CoT)":[9],"reasoning":[10,49,99,113],"to":[11,70],"bridge":[12],"perception":[13],"and":[14,25,73,124,156],"action.":[15],"While":[16],"effective,":[17],"this":[18,32],"paradigm":[19],"suffers":[20],"from":[21],"high":[22],"computational":[23],"costs":[24],"error":[26],"propagation":[27],"in":[28],"multi-step":[29],"tasks.":[30],"In":[31],"paper,":[33],"we":[34,81,105],"propose":[35],"Adaptive":[36],"Variable":[37],"Alignment":[38],"VLA":[39,45],"(AVA-VLA),":[40],"a":[41,51,83,94,119,136,146],"novel":[42],"Latent":[43],"Reasoning":[44],"framework":[46],"that":[47,88,110,133],"as":[50,93],"sequence":[52],"of":[53],"unobservable":[54],"latent":[55,65,90],"variables,":[56],"bypassing":[57],"the":[58],"need":[59],"for":[60],"text":[62],"generation.":[63],"However,":[64],"trajectories":[66,100],"are":[67],"inherently":[68],"susceptible":[69],"noise":[71],"interference":[72],"misalignment":[74],"with":[75],"downstream":[76],"objectives.":[77],"To":[78],"address":[79],"this,":[80],"introduce":[82],"Reinforcement":[84],"Learning-based":[85],"Denoising":[86],"mechanism":[87],"treats":[89],"state":[91,116],"generation":[92],"sequential":[95],"decision":[96,130],"process,":[97],"optimizing":[98],"via":[101],"task-level":[102],"rewards.":[103],"Furthermore,":[104],"incorporate":[106],"an":[107],"Early-Exit":[108],"Strategy":[109],"adaptively":[111],"terminates":[112],"based":[114],"confidence,":[117],"enabling":[118],"dynamic":[120],"trade-off":[121],"between":[122],"depth":[123],"efficiency.":[125],"Extensive":[126],"experiments":[127],"embodied":[129],"benchmarks":[131],"demonstrate":[132],"AVA-VLA":[134],"achieves":[135],"6x":[137],"inference":[138],"speedup":[139],"over":[140,159],"CoT":[142],"methods":[143],"while":[144],"attaining":[145],"98.3%":[147],"average":[148],"success":[149],"rate":[150],"LIBERO,":[152],"improving":[153],"both":[154],"efficiency":[155],"long-horizon":[157],"stability":[158],"full-reasoning":[160],"baselines.":[161]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-17T00:00:00"}
