{"id":"https://openalex.org/W7161948006","doi":"https://doi.org/10.48550/arxiv.2605.20342","title":"ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning","display_name":"ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning","publication_year":2026,"publication_date":"2026-05-19","ids":{"openalex":"https://openalex.org/W7161948006","doi":"https://doi.org/10.48550/arxiv.2605.20342"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.20342","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.20342","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.20342","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5088457247","display_name":"Zuhao Yang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yang, Zuhao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136654661","display_name":"Kaichen Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Kaichen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136645041","display_name":"Sudong Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Sudong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136706851","display_name":"Keming Wu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wu, Keming","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5123533335","display_name":"Zhongyu Yang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yang, Zhongyu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136664993","display_name":"Bo Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Bo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136630792","display_name":"Xiaojuan Qi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Qi, Xiaojuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136672809","display_name":"Shijian Lu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lu, Shijian","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136627973","display_name":"Xingxuan Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Xingxuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5136662612","display_name":"Lidong Bing","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bing, Lidong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.5680000185966492,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.5680000185966492,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.08100000023841858,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.028599999845027924,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7430999875068665},{"id":"https://openalex.org/keywords/context","display_name":"Context (archaeology)","score":0.527899980545044},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.5257999897003174},{"id":"https://openalex.org/keywords/prior-probability","display_name":"Prior probability","score":0.5252000093460083},{"id":"https://openalex.org/keywords/probabilistic-logic","display_name":"Probabilistic logic","score":0.37220001220703125},{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.353300005197525},{"id":"https://openalex.org/keywords/baseline","display_name":"Baseline (sea)","score":0.3416000008583069},{"id":"https://openalex.org/keywords/fuzz-testing","display_name":"Fuzz testing","score":0.33629998564720154}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7552000284194946},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7430999875068665},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5565000176429749},{"id":"https://openalex.org/C2779343474","wikidata":"https://www.wikidata.org/wiki/Q3109175","display_name":"Context (archaeology)","level":2,"score":0.527899980545044},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.5257999897003174},{"id":"https://openalex.org/C177769412","wikidata":"https://www.wikidata.org/wiki/Q278090","display_name":"Prior probability","level":3,"score":0.5252000093460083},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4932999908924103},{"id":"https://openalex.org/C49937458","wikidata":"https://www.wikidata.org/wiki/Q2599292","display_name":"Probabilistic logic","level":2,"score":0.37220001220703125},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.353300005197525},{"id":"https://openalex.org/C12725497","wikidata":"https://www.wikidata.org/wiki/Q810247","display_name":"Baseline (sea)","level":2,"score":0.3416000008583069},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.3382999897003174},{"id":"https://openalex.org/C111065885","wikidata":"https://www.wikidata.org/wiki/Q1189053","display_name":"Fuzz testing","level":3,"score":0.33629998564720154},{"id":"https://openalex.org/C61797465","wikidata":"https://www.wikidata.org/wiki/Q1188986","display_name":"Term (time)","level":2,"score":0.3244999945163727},{"id":"https://openalex.org/C2776502983","wikidata":"https://www.wikidata.org/wiki/Q690182","display_name":"Contrast (vision)","level":2,"score":0.310699999332428},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.30239999294281006},{"id":"https://openalex.org/C22367795","wikidata":"https://www.wikidata.org/wiki/Q7625208","display_name":"Structured prediction","level":2,"score":0.29910001158714294},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.28369998931884766},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.2808000147342682},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.27730000019073486},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.27489998936653137},{"id":"https://openalex.org/C2780009758","wikidata":"https://www.wikidata.org/wiki/Q6804172","display_name":"Measure (data warehouse)","level":2,"score":0.2603999972343445},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.2563999891281128},{"id":"https://openalex.org/C2776650193","wikidata":"https://www.wikidata.org/wiki/Q264661","display_name":"Obstacle","level":2,"score":0.2563000023365021},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.25029999017715454}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.20342","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.20342","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.20342","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.20342","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Training":[0],"large":[1],"multimodal":[2],"models":[3],"(LMMs)":[4],"via":[5],"reinforcement":[6],"learning":[7],"(RL)":[8],"to":[9,21,93,188,235],"natively":[10],"invoke":[11],"video-processing":[12],"tools":[13],"(e.g.,":[14],"cropping)":[15],"has":[16],"become":[17,240],"a":[18,36,79,130,176,192,205,256],"promising":[19],"route":[20],"long-video":[22,214],"understanding.":[23],"However,":[24],"existing":[25],"native-RL":[26],"methods":[27],"dispatch":[28],"tool":[29,46,106,110,143,158,203,238],"calls":[30,47],"sequentially":[31],"(i.e.,":[32],"one":[33],"per":[34],"turn):":[35],"single":[37,80],"wrong":[38],"crop":[39],"propagates":[40],"errors":[41],"without":[42],"peer":[43],"correction,":[44],"multi-turn":[45],"corrupt":[48],"context,":[49],"and":[50,85,117,157,164,190,253,264],"inference":[51],"cost":[52],"scales":[53],"linearly":[54],"with":[55,171,227,249],"the":[56,63,100,104,119,150,183,202,220,250],"number":[57],"of":[58,153],"turns.":[59],"We":[60,160],"introduce":[61],"ParaVT,":[62],"first":[64],"multi-agent":[65],"end-to-end":[66],"RL-trained":[67],"framework":[68],"for":[69,82,259],"Parallel":[70],"Video":[71],"Tool":[72,101],"calling,":[73],"dispatching":[74],"multiple":[75],"time-window":[76],"crops":[77],"in":[78,243],"turn":[81],"cleaner":[83],"context":[84],"better":[86],"fault":[87],"tolerance.":[88],"Yet":[89],"applying":[90],"standard":[91,169],"RL":[92,140,170,246],"ParaVT":[94,217,254],"reveals":[95],"an":[96],"obstacle":[97],"we":[98],"term":[99],"Prior":[102],"Paradox:":[103],"pretrained":[105],"priors":[107],"that":[108,146,196],"enable":[109],"exploration":[111],"also":[112],"destabilize":[113],"cold-started":[114],"structural":[115],"format":[116,136,155,178,231],"expose":[118],"skip-tool":[120],"reward":[121,179,207],"shortcut":[122],"under":[123],"temperature":[124],"sampling.":[125],"A":[126],"cross-model":[127],"contrast":[128],"on":[129,225],"weaker-prior":[131],"LMM":[132],"supports":[133],"this":[134],"claim:":[135],"stays":[137],"stable":[138],"but":[139],"elicits":[141],"zero":[142],"calls,":[144],"indicating":[145],"prior":[147],"strength":[148],"is":[149],"shared":[151],"driver":[152],"both":[154],"collapse":[156],"exploration.":[159],"propose":[161],"PARA-GRPO":[162,228],"(Parseability-Anchored":[163],"Ratio-gAted":[165],"GRPO),":[166],"which":[167],"augments":[168],"two":[172],"complementary":[173],"mechanisms:":[174],"(i)":[175],"targeted":[177],"applied":[180],"only":[181],"at":[182],"structural-token":[184],"positions":[185],"most":[186],"prone":[187],"collapse,":[189],"(ii)":[191],"per-prompt":[193],"frame-budget":[194],"randomization":[195],"creates":[197],"training":[198],"prompts":[199],"where":[200],"calling":[201],"yields":[204],"measurable":[206],"signal":[208],"over":[209,219],"skipping":[210],"it.":[211],"Across":[212],"six":[213],"understanding":[215],"benchmarks,":[216],"improves":[218],"Qwen3-VL":[221],"baseline":[222],"by":[223],"+7.9%":[224],"average,":[226],"lifting":[229],"training-time":[230],"compliance":[232],"from":[233],"0.13":[234],"0.64.":[236],"As":[237],"capabilities":[239],"increasingly":[241],"internalized":[242],"modern":[244],"LMMs,":[245],"must":[247],"cooperate":[248],"resulting":[251],"priors,":[252],"offers":[255],"general":[257],"recipe":[258],"agentic":[260],"RL.":[261],"Code,":[262],"data,":[263],"model":[265],"weights":[266],"are":[267],"publicly":[268],"available.":[269]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-22T00:00:00"}
