{"id":"https://openalex.org/W7165398370","doi":"https://doi.org/10.48550/arxiv.2606.19927","title":"CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs","display_name":"CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs","publication_year":2026,"publication_date":"2026-06-18","ids":{"openalex":"https://openalex.org/W7165398370","doi":"https://doi.org/10.48550/arxiv.2606.19927"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.19927","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.19927","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.19927","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5122947500","display_name":"Chengwen Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Chengwen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138993451","display_name":"Hao Peng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Peng, Hao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139007429","display_name":"Jisheng Dang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Dang, Jisheng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138985608","display_name":"Hong Peng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Peng, Hong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139023236","display_name":"Bin Hu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Hu, Bin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5138976573","display_name":"Tat-Seng Chua","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chua, Tat-Seng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.4307999908924103,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.4307999908924103,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.21979999542236328,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10812","display_name":"Human Pose and Action Recognition","score":0.13040000200271606,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.5131000280380249},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.4578999876976013},{"id":"https://openalex.org/keywords/decoding-methods","display_name":"Decoding methods","score":0.4207000136375427},{"id":"https://openalex.org/keywords/security-token","display_name":"Security token","score":0.40450000762939453},{"id":"https://openalex.org/keywords/adaptive-reasoning","display_name":"Adaptive reasoning","score":0.3671000003814697},{"id":"https://openalex.org/keywords/pipeline","display_name":"Pipeline (software)","score":0.361299991607666},{"id":"https://openalex.org/keywords/adaptive-system","display_name":"Adaptive system","score":0.3253999948501587},{"id":"https://openalex.org/keywords/task-analysis","display_name":"Task analysis","score":0.31869998574256897}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7300999760627747},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5479000210762024},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.5131000280380249},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.4578999876976013},{"id":"https://openalex.org/C57273362","wikidata":"https://www.wikidata.org/wiki/Q576722","display_name":"Decoding methods","level":2,"score":0.4207000136375427},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.41429999470710754},{"id":"https://openalex.org/C48145219","wikidata":"https://www.wikidata.org/wiki/Q1335365","display_name":"Security token","level":2,"score":0.40450000762939453},{"id":"https://openalex.org/C107848011","wikidata":"https://www.wikidata.org/wiki/Q4680756","display_name":"Adaptive reasoning","level":4,"score":0.3671000003814697},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.361299991607666},{"id":"https://openalex.org/C52970973","wikidata":"https://www.wikidata.org/wiki/Q2497134","display_name":"Adaptive system","level":2,"score":0.3253999948501587},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.31869998574256897},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.31119999289512634},{"id":"https://openalex.org/C89288958","wikidata":"https://www.wikidata.org/wiki/Q7301504","display_name":"Reasoning system","level":2,"score":0.2913999855518341},{"id":"https://openalex.org/C68784500","wikidata":"https://www.wikidata.org/wiki/Q1570691","display_name":"Adaptive behavior","level":2,"score":0.28610000014305115},{"id":"https://openalex.org/C179518139","wikidata":"https://www.wikidata.org/wiki/Q5140297","display_name":"Coding (social sciences)","level":2,"score":0.28130000829696655},{"id":"https://openalex.org/C100521375","wikidata":"https://www.wikidata.org/wiki/Q2015382","display_name":"Competence (human resources)","level":2,"score":0.2786000072956085},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.27459999918937683},{"id":"https://openalex.org/C13662910","wikidata":"https://www.wikidata.org/wiki/Q193139","display_name":"Trajectory","level":2,"score":0.2727000117301941},{"id":"https://openalex.org/C153258448","wikidata":"https://www.wikidata.org/wiki/Q1199743","display_name":"Gradient descent","level":3,"score":0.2709999978542328},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.2702000141143799},{"id":"https://openalex.org/C43126263","wikidata":"https://www.wikidata.org/wiki/Q128751","display_name":"Source code","level":2,"score":0.26899999380111694},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.25999999046325684},{"id":"https://openalex.org/C115086926","wikidata":"https://www.wikidata.org/wiki/Q17004651","display_name":"Causal reasoning","level":3,"score":0.25060001015663147},{"id":"https://openalex.org/C107464732","wikidata":"https://www.wikidata.org/wiki/Q235781","display_name":"Adaptive control","level":3,"score":0.25049999356269836}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.19927","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.19927","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.19927","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.19927","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"In":[0,47],"multimodal":[1,64],"video":[2,157,161],"reasoning,":[3],"reinforcement":[4,172],"learning-based":[5],"methods":[6],"typically":[7],"rely":[8],"on":[9,132,155],"simplistic":[10],"and":[11,38,81,119,147,159,174,191,218],"inflexible":[12],"reasoning-length":[13],"control":[14],"strategies":[15],"that":[16,90,165],"fail":[17],"to":[18,20,84,99,124],"adapt":[19],"the":[21,42,92,143,210],"model's":[22],"evolving":[23],"competence.":[24],"This":[25],"mismatch":[26],"may":[27],"suppress":[28],"necessary":[29],"exploration":[30],"at":[31,199,220],"early":[32],"stages,":[33],"while":[34],"encouraging":[35],"redundant":[36],"reasoning":[37,60,98,114,158,169,187,197,206],"inefficient":[39],"decoding":[40],"once":[41],"model":[43],"becomes":[44],"more":[45,195],"competent.":[46],"this":[48],"paper,":[49],"we":[50],"propose":[51],"CARE,":[52],"a":[53,69,121,182],"competence-aware":[54],"reward":[55,93,126],"shaping":[56],"framework":[57,217],"for":[58,128,213],"adaptive":[59,203],"length":[61,188],"optimization":[62],"in":[63],"reasoning.":[65,102],"Specifically,":[66],"CARE":[67,111,166,180,216],"maintains":[68],"smoothed":[70],"competence":[71],"estimate":[72],"via":[73],"an":[74],"exponential":[75],"moving":[76],"average":[77],"of":[78,186,205],"pass":[79],"rates,":[80],"uses":[82],"it":[83],"route":[85],"training":[86,145],"into":[87,142],"progressive":[88],"stages":[89],"shift":[91],"preference":[94],"from":[95],"exploration-oriented":[96],"long-form":[97],"efficiency-oriented":[100],"concise":[101],"To":[103],"avoid":[104],"conflating":[105],"verbosity":[106],"with":[107,116],"intrinsic":[108],"task":[109],"complexity,":[110],"further":[112],"normalizes":[113],"effort":[115],"batch-level":[117],"statistics,":[118],"introduces":[120],"posterior":[122],"amplifier":[123],"strengthen":[125],"signals":[127],"unexpectedly":[129],"strong":[130],"performance":[131],"historically":[133],"difficult":[134],"samples.":[135],"The":[136],"proposed":[137,215],"mechanism":[138],"is":[139],"seamlessly":[140],"integrated":[141],"GRPO":[144],"pipeline":[146],"incurs":[148],"no":[149],"additional":[150],"inference-time":[151],"overhead.":[152],"Extensive":[153],"experiments":[154,219],"multiple":[156],"general":[160],"understanding":[162],"benchmarks":[163],"demonstrate":[164],"consistently":[167],"improves":[168],"accuracy,":[170],"stabilizes":[171],"learning,":[173],"significantly":[175],"enhances":[176],"token":[177],"efficiency.":[178],"Moreover,":[179],"exhibits":[181],"characteristic":[183],"inverted-U":[184],"trajectory":[185],"during":[189],"training,":[190],"yields":[192],"shorter":[193],"yet":[194],"informative":[196],"traces":[198],"convergence,":[200],"indicating":[201],"effective":[202],"allocation":[204],"budget.":[207],"We":[208],"provide":[209],"source":[211],"code":[212],"our":[214],"https://github.com/1Pansy/Video-CARE.":[221]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-20T00:00:00"}
