{"id":"https://openalex.org/W7165199735","doi":"https://doi.org/10.48550/arxiv.2606.18441","title":"Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs","display_name":"Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs","publication_year":2026,"publication_date":"2026-06-16","ids":{"openalex":"https://openalex.org/W7165199735","doi":"https://doi.org/10.48550/arxiv.2606.18441"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.18441","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.18441","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.18441","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5122947500","display_name":"Chengwen Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Chengwen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5011086655","display_name":"Z Zhangqin Huang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Huang, Zhe","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138922523","display_name":"Jisheng Dang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Dang, Jisheng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138892270","display_name":"Hong Peng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Peng, Hong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138950027","display_name":"Qi Tian","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tian, Qi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5138873434","display_name":"Tat-Seng Chua","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chua, Tat-Seng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.9544000029563904,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.9544000029563904,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.01850000023841858,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10775","display_name":"Generative Adversarial Networks and Image Synthesis","score":0.0038999998942017555,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/salience","display_name":"Salience (neuroscience)","score":0.7124000191688538},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5097000002861023},{"id":"https://openalex.org/keywords/frame","display_name":"Frame (networking)","score":0.486299991607666},{"id":"https://openalex.org/keywords/perception","display_name":"Perception","score":0.47429999709129333},{"id":"https://openalex.org/keywords/focus","display_name":"Focus (optics)","score":0.4320000112056732},{"id":"https://openalex.org/keywords/visual-perception","display_name":"Visual perception","score":0.3873000144958496},{"id":"https://openalex.org/keywords/visualization","display_name":"Visualization","score":0.33340001106262207}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7412999868392944},{"id":"https://openalex.org/C108154423","wikidata":"https://www.wikidata.org/wiki/Q1469792","display_name":"Salience (neuroscience)","level":2,"score":0.7124000191688538},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5932000279426575},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5097000002861023},{"id":"https://openalex.org/C126042441","wikidata":"https://www.wikidata.org/wiki/Q1324888","display_name":"Frame (networking)","level":2,"score":0.486299991607666},{"id":"https://openalex.org/C26760741","wikidata":"https://www.wikidata.org/wiki/Q160402","display_name":"Perception","level":2,"score":0.47429999709129333},{"id":"https://openalex.org/C192209626","wikidata":"https://www.wikidata.org/wiki/Q190909","display_name":"Focus (optics)","level":2,"score":0.4320000112056732},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4113999903202057},{"id":"https://openalex.org/C178253425","wikidata":"https://www.wikidata.org/wiki/Q162668","display_name":"Visual perception","level":3,"score":0.3873000144958496},{"id":"https://openalex.org/C36464697","wikidata":"https://www.wikidata.org/wiki/Q451553","display_name":"Visualization","level":2,"score":0.33340001106262207},{"id":"https://openalex.org/C2779321571","wikidata":"https://www.wikidata.org/wiki/Q7936605","display_name":"Visual learning","level":2,"score":0.314300000667572},{"id":"https://openalex.org/C56461940","wikidata":"https://www.wikidata.org/wiki/Q970687","display_name":"Eye tracking","level":2,"score":0.30000001192092896},{"id":"https://openalex.org/C111370547","wikidata":"https://www.wikidata.org/wiki/Q7451120","display_name":"Sensory cue","level":2,"score":0.2955999970436096},{"id":"https://openalex.org/C2777508537","wikidata":"https://www.wikidata.org/wiki/Q7936620","display_name":"Visual reasoning","level":2,"score":0.28929999470710754},{"id":"https://openalex.org/C5065155","wikidata":"https://www.wikidata.org/wiki/Q1185775","display_name":"Frame problem","level":2,"score":0.27059999108314514},{"id":"https://openalex.org/C2780103172","wikidata":"https://www.wikidata.org/wiki/Q1309721","display_name":"Visual Objects","level":3,"score":0.26179999113082886},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.26010000705718994},{"id":"https://openalex.org/C2986089797","wikidata":"https://www.wikidata.org/wiki/Q6501338","display_name":"Visual attention","level":3,"score":0.2547999918460846},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.25440001487731934}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.18441","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.18441","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.18441","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.18441","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1],"has":[2],"improved":[3],"the":[4,31,42,100,146,154],"reasoning":[5,133],"ability":[6],"of":[7,46,153],"large":[8,18],"language":[9,19],"models,":[10],"but":[11],"applying":[12],"outcome-only":[13],"rewards":[14],"to":[15],"video":[16,62,72,132],"multimodal":[17],"models":[20],"(Video-MLLMs)":[21],"provides":[22,113,149],"limited":[23],"guidance":[24],"on":[25],"which":[26],"visual":[27,81,91],"evidence":[28,155],"should":[29],"support":[30],"answer.":[32],"Inspired":[33],"by":[34],"multisensory":[35],"integration,":[36],"where":[37],"consistent":[38],"cues":[39],"can":[40],"enhance":[41],"salience":[43],"and":[44,79,92,95,109,135,142],"reliability":[45],"perceptual":[47],"estimates,":[48],"we":[49],"introduce":[50],"Consensus":[51,101],"Frame":[52,102],"GRPO":[53],"(CF-GRPO),":[54],"a":[55,66,86,114],"temporal-annotation-free":[56],"process-level":[57],"reward":[58,116],"framework":[59],"for":[60],"evidence-aware":[61],"reasoning.":[63],"CF-GRPO":[64],"constructs":[65],"consensus":[67,147],"frame":[68],"prior":[69,148],"from":[70,90],"intrinsic":[71],"cues,":[73,78],"including":[74],"temporal":[75,121],"coverage,":[76],"scene-transition":[77],"query-conditioned":[80],"relevance.":[82],"It":[83],"then":[84],"computes":[85],"model-side":[87],"frame-use":[88],"score":[89],"response":[93],"representations":[94],"optimizes":[96],"their":[97],"agreement":[98],"through":[99],"Reward":[103],"(CFR).":[104],"With":[105],"salience-aware":[106],"sparse":[107],"aggregation":[108],"distribution":[110],"sharpening,":[111],"CFR":[112],"high-contrast":[115],"signal":[117],"without":[118],"requiring":[119],"human":[120],"annotations.":[122],"Experiments":[123],"show":[124],"that":[125],"VideoCFR":[126],"achieves":[127],"competitive":[128],"performance":[129],"across":[130],"complex":[131],"benchmarks":[134],"improves":[136],"several":[137],"metrics":[138],"over":[139],"representative":[140],"Video-MLLM":[141],"RL":[143],"baselines,":[144],"while":[145],"an":[150],"interpretable":[151],"view":[152],"frames":[156],"emphasized":[157],"during":[158],"training.":[159],"The":[160],"implementation":[161],"is":[162],"available":[163],"at":[164],"https://github.com/1Pansy/VideoCFR.":[165]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-19T00:00:00"}
