{"id":"https://openalex.org/W7136694066","doi":"https://doi.org/10.48550/arxiv.2603.13119","title":"Geometry-Guided Camera Motion Understanding in VideoLLMs","display_name":"Geometry-Guided Camera Motion Understanding in VideoLLMs","publication_year":2026,"publication_date":"2026-03-13","ids":{"openalex":"https://openalex.org/W7136694066","doi":"https://doi.org/10.48550/arxiv.2603.13119"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.13119","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.13119","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.13119","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5001463575","display_name":"Haoan Feng","orcid":"https://orcid.org/0000-0002-3667-3990"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Feng, Haoan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5020854369","display_name":"Sri Harsha Musunuri","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Musunuri, Sri Harsha","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5129566213","display_name":"Guan-Ming Su","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Su, Guan-Ming","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.35830000042915344,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.35830000042915344,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10812","display_name":"Human Pose and Action Recognition","score":0.335099995136261,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10531","display_name":"Advanced Vision and Imaging","score":0.05050000175833702,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/motion","display_name":"Motion (physics)","score":0.7084000110626221},{"id":"https://openalex.org/keywords/structure-from-motion","display_name":"Structure from motion","score":0.5285000205039978},{"id":"https://openalex.org/keywords/pipeline","display_name":"Pipeline (software)","score":0.5055000185966492},{"id":"https://openalex.org/keywords/benchmark","display_name":"Benchmark (surveying)","score":0.5019000172615051},{"id":"https://openalex.org/keywords/construct","display_name":"Construct (python library)","score":0.4702000021934509},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.4697999954223633},{"id":"https://openalex.org/keywords/optical-flow","display_name":"Optical flow","score":0.4293999969959259},{"id":"https://openalex.org/keywords/motion-estimation","display_name":"Motion estimation","score":0.40880000591278076},{"id":"https://openalex.org/keywords/camera-auto-calibration","display_name":"Camera auto-calibration","score":0.40860000252723694}],"concepts":[{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.7835999727249146},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.7516999840736389},{"id":"https://openalex.org/C104114177","wikidata":"https://www.wikidata.org/wiki/Q79782","display_name":"Motion (physics)","level":2,"score":0.7084000110626221},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6887000203132629},{"id":"https://openalex.org/C146159030","wikidata":"https://www.wikidata.org/wiki/Q7625099","display_name":"Structure from motion","level":3,"score":0.5285000205039978},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.5055000185966492},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.5019000172615051},{"id":"https://openalex.org/C2780801425","wikidata":"https://www.wikidata.org/wiki/Q5164392","display_name":"Construct (python library)","level":2,"score":0.4702000021934509},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.4697999954223633},{"id":"https://openalex.org/C155542232","wikidata":"https://www.wikidata.org/wiki/Q736111","display_name":"Optical flow","level":3,"score":0.4293999969959259},{"id":"https://openalex.org/C10161872","wikidata":"https://www.wikidata.org/wiki/Q557891","display_name":"Motion estimation","level":2,"score":0.40880000591278076},{"id":"https://openalex.org/C94816000","wikidata":"https://www.wikidata.org/wiki/Q5026006","display_name":"Camera auto-calibration","level":3,"score":0.40860000252723694},{"id":"https://openalex.org/C48007421","wikidata":"https://www.wikidata.org/wiki/Q676252","display_name":"Motion capture","level":3,"score":0.3905999958515167},{"id":"https://openalex.org/C118505674","wikidata":"https://www.wikidata.org/wiki/Q42586063","display_name":"Encoder","level":2,"score":0.3873000144958496},{"id":"https://openalex.org/C26760741","wikidata":"https://www.wikidata.org/wiki/Q160402","display_name":"Perception","level":2,"score":0.3614000082015991},{"id":"https://openalex.org/C110898773","wikidata":"https://www.wikidata.org/wiki/Q2933935","display_name":"Camera resectioning","level":2,"score":0.34850001335144043},{"id":"https://openalex.org/C95020103","wikidata":"https://www.wikidata.org/wiki/Q1813492","display_name":"Match moving","level":3,"score":0.33550000190734863},{"id":"https://openalex.org/C2779843651","wikidata":"https://www.wikidata.org/wiki/Q7390335","display_name":"SIGNAL (programming language)","level":2,"score":0.3319000005722046},{"id":"https://openalex.org/C65909025","wikidata":"https://www.wikidata.org/wiki/Q1945033","display_name":"Monocular","level":2,"score":0.323199987411499},{"id":"https://openalex.org/C100776233","wikidata":"https://www.wikidata.org/wiki/Q2532492","display_name":"Bridge (graph theory)","level":2,"score":0.302700012922287},{"id":"https://openalex.org/C124774092","wikidata":"https://www.wikidata.org/wiki/Q6917782","display_name":"Motion field","level":3,"score":0.3021000027656555},{"id":"https://openalex.org/C198352243","wikidata":"https://www.wikidata.org/wiki/Q37105","display_name":"Line (geometry)","level":2,"score":0.2662000060081482},{"id":"https://openalex.org/C115961682","wikidata":"https://www.wikidata.org/wiki/Q860623","display_name":"Image (mathematics)","level":2,"score":0.25440001487731934},{"id":"https://openalex.org/C52622490","wikidata":"https://www.wikidata.org/wiki/Q1026626","display_name":"Feature extraction","level":2,"score":0.25130000710487366}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.13119","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.13119","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.13119","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.13119","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Camera":[0],"motion":[1,29,56,77,89,132,151],"is":[2,179],"a":[3,36,46,63,82,116,135,169],"fundamental":[4],"geometric":[5,122],"signal":[6],"that":[7,87,120],"shapes":[8],"visual":[9],"perception":[10],"and":[11,24,41,61,138,153,162,172,177],"cinematic":[12],"style,":[13],"yet":[14],"current":[15],"video-capable":[16],"vision-language":[17],"models":[18,128],"(VideoLLMs)":[19],"rarely":[20],"represent":[21],"it":[22],"explicitly":[23],"often":[25],"fail":[26],"on":[27,81],"fine-grained":[28],"primitives.":[30,78],"We":[31,43],"address":[32],"this":[33,107],"gap":[34,108],"with":[35,50,134],"framework":[37],"of":[38],"$\\textbf{benchmarking}$,":[39],"$\\textbf{diagnosis}$,":[40],"$\\textbf{injection}$.":[42],"curate":[44],"$\\textbf{CameraMotionDataset}$,":[45],"large-scale":[47],"synthetic":[48],"dataset":[49,176],"explicit":[51],"camera":[52,55,76,88,123],"control,":[53],"formulate":[54],"as":[57,165],"constraint-aware":[58],"multi-label":[59],"recognition,":[60],"construct":[62],"VQA":[64],"benchmark--$\\textbf{CameraMotionVQA}$.":[65],"Across":[66],"diverse":[67],"off-the-shelf":[68],"VideoLLMs,":[69],"we":[70,114],"observe":[71],"substantial":[72],"errors":[73],"in":[74,95],"recognizing":[75],"Probing":[79],"experiments":[80],"Qwen2.5-VL":[83],"vision":[84],"encoder":[85],"suggest":[86],"cues":[90,124],"are":[91],"weakly":[92],"represented,":[93],"especially":[94],"deeper":[96],"ViT":[97],"blocks,":[98],"helping":[99],"explain":[100],"the":[101],"observed":[102],"failure":[103],"modes.":[104],"To":[105],"bridge":[106],"without":[109],"costly":[110],"training":[111],"or":[112],"fine-tuning,":[113],"propose":[115],"lightweight,":[117],"model-agnostic":[118],"pipeline":[119],"extracts":[121],"from":[125],"3D":[126],"foundation":[127],"(3DFMs),":[129],"predicts":[130],"constrained":[131],"primitives":[133],"temporal":[136],"classifier,":[137],"injects":[139],"them":[140],"into":[141],"downstream":[142],"VideoLLM":[143,171],"inference":[144],"via":[145],"structured":[146,163],"prompting.":[147],"Experiments":[148],"demonstrate":[149],"improved":[150],"recognition":[152],"more":[154],"camera-aware":[155,170],"model":[156],"responses,":[157],"highlighting":[158],"geometry-driven":[159],"cue":[160],"extraction":[161],"prompting":[164],"practical":[166],"steps":[167],"toward":[168],"VLA":[173],"system.":[174],"The":[175],"benchmark":[178],"publicly":[180],"available":[181],"at":[182],"https://hf.co/datasets/fengyee/camera-motion-dataset-and-benchmark.":[183]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-03-17T00:00:00"}
