{"id":"https://openalex.org/W7165791839","doi":"https://doi.org/10.48550/arxiv.2606.24464","title":"Boosting Text-Driven Video Segmentation via Geometry-Aware Distillation","display_name":"Boosting Text-Driven Video Segmentation via Geometry-Aware Distillation","publication_year":2026,"publication_date":"2026-06-23","ids":{"openalex":"https://openalex.org/W7165791839","doi":"https://doi.org/10.48550/arxiv.2606.24464"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.24464","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.24464","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.24464","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139268543","display_name":"Tianyu Zhu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhu, Tianyu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5107311577","display_name":"Y Liang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liang, Yingping","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5132549253","display_name":"Hesong Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Hesong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5069101640","display_name":"Y Fu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Fu, Ying","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.6557000279426575,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.6557000279426575,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10036","display_name":"Advanced Neural Network Applications","score":0.1340000033378601,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11605","display_name":"Visual Attention and Saliency Detection","score":0.03709999844431877,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/segmentation","display_name":"Segmentation","score":0.7245000004768372},{"id":"https://openalex.org/keywords/boosting","display_name":"Boosting (machine learning)","score":0.5807999968528748},{"id":"https://openalex.org/keywords/monocular","display_name":"Monocular","score":0.5544000267982483},{"id":"https://openalex.org/keywords/image-segmentation","display_name":"Image segmentation","score":0.4943999946117401},{"id":"https://openalex.org/keywords/pattern-recognition","display_name":"Pattern recognition (psychology)","score":0.43779999017715454},{"id":"https://openalex.org/keywords/scale-space-segmentation","display_name":"Scale-space segmentation","score":0.43149998784065247},{"id":"https://openalex.org/keywords/segmentation-based-object-categorization","display_name":"Segmentation-based object categorization","score":0.4203999936580658},{"id":"https://openalex.org/keywords/consistency","display_name":"Consistency (knowledge bases)","score":0.41130000352859497},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.4041000008583069}],"concepts":[{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.807200014591217},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7516999840736389},{"id":"https://openalex.org/C89600930","wikidata":"https://www.wikidata.org/wiki/Q1423946","display_name":"Segmentation","level":2,"score":0.7245000004768372},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.6952999830245972},{"id":"https://openalex.org/C46686674","wikidata":"https://www.wikidata.org/wiki/Q466303","display_name":"Boosting (machine learning)","level":2,"score":0.5807999968528748},{"id":"https://openalex.org/C65909025","wikidata":"https://www.wikidata.org/wiki/Q1945033","display_name":"Monocular","level":2,"score":0.5544000267982483},{"id":"https://openalex.org/C124504099","wikidata":"https://www.wikidata.org/wiki/Q56933","display_name":"Image segmentation","level":3,"score":0.4943999946117401},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.43779999017715454},{"id":"https://openalex.org/C65885262","wikidata":"https://www.wikidata.org/wiki/Q7429708","display_name":"Scale-space segmentation","level":4,"score":0.43149998784065247},{"id":"https://openalex.org/C25694479","wikidata":"https://www.wikidata.org/wiki/Q7446278","display_name":"Segmentation-based object categorization","level":5,"score":0.4203999936580658},{"id":"https://openalex.org/C2776436953","wikidata":"https://www.wikidata.org/wiki/Q5163215","display_name":"Consistency (knowledge bases)","level":2,"score":0.41130000352859497},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.4041000008583069},{"id":"https://openalex.org/C2781238097","wikidata":"https://www.wikidata.org/wiki/Q175026","display_name":"Object (grammar)","level":2,"score":0.38269999623298645},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.33730000257492065},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.33329999446868896},{"id":"https://openalex.org/C160633673","wikidata":"https://www.wikidata.org/wiki/Q355198","display_name":"Pixel","level":2,"score":0.3325999975204468},{"id":"https://openalex.org/C147764199","wikidata":"https://www.wikidata.org/wiki/Q6865248","display_name":"Minification","level":2,"score":0.30790001153945923},{"id":"https://openalex.org/C2781181686","wikidata":"https://www.wikidata.org/wiki/Q4226068","display_name":"Coherence (philosophical gambling strategy)","level":2,"score":0.30790001153945923},{"id":"https://openalex.org/C2776151529","wikidata":"https://www.wikidata.org/wiki/Q3045304","display_name":"Object detection","level":3,"score":0.29499998688697815},{"id":"https://openalex.org/C64876066","wikidata":"https://www.wikidata.org/wiki/Q5141226","display_name":"Cognitive neuroscience of visual object recognition","level":3,"score":0.27619999647140503},{"id":"https://openalex.org/C52622490","wikidata":"https://www.wikidata.org/wiki/Q1026626","display_name":"Feature extraction","level":2,"score":0.2667999863624573},{"id":"https://openalex.org/C63099799","wikidata":"https://www.wikidata.org/wiki/Q17147001","display_name":"Image texture","level":4,"score":0.262800008058548},{"id":"https://openalex.org/C9417928","wikidata":"https://www.wikidata.org/wiki/Q1070689","display_name":"Image processing","level":3,"score":0.2547999918460846},{"id":"https://openalex.org/C115961682","wikidata":"https://www.wikidata.org/wiki/Q860623","display_name":"Image (mathematics)","level":2,"score":0.2547999918460846}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.24464","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.24464","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.24464","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.24464","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Text-driven":[0],"Referring":[1],"Video":[2,54],"Object":[3],"Segmentation":[4],"(RVOS)":[5],"aims":[6],"to":[7,43,67,88],"locate":[8],"and":[9,41,108,131,136],"segment":[10],"target":[11],"objects":[12],"in":[13,139,157],"videos":[14],"given":[15],"natural":[16],"language.":[17],"However,":[18],"existing":[19],"models":[20],"are":[21],"typically":[22],"trained":[23],"on":[24,96,112,166],"2D":[25],"image":[26,149],"or":[27],"video":[28,70,113],"datasets":[29],"with":[30,81,161],"naive":[31],"segmentation":[32,55,114,150],"losses,":[33],"which":[34],"overlooks":[35],"the":[36,73,86,101,110],"geometric":[37,63],"consistency":[38],"across":[39,173],"frames":[40],"leads":[42],"weak":[44],"spatial":[45,94],"understanding.":[46],"In":[47,72,100],"this":[48],"paper,":[49],"we":[50,76,104],"propose":[51],"Geometry-enhanced":[52],"Language-guided":[53],"(GeoLaV),":[56],"a":[57,121],"two-stage":[58],"framework":[59],"that":[60,144],"distills":[61],"3D":[62,117,123,129],"knowledge":[64,119],"from":[65,120],"images":[66],"enhance":[68],"text-driven":[69],"segmentation.":[71,140],"first":[74],"stage,":[75,103],"perform":[77],"monocular":[78,82],"geometry":[79],"pretraining":[80],"novel-view":[83],"synthesis,":[84],"enabling":[85],"model":[87,111],"acquire":[89],"geometry-consistent":[90],"visual":[91],"representations":[92],"via":[93],"alignment":[95],"large-scale":[97],"single-image":[98],"datasets.":[99],"second":[102],"introduce":[105],"geometry-aware":[106,162],"distillation":[107,163],"fine-tune":[109],"datasets,":[115],"transferring":[116],"structural":[118],"general":[122],"prior":[124],"model.":[125],"This":[126],"process":[127],"reinforces":[128],"awareness":[130],"improves":[132],"both":[133],"spatiotemporal":[134],"coherence":[135],"language":[137],"grounding":[138],"Extensive":[141],"experiments":[142],"show":[143],"our":[145,168],"method":[146,169],"using":[147],"only":[148],"data":[151],"already":[152],"provides":[153],"notable":[154],"zero-shot":[155],"generalization":[156],"RVOS.":[158],"When":[159],"combined":[160],"for":[164],"fine-tuning":[165],"videos,":[167],"achieves":[170],"state-of-the-art":[171],"performance":[172],"multiple":[174],"RVOS":[175],"benchmarks.":[176],"The":[177],"code":[178],"is":[179],"available":[180],"at":[181],"https://github.com/Tony1882880/GeoLaV.":[182]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-06-25T00:00:00"}
