{"id":"https://openalex.org/W7165383424","doi":"https://doi.org/10.48550/arxiv.2606.19776","title":"Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding","display_name":"Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding","publication_year":2026,"publication_date":"2026-06-18","ids":{"openalex":"https://openalex.org/W7165383424","doi":"https://doi.org/10.48550/arxiv.2606.19776"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.19776","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.19776","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.19776","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139015033","display_name":"Jianing Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Jianing","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139014939","display_name":"Zhou Fang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Fang, Zhou","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138987611","display_name":"Yijiang Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Yijiang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5138976393","display_name":"Li Du","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Du, Li","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.9226999878883362,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.9226999878883362,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10191","display_name":"Robotics and Sensor-Based Localization","score":0.016599999740719795,"subfield":{"id":"https://openalex.org/subfields/2202","display_name":"Aerospace Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10036","display_name":"Advanced Neural Network Applications","score":0.007899999618530273,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/closed-captioning","display_name":"Closed captioning","score":0.5178999900817871},{"id":"https://openalex.org/keywords/semantics","display_name":"Semantics (computer science)","score":0.5151000022888184},{"id":"https://openalex.org/keywords/point-cloud","display_name":"Point cloud","score":0.5094000101089478},{"id":"https://openalex.org/keywords/perception","display_name":"Perception","score":0.47870001196861267},{"id":"https://openalex.org/keywords/point","display_name":"Point (geometry)","score":0.47040000557899475},{"id":"https://openalex.org/keywords/encoder","display_name":"Encoder","score":0.46860000491142273},{"id":"https://openalex.org/keywords/scene-statistics","display_name":"Scene statistics","score":0.42579999566078186},{"id":"https://openalex.org/keywords/3d-modeling","display_name":"3D modeling","score":0.41909998655319214},{"id":"https://openalex.org/keywords/visualization","display_name":"Visualization","score":0.4133000075817108}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7376999855041504},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6565999984741211},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.6509000062942505},{"id":"https://openalex.org/C157657479","wikidata":"https://www.wikidata.org/wiki/Q2367247","display_name":"Closed captioning","level":3,"score":0.5178999900817871},{"id":"https://openalex.org/C184337299","wikidata":"https://www.wikidata.org/wiki/Q1437428","display_name":"Semantics (computer science)","level":2,"score":0.5151000022888184},{"id":"https://openalex.org/C131979681","wikidata":"https://www.wikidata.org/wiki/Q1899648","display_name":"Point cloud","level":2,"score":0.5094000101089478},{"id":"https://openalex.org/C26760741","wikidata":"https://www.wikidata.org/wiki/Q160402","display_name":"Perception","level":2,"score":0.47870001196861267},{"id":"https://openalex.org/C28719098","wikidata":"https://www.wikidata.org/wiki/Q44946","display_name":"Point (geometry)","level":2,"score":0.47040000557899475},{"id":"https://openalex.org/C118505674","wikidata":"https://www.wikidata.org/wiki/Q42586063","display_name":"Encoder","level":2,"score":0.46860000491142273},{"id":"https://openalex.org/C197654239","wikidata":"https://www.wikidata.org/wiki/Q7430757","display_name":"Scene statistics","level":3,"score":0.42579999566078186},{"id":"https://openalex.org/C2777897806","wikidata":"https://www.wikidata.org/wiki/Q568742","display_name":"3D modeling","level":2,"score":0.41909998655319214},{"id":"https://openalex.org/C36464697","wikidata":"https://www.wikidata.org/wiki/Q451553","display_name":"Visualization","level":2,"score":0.4133000075817108},{"id":"https://openalex.org/C100609095","wikidata":"https://www.wikidata.org/wiki/Q1335050","display_name":"Embodied cognition","level":2,"score":0.3919999897480011},{"id":"https://openalex.org/C108882727","wikidata":"https://www.wikidata.org/wiki/Q2991685","display_name":"Solid modeling","level":2,"score":0.3871999979019165},{"id":"https://openalex.org/C160331591","wikidata":"https://www.wikidata.org/wiki/Q7075743","display_name":"Occupancy","level":2,"score":0.3822000026702881},{"id":"https://openalex.org/C3019007443","wikidata":"https://www.wikidata.org/wiki/Q568742","display_name":"3d model","level":2,"score":0.3790000081062317},{"id":"https://openalex.org/C82990744","wikidata":"https://www.wikidata.org/wiki/Q166194","display_name":"RGB color model","level":2,"score":0.3700999915599823},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.3695000112056732},{"id":"https://openalex.org/C104065381","wikidata":"https://www.wikidata.org/wiki/Q1002535","display_name":"Geometric modeling","level":2,"score":0.3540000021457672},{"id":"https://openalex.org/C67186912","wikidata":"https://www.wikidata.org/wiki/Q367664","display_name":"Data modeling","level":2,"score":0.34310001134872437},{"id":"https://openalex.org/C178253425","wikidata":"https://www.wikidata.org/wiki/Q162668","display_name":"Visual perception","level":3,"score":0.3111000061035156},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.305400013923645},{"id":"https://openalex.org/C12713177","wikidata":"https://www.wikidata.org/wiki/Q1900281","display_name":"Perspective (graphical)","level":2,"score":0.29420000314712524},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.26980000734329224},{"id":"https://openalex.org/C121684516","wikidata":"https://www.wikidata.org/wiki/Q7600677","display_name":"Computer graphics (images)","level":1,"score":0.26809999346733093},{"id":"https://openalex.org/C2776151529","wikidata":"https://www.wikidata.org/wiki/Q3045304","display_name":"Object detection","level":3,"score":0.26759999990463257},{"id":"https://openalex.org/C84824328","wikidata":"https://www.wikidata.org/wiki/Q4633097","display_name":"2D to 3D conversion","level":3,"score":0.2623000144958496},{"id":"https://openalex.org/C2780878386","wikidata":"https://www.wikidata.org/wiki/Q1659648","display_name":"Visual language","level":2,"score":0.2524000108242035}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.19776","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.19776","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.19776","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.19776","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Recently,":[0],"vision-language":[1,69,78,157],"models":[2],"(VLMs)":[3],"have":[4],"made":[5],"significant":[6],"progress":[7],"in":[8,14],"3D":[9,32,44,59,77,90,110,128,175,181],"scene":[10,91,111,143],"understanding,":[11],"driving":[12],"advances":[13],"applications":[15],"such":[16],"as":[17,113],"embodied":[18],"intelligence":[19],"and":[20,100,155,180],"robotic":[21],"vision.":[22],"However,":[23],"existing":[24],"approaches":[25],"typically":[26],"either":[27],"rely":[28],"directly":[29],"on":[30,96,163,169,174],"explicit":[31],"inputs":[33],"(e.g.,":[34],"point":[35],"clouds":[36],"or":[37,40],"RGB-D":[38],"sequences),":[39],"introduce":[41],"an":[42,114],"additional":[43],"geometry":[45],"encoder":[46],"to":[47,121],"derive":[48],"3D-aware":[49],"visual":[50],"tokens":[51,126,131],"from":[52,62],"2D":[53,65,104,125],"images.":[54],"Such":[55],"designs":[56],"structurally":[57],"decouple":[58],"geometric":[60,116,153],"perception":[61,154],"the":[63,72],"rich":[64],"semantics":[66],"learned":[67],"via":[68],"pre-training,":[70],"hindering":[71],"development":[73],"of":[74],"a":[75,86,102,136],"unified":[76,142],"representation.":[79],"In":[80],"this":[81],"work,":[82],"we":[83],"propose":[84],"Occ-VLM,":[85],"novel":[87],"framework":[88],"for":[89,141],"understanding":[92],"that":[93,148],"operates":[94],"purely":[95],"posed":[97],"RGB":[98],"images":[99],"employs":[101],"single":[103],"vision":[105],"encoder.":[106],"Specifically,":[107],"Occ-VLM":[108,149],"reconstructs":[109],"occupancy":[112,165],"auxiliary":[115],"prior,":[117],"which":[118],"is":[119],"utilized":[120],"spatially":[122],"associate":[123],"foreground":[124],"with":[127,171],"space.":[129],"These":[130],"are":[132],"then":[133],"decoded":[134],"by":[135],"Large":[137],"Language":[138],"Model":[139],"(LLM)":[140],"understanding.":[144],"Extensive":[145],"experiments":[146],"demonstrate":[147],"achieves":[150],"both":[151],"accurate":[152],"robust":[156],"reasoning:":[158],"it":[159],"attains":[160],"state-of-the-art":[161],"performance":[162],"multi-view":[164],"prediction,":[166],"while":[167],"performing":[168],"par":[170],"3D-input":[172],"VLMs":[173],"Visual":[176],"Question":[177],"Answering":[178],"(VQA)":[179],"dense":[182],"captioning":[183],"benchmarks.":[184]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-06-20T00:00:00"}
