{"id":"https://openalex.org/W4415537198","doi":"https://doi.org/10.1145/3746027.3754840","title":"What You Perceive Is What You Conceive: A Cognition-Inspired Framework for Open Vocabulary Image Segmentation","display_name":"What You Perceive Is What You Conceive: A Cognition-Inspired Framework for Open Vocabulary Image Segmentation","publication_year":2025,"publication_date":"2025-10-25","ids":{"openalex":"https://openalex.org/W4415537198","doi":"https://doi.org/10.1145/3746027.3754840"},"language":null,"primary_location":{"id":"doi:10.1145/3746027.3754840","is_oa":false,"landing_page_url":"https://doi.org/10.1145/3746027.3754840","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 33rd ACM International Conference on Multimedia","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5069323421","display_name":"Jianghang Lin","orcid":null},"institutions":[{"id":"https://openalex.org/I191208505","display_name":"Xiamen University","ror":"https://ror.org/00mcjh785","country_code":"CN","type":"education","lineage":["https://openalex.org/I191208505"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Jianghang Lin","raw_affiliation_strings":["Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China"],"raw_orcid":"https://orcid.org/0009-0009-3873-3860","affiliations":[{"raw_affiliation_string":"Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China","institution_ids":["https://openalex.org/I191208505"]}]},{"author_position":"middle","author":{"id":null,"display_name":"Yue Hu","orcid":"https://orcid.org/0009-0009-0650-7383"},"institutions":[{"id":"https://openalex.org/I191208505","display_name":"Xiamen University","ror":"https://ror.org/00mcjh785","country_code":"CN","type":"education","lineage":["https://openalex.org/I191208505"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Yue Hu","raw_affiliation_strings":["Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China"],"raw_orcid":"https://orcid.org/0009-0009-0650-7383","affiliations":[{"raw_affiliation_string":"Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China","institution_ids":["https://openalex.org/I191208505"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5036686619","display_name":"Jinyi Shen","orcid":null},"institutions":[{"id":"https://openalex.org/I191208505","display_name":"Xiamen University","ror":"https://ror.org/00mcjh785","country_code":"CN","type":"education","lineage":["https://openalex.org/I191208505"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Jiangtao Shen","raw_affiliation_strings":["Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China"],"raw_orcid":"https://orcid.org/0009-0005-2776-3643","affiliations":[{"raw_affiliation_string":"Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China","institution_ids":["https://openalex.org/I191208505"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5039883116","display_name":"Yunhang Shen","orcid":"https://orcid.org/0000-0002-3970-7519"},"institutions":[{"id":"https://openalex.org/I191208505","display_name":"Xiamen University","ror":"https://ror.org/00mcjh785","country_code":"CN","type":"education","lineage":["https://openalex.org/I191208505"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Yunhang Shen","raw_affiliation_strings":["Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China"],"raw_orcid":"https://orcid.org/0000-0002-3970-7519","affiliations":[{"raw_affiliation_string":"Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China","institution_ids":["https://openalex.org/I191208505"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5014628588","display_name":"Liujuan Cao","orcid":"https://orcid.org/0000-0002-7645-9606"},"institutions":[{"id":"https://openalex.org/I191208505","display_name":"Xiamen University","ror":"https://ror.org/00mcjh785","country_code":"CN","type":"education","lineage":["https://openalex.org/I191208505"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Liujuan Cao","raw_affiliation_strings":["Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China"],"raw_orcid":"https://orcid.org/0000-0002-7645-9606","affiliations":[{"raw_affiliation_string":"Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China","institution_ids":["https://openalex.org/I191208505"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5033991031","display_name":"Shengchuan Zhang","orcid":null},"institutions":[{"id":"https://openalex.org/I191208505","display_name":"Xiamen University","ror":"https://ror.org/00mcjh785","country_code":"CN","type":"education","lineage":["https://openalex.org/I191208505"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Shengchuan Zhang","raw_affiliation_strings":["Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China"],"raw_orcid":"https://orcid.org/0000-0002-0800-0609","affiliations":[{"raw_affiliation_string":"Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China","institution_ids":["https://openalex.org/I191208505"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5016080094","display_name":"Rongrong Ji","orcid":"https://orcid.org/0000-0001-9163-2932"},"institutions":[{"id":"https://openalex.org/I191208505","display_name":"Xiamen University","ror":"https://ror.org/00mcjh785","country_code":"CN","type":"education","lineage":["https://openalex.org/I191208505"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Rongrong Ji","raw_affiliation_strings":["Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China"],"raw_orcid":"https://orcid.org/0000-0001-9163-2932","affiliations":[{"raw_affiliation_string":"Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China","institution_ids":["https://openalex.org/I191208505"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I191208505"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":1,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"2841","last_page":"2850"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.9973000288009644,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.9973000288009644,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10824","display_name":"Image Retrieval and Classification Techniques","score":0.9884999990463257,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11605","display_name":"Visual Attention and Saliency Detection","score":0.9837999939918518,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/segmentation","display_name":"Segmentation","score":0.616599977016449},{"id":"https://openalex.org/keywords/object","display_name":"Object (grammar)","score":0.5490999817848206},{"id":"https://openalex.org/keywords/vocabulary","display_name":"Vocabulary","score":0.536899983882904},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.527899980545044},{"id":"https://openalex.org/keywords/semantics","display_name":"Semantics (computer science)","score":0.49630001187324524},{"id":"https://openalex.org/keywords/image-segmentation","display_name":"Image segmentation","score":0.47530001401901245},{"id":"https://openalex.org/keywords/feature","display_name":"Feature (linguistics)","score":0.4618000090122223},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.4537999927997589},{"id":"https://openalex.org/keywords/cognitive-neuroscience-of-visual-object-recognition","display_name":"Cognitive neuroscience of visual object recognition","score":0.4307999908924103}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7502999901771545},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.7358999848365784},{"id":"https://openalex.org/C89600930","wikidata":"https://www.wikidata.org/wiki/Q1423946","display_name":"Segmentation","level":2,"score":0.616599977016449},{"id":"https://openalex.org/C2781238097","wikidata":"https://www.wikidata.org/wiki/Q175026","display_name":"Object (grammar)","level":2,"score":0.5490999817848206},{"id":"https://openalex.org/C2777601683","wikidata":"https://www.wikidata.org/wiki/Q6499736","display_name":"Vocabulary","level":2,"score":0.536899983882904},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.527899980545044},{"id":"https://openalex.org/C184337299","wikidata":"https://www.wikidata.org/wiki/Q1437428","display_name":"Semantics (computer science)","level":2,"score":0.49630001187324524},{"id":"https://openalex.org/C124504099","wikidata":"https://www.wikidata.org/wiki/Q56933","display_name":"Image segmentation","level":3,"score":0.47530001401901245},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.46619999408721924},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.4618000090122223},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.4537999927997589},{"id":"https://openalex.org/C64876066","wikidata":"https://www.wikidata.org/wiki/Q5141226","display_name":"Cognitive neuroscience of visual object recognition","level":3,"score":0.4307999908924103},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.42910000681877136},{"id":"https://openalex.org/C115961682","wikidata":"https://www.wikidata.org/wiki/Q860623","display_name":"Image (mathematics)","level":2,"score":0.39089998602867126},{"id":"https://openalex.org/C2776151529","wikidata":"https://www.wikidata.org/wiki/Q3045304","display_name":"Object detection","level":3,"score":0.3668999969959259},{"id":"https://openalex.org/C2781122975","wikidata":"https://www.wikidata.org/wiki/Q16928266","display_name":"Semantic feature","level":2,"score":0.36649999022483826},{"id":"https://openalex.org/C26760741","wikidata":"https://www.wikidata.org/wiki/Q160402","display_name":"Perception","level":2,"score":0.34369999170303345},{"id":"https://openalex.org/C160086991","wikidata":"https://www.wikidata.org/wiki/Q5939193","display_name":"Human visual system model","level":3,"score":0.3434999883174896},{"id":"https://openalex.org/C167966045","wikidata":"https://www.wikidata.org/wiki/Q5532625","display_name":"Generative model","level":3,"score":0.3393999934196472},{"id":"https://openalex.org/C25694479","wikidata":"https://www.wikidata.org/wiki/Q7446278","display_name":"Segmentation-based object categorization","level":5,"score":0.33399999141693115},{"id":"https://openalex.org/C2780598303","wikidata":"https://www.wikidata.org/wiki/Q65921492","display_name":"Flexibility (engineering)","level":2,"score":0.32679998874664307},{"id":"https://openalex.org/C52622490","wikidata":"https://www.wikidata.org/wiki/Q1026626","display_name":"Feature extraction","level":2,"score":0.3199000060558319},{"id":"https://openalex.org/C23224414","wikidata":"https://www.wikidata.org/wiki/Q176769","display_name":"Hidden Markov model","level":2,"score":0.3043999969959259},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.28929999470710754},{"id":"https://openalex.org/C178253425","wikidata":"https://www.wikidata.org/wiki/Q162668","display_name":"Visual perception","level":3,"score":0.27970001101493835},{"id":"https://openalex.org/C65885262","wikidata":"https://www.wikidata.org/wiki/Q7429708","display_name":"Scale-space segmentation","level":4,"score":0.27889999747276306},{"id":"https://openalex.org/C75294576","wikidata":"https://www.wikidata.org/wiki/Q5165192","display_name":"Contextual image classification","level":3,"score":0.2687000036239624},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.26739999651908875},{"id":"https://openalex.org/C36464697","wikidata":"https://www.wikidata.org/wiki/Q451553","display_name":"Visualization","level":2,"score":0.2533000111579895},{"id":"https://openalex.org/C2780103172","wikidata":"https://www.wikidata.org/wiki/Q1309721","display_name":"Visual Objects","level":3,"score":0.2522999942302704}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1145/3746027.3754840","is_oa":false,"landing_page_url":"https://doi.org/10.1145/3746027.3754840","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 33rd ACM International Conference on Multimedia","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":24,"referenced_works":["https://openalex.org/W2031489346","https://openalex.org/W2125215748","https://openalex.org/W2250384498","https://openalex.org/W2302548814","https://openalex.org/W2340897893","https://openalex.org/W2737258237","https://openalex.org/W2781228439","https://openalex.org/W2963150697","https://openalex.org/W2964345792","https://openalex.org/W2999219213","https://openalex.org/W3176641147","https://openalex.org/W3216551675","https://openalex.org/W4286982960","https://openalex.org/W4312443924","https://openalex.org/W4312543911","https://openalex.org/W4312815172","https://openalex.org/W4312980231","https://openalex.org/W4386075561","https://openalex.org/W4386076397","https://openalex.org/W4390874207","https://openalex.org/W4400582175","https://openalex.org/W4402733565","https://openalex.org/W4403791674","https://openalex.org/W6912494966"],"related_works":[],"abstract_inverted_index":{"Open":[0],"vocabulary":[1,70],"image":[2,71,213],"segmentation":[3,28,54,72],"tackles":[4],"the":[5,36,75],"challenge":[6],"of":[7,41,85,96,164],"recognizing":[8,42,219],"dynamically":[9],"adjustable,":[10],"predefined":[11],"novel":[12,65],"categories":[13],"at":[14],"inference":[15],"time":[16],"by":[17,30,110],"leveraging":[18],"vision-language":[19],"alignment.":[20],"However,":[21],"existing":[22],"paradigms":[23],"typically":[24],"perform":[25],"class-agnostic":[26],"region":[27,53,119],"followed":[29],"category":[31],"matching,":[32],"which":[33],"deviates":[34],"from":[35],"human":[37,76,108],"visual":[38,77,134,138],"system's":[39],"process":[40],"objects":[43],"based":[44,140],"on":[45,141,184,197],"semantic":[46,116,156],"concepts,":[47],"leading":[48],"to":[49,114],"poor":[50],"alignment":[51],"between":[52],"and":[55,181,194,204],"object":[56,112,142],"concepts.":[57,143],"To":[58],"bridge":[59],"this":[60],"gap,":[61],"we":[62],"propose":[63],"a":[64,82,162],"Cognition-Inspired":[66,146],"Framework":[67],"for":[68,118],"open":[69],"that":[73,106,127,149,170],"emulates":[74],"recognition":[78],"process:":[79],"first":[80],"forming":[81],"conceptual":[83],"understanding":[84],"an":[86],"object,":[87],"then":[88],"perceiving":[89],"its":[90],"spatial":[91],"extent.":[92],"The":[93],"framework":[94,172,210],"consists":[95],"three":[97],"core":[98],"components:":[99],"(1)":[100],"A":[101,122,145],"Generative":[102],"Vision-Language":[103],"Model":[104],"(G-VLM)":[105],"mimics":[107],"cognition":[109],"generating":[111],"concepts":[113],"provide":[115],"guidance":[117],"segmentation.":[120],"(2)":[121],"Concept-Aware":[123],"Visual":[124],"Enhancer":[125],"module":[126],"fuses":[128],"textual":[129],"concept":[130],"features":[131,153],"with":[132,154],"global":[133],"representations,":[135],"enabling":[136],"adaptive":[137],"perception":[139],"(3)":[144],"Mask":[147],"Decoder":[148],"integrates":[150],"local":[151],"instance":[152],"G-VLM-provided":[155],"cues,":[157],"allowing":[158],"selective":[159],"classification":[160],"over":[161],"subset":[163],"relevant":[165],"categories.":[166,221],"Extensive":[167],"experiments":[168],"demonstrate":[169],"our":[171,209],"achieves":[173],"significant":[174],"improvements,":[175],"reaching":[176],"27.2":[177],"PQ,":[178],"17.0":[179],"mAP,":[180],"35.3":[182],"mIoU":[183,196],"A-150.":[185],"It":[186],"further":[187],"attains":[188],"56.2,":[189],"28.2,":[190],"15.4,":[191],"59.2,":[192],"18.7,":[193],"95.8":[195],"Cityscapes,":[198],"Mapillary":[199],"Vistas,":[200],"A-847,":[201],"PC-59,":[202],"PC-459,":[203],"PAS-20,":[205],"respectively.":[206],"In":[207],"addition,":[208],"supports":[211],"vocabulary-free":[212],"segmentation,":[214],"offering":[215],"enhanced":[216],"flexibility":[217],"in":[218],"unseen":[220]},"counts_by_year":[{"year":2026,"cited_by_count":1}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-25T00:00:00"}
