{"id":"https://openalex.org/W7131260957","doi":"https://doi.org/10.1109/vcip67698.2025.11396859","title":"Dual-Layer Image Codec with Text Guidance for Hybrid Visual Perception","display_name":"Dual-Layer Image Codec with Text Guidance for Hybrid Visual Perception","publication_year":2025,"publication_date":"2025-12-01","ids":{"openalex":"https://openalex.org/W7131260957","doi":"https://doi.org/10.1109/vcip67698.2025.11396859"},"language":null,"primary_location":{"id":"doi:10.1109/vcip67698.2025.11396859","is_oa":false,"landing_page_url":"https://doi.org/10.1109/vcip67698.2025.11396859","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Conference on Visual Communications and Image Processing (VCIP)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5071823645","display_name":"Tianma Shen","orcid":null},"institutions":[{"id":"https://openalex.org/I16269868","display_name":"Santa Clara University","ror":"https://ror.org/03ypqe447","country_code":"US","type":"education","lineage":["https://openalex.org/I16269868"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Tianma Shen","raw_affiliation_strings":["Santa Clara University,Department of Computer Science and Engineering,Santa Clara,CA,USA,95053"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Santa Clara University,Department of Computer Science and Engineering,Santa Clara,CA,USA,95053","institution_ids":["https://openalex.org/I16269868"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5035511812","display_name":"Joseph Quan","orcid":null},"institutions":[{"id":"https://openalex.org/I311071055","display_name":"Grand Canyon University","ror":"https://ror.org/014kv8184","country_code":"US","type":"education","lineage":["https://openalex.org/I311071055"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Joseph Quan","raw_affiliation_strings":["Canyon Crest Academy,San Diego,CA,USA,92130"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Canyon Crest Academy,San Diego,CA,USA,92130","institution_ids":["https://openalex.org/I311071055"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5126700957","display_name":"Ying Liu","orcid":null},"institutions":[{"id":"https://openalex.org/I16269868","display_name":"Santa Clara University","ror":"https://ror.org/03ypqe447","country_code":"US","type":"education","lineage":["https://openalex.org/I16269868"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Ying Liu","raw_affiliation_strings":["Santa Clara University,Department of Computer Science and Engineering,Santa Clara,CA,USA,95053"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Santa Clara University,Department of Computer Science and Engineering,Santa Clara,CA,USA,95053","institution_ids":["https://openalex.org/I16269868"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.66310359,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"5"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10775","display_name":"Generative Adversarial Networks and Image Synthesis","score":0.08900000154972076,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10775","display_name":"Generative Adversarial Networks and Image Synthesis","score":0.08900000154972076,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11448","display_name":"Face recognition and analysis","score":0.0835999995470047,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11605","display_name":"Visual Attention and Saliency Detection","score":0.08060000091791153,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/codec","display_name":"Codec","score":0.7297000288963318},{"id":"https://openalex.org/keywords/object","display_name":"Object (grammar)","score":0.5329999923706055},{"id":"https://openalex.org/keywords/image-compression","display_name":"Image compression","score":0.5013999938964844},{"id":"https://openalex.org/keywords/object-detection","display_name":"Object detection","score":0.5002999901771545},{"id":"https://openalex.org/keywords/image","display_name":"Image (mathematics)","score":0.48330000042915344},{"id":"https://openalex.org/keywords/perception","display_name":"Perception","score":0.4763000011444092},{"id":"https://openalex.org/keywords/human-visual-system-model","display_name":"Human visual system model","score":0.4415999948978424},{"id":"https://openalex.org/keywords/data-compression","display_name":"Data compression","score":0.4189999997615814},{"id":"https://openalex.org/keywords/visual-perception","display_name":"Visual perception","score":0.4081999957561493}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8215000033378601},{"id":"https://openalex.org/C161765866","wikidata":"https://www.wikidata.org/wiki/Q184748","display_name":"Codec","level":2,"score":0.7297000288963318},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.725600004196167},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.711899995803833},{"id":"https://openalex.org/C2781238097","wikidata":"https://www.wikidata.org/wiki/Q175026","display_name":"Object (grammar)","level":2,"score":0.5329999923706055},{"id":"https://openalex.org/C13481523","wikidata":"https://www.wikidata.org/wiki/Q412438","display_name":"Image compression","level":4,"score":0.5013999938964844},{"id":"https://openalex.org/C2776151529","wikidata":"https://www.wikidata.org/wiki/Q3045304","display_name":"Object detection","level":3,"score":0.5002999901771545},{"id":"https://openalex.org/C115961682","wikidata":"https://www.wikidata.org/wiki/Q860623","display_name":"Image (mathematics)","level":2,"score":0.48330000042915344},{"id":"https://openalex.org/C26760741","wikidata":"https://www.wikidata.org/wiki/Q160402","display_name":"Perception","level":2,"score":0.4763000011444092},{"id":"https://openalex.org/C160086991","wikidata":"https://www.wikidata.org/wiki/Q5939193","display_name":"Human visual system model","level":3,"score":0.4415999948978424},{"id":"https://openalex.org/C78548338","wikidata":"https://www.wikidata.org/wiki/Q2493","display_name":"Data compression","level":2,"score":0.4189999997615814},{"id":"https://openalex.org/C178253425","wikidata":"https://www.wikidata.org/wiki/Q162668","display_name":"Visual perception","level":3,"score":0.4081999957561493},{"id":"https://openalex.org/C2779227376","wikidata":"https://www.wikidata.org/wiki/Q6505497","display_name":"Layer (electronics)","level":2,"score":0.39410001039505005},{"id":"https://openalex.org/C55020928","wikidata":"https://www.wikidata.org/wiki/Q3813865","display_name":"Image quality","level":3,"score":0.3596000075340271},{"id":"https://openalex.org/C2779530757","wikidata":"https://www.wikidata.org/wiki/Q1207505","display_name":"Quality (philosophy)","level":2,"score":0.3425000011920929},{"id":"https://openalex.org/C5339829","wikidata":"https://www.wikidata.org/wiki/Q1425977","display_name":"Machine vision","level":2,"score":0.3424000144004822},{"id":"https://openalex.org/C9417928","wikidata":"https://www.wikidata.org/wiki/Q1070689","display_name":"Image processing","level":3,"score":0.33500000834465027},{"id":"https://openalex.org/C57654395","wikidata":"https://www.wikidata.org/wiki/Q1097775","display_name":"Compression artifact","level":5,"score":0.31220000982284546},{"id":"https://openalex.org/C64876066","wikidata":"https://www.wikidata.org/wiki/Q5141226","display_name":"Cognitive neuroscience of visual object recognition","level":3,"score":0.30869999527931213},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.30480000376701355},{"id":"https://openalex.org/C180016635","wikidata":"https://www.wikidata.org/wiki/Q2712821","display_name":"Compression (physics)","level":2,"score":0.302700012922287},{"id":"https://openalex.org/C2780103172","wikidata":"https://www.wikidata.org/wiki/Q1309721","display_name":"Visual Objects","level":3,"score":0.28839999437332153},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.2694999873638153},{"id":"https://openalex.org/C141379421","wikidata":"https://www.wikidata.org/wiki/Q6094427","display_name":"Iterative reconstruction","level":2,"score":0.26030001044273376},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.259799987077713}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/vcip67698.2025.11396859","is_oa":false,"landing_page_url":"https://doi.org/10.1109/vcip67698.2025.11396859","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Conference on Visual Communications and Image Processing (VCIP)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320306076","display_name":"National Science Foundation","ror":"https://ror.org/021nxhr62"}],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":28,"referenced_works":["https://openalex.org/W639708223","https://openalex.org/W1861492603","https://openalex.org/W2963150697","https://openalex.org/W3035205678","https://openalex.org/W3090392341","https://openalex.org/W3160555381","https://openalex.org/W3160673571","https://openalex.org/W3186910762","https://openalex.org/W3195300140","https://openalex.org/W3202918664","https://openalex.org/W4211097769","https://openalex.org/W4223425316","https://openalex.org/W4288083516","https://openalex.org/W4317555366","https://openalex.org/W4323022458","https://openalex.org/W4360897350","https://openalex.org/W4360995494","https://openalex.org/W4384009260","https://openalex.org/W4390488855","https://openalex.org/W4390872385","https://openalex.org/W4391092988","https://openalex.org/W4393033207","https://openalex.org/W4400034410","https://openalex.org/W4401235869","https://openalex.org/W4401452460","https://openalex.org/W4402775363","https://openalex.org/W4402915971","https://openalex.org/W4406046518"],"related_works":[],"abstract_inverted_index":{"Image":[0],"compression":[1,20],"for":[2,31,58,98],"humans":[3],"and":[4,50,61,78,102],"machines":[5],"(ICHM)":[6],"requires":[7],"balancing":[8],"machine":[9,33],"vision":[10,34],"performance":[11],"with":[12],"human":[13],"visual":[14,51,70],"quality.":[15],"Recent":[16],"methods":[17],"introduce":[18],"text-assisted":[19],"to":[21,106],"improve":[22],"perceptual":[23],"quality,":[24],"but":[25],"they":[26],"often":[27],"lack":[28],"explicit":[29],"optimization":[30],"downstream":[32],"tasks.":[35],"To":[36],"address":[37],"this,":[38],"we":[39],"propose":[40],"a":[41],"novel":[42],"dual-layer":[43],"codec":[44],"that":[45,91],"jointly":[46],"considers":[47],"semantic":[48],"accuracy":[49],"fidelity.":[52],"The":[53],"base":[54],"layer":[55,68],"is":[56],"optimized":[57],"object":[59,100],"detection":[60,101],"encodes":[62],"semantic-aware":[63],"features,":[64],"while":[65],"the":[66,75],"enhancement":[67],"refines":[69],"quality":[71],"by":[72],"leveraging":[73],"both":[74,99],"base-layer":[76],"output":[77],"text":[79,84],"guidance":[80],"during":[81],"encoding\u2014without":[82],"requiring":[83],"at":[85],"decoding.":[86],"Experiments":[87],"on":[88],"COCO2017":[89],"demonstrate":[90],"our":[92],"method":[93],"achieves":[94],"superior":[95],"rate-accuracy":[96],"trade-offs":[97],"image":[103],"reconstruction":[104],"compared":[105],"prior":[107],"ICHM":[108],"methods.":[109]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-02-25T00:00:00"}
