{"id":"https://openalex.org/W7131297062","doi":"https://doi.org/10.1109/vcip67698.2025.11396819","title":"DiffVC-OSD: One-Step Diffusion-based Perceptual Neural Video Compression Framework","display_name":"DiffVC-OSD: One-Step Diffusion-based Perceptual Neural Video Compression Framework","publication_year":2025,"publication_date":"2025-12-01","ids":{"openalex":"https://openalex.org/W7131297062","doi":"https://doi.org/10.1109/vcip67698.2025.11396819"},"language":null,"primary_location":{"id":"doi:10.1109/vcip67698.2025.11396819","is_oa":false,"landing_page_url":"https://doi.org/10.1109/vcip67698.2025.11396819","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Conference on Visual Communications and Image Processing (VCIP)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5126660378","display_name":"Wenzhuo Ma","orcid":null},"institutions":[{"id":"https://openalex.org/I37461747","display_name":"Wuhan University","ror":"https://ror.org/033vjfk17","country_code":"CN","type":"education","lineage":["https://openalex.org/I37461747"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Wenzhuo Ma","raw_affiliation_strings":["Wuhan University,School of Remote Sensing and Information Engineering,Wuhan,China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Wuhan University,School of Remote Sensing and Information Engineering,Wuhan,China","institution_ids":["https://openalex.org/I37461747"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5126735673","display_name":"Zhenzhong Chen","orcid":null},"institutions":[{"id":"https://openalex.org/I37461747","display_name":"Wuhan University","ror":"https://ror.org/033vjfk17","country_code":"CN","type":"education","lineage":["https://openalex.org/I37461747"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Zhenzhong Chen","raw_affiliation_strings":["Wuhan University,School of Remote Sensing and Information Engineering,Wuhan,China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Wuhan University,School of Remote Sensing and Information Engineering,Wuhan,China","institution_ids":["https://openalex.org/I37461747"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I37461747"],"apc_list":null,"apc_paid":null,"fwci":1.4136,"has_fulltext":false,"cited_by_count":1,"citation_normalized_percentile":{"value":0.88032718,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":94,"max":97},"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"5"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10901","display_name":"Advanced Data Compression Techniques","score":0.29750001430511475,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10901","display_name":"Advanced Data Compression Techniques","score":0.29750001430511475,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10741","display_name":"Video Coding and Compression Technologies","score":0.22190000116825104,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11165","display_name":"Image and Video Quality Assessment","score":0.17389999330043793,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/leverage","display_name":"Leverage (statistics)","score":0.6007999777793884},{"id":"https://openalex.org/keywords/data-compression","display_name":"Data compression","score":0.5633000135421753},{"id":"https://openalex.org/keywords/perception","display_name":"Perception","score":0.49540001153945923},{"id":"https://openalex.org/keywords/compression","display_name":"Compression (physics)","score":0.4453999996185303},{"id":"https://openalex.org/keywords/compression-artifact","display_name":"Compression artifact","score":0.4424000084400177},{"id":"https://openalex.org/keywords/decoding-methods","display_name":"Decoding methods","score":0.4361000061035156},{"id":"https://openalex.org/keywords/context","display_name":"Context (archaeology)","score":0.4187000095844269},{"id":"https://openalex.org/keywords/video-denoising","display_name":"Video denoising","score":0.40400001406669617}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7623999714851379},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6496999859809875},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.6007999777793884},{"id":"https://openalex.org/C78548338","wikidata":"https://www.wikidata.org/wiki/Q2493","display_name":"Data compression","level":2,"score":0.5633000135421753},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.49950000643730164},{"id":"https://openalex.org/C26760741","wikidata":"https://www.wikidata.org/wiki/Q160402","display_name":"Perception","level":2,"score":0.49540001153945923},{"id":"https://openalex.org/C180016635","wikidata":"https://www.wikidata.org/wiki/Q2712821","display_name":"Compression (physics)","level":2,"score":0.4453999996185303},{"id":"https://openalex.org/C57654395","wikidata":"https://www.wikidata.org/wiki/Q1097775","display_name":"Compression artifact","level":5,"score":0.4424000084400177},{"id":"https://openalex.org/C57273362","wikidata":"https://www.wikidata.org/wiki/Q576722","display_name":"Decoding methods","level":2,"score":0.4361000061035156},{"id":"https://openalex.org/C2779343474","wikidata":"https://www.wikidata.org/wiki/Q3109175","display_name":"Context (archaeology)","level":2,"score":0.4187000095844269},{"id":"https://openalex.org/C30814859","wikidata":"https://www.wikidata.org/wiki/Q4119603","display_name":"Video denoising","level":5,"score":0.40400001406669617},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.37049999833106995},{"id":"https://openalex.org/C183322885","wikidata":"https://www.wikidata.org/wiki/Q17007702","display_name":"Context model","level":3,"score":0.3626999855041504},{"id":"https://openalex.org/C163294075","wikidata":"https://www.wikidata.org/wiki/Q581861","display_name":"Noise reduction","level":2,"score":0.35089999437332153},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.32330000400543213},{"id":"https://openalex.org/C2776359362","wikidata":"https://www.wikidata.org/wiki/Q2145286","display_name":"Representation (politics)","level":3,"score":0.32199999690055847},{"id":"https://openalex.org/C106030495","wikidata":"https://www.wikidata.org/wiki/Q1797012","display_name":"Video compression picture types","level":4,"score":0.31360000371932983},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.2809999883174896},{"id":"https://openalex.org/C25797200","wikidata":"https://www.wikidata.org/wiki/Q828137","display_name":"Compression ratio","level":3,"score":0.2694999873638153},{"id":"https://openalex.org/C94835093","wikidata":"https://www.wikidata.org/wiki/Q3113333","display_name":"Data compression ratio","level":5,"score":0.26660001277923584},{"id":"https://openalex.org/C143184774","wikidata":"https://www.wikidata.org/wiki/Q3020846","display_name":"Deblocking filter","level":2,"score":0.25130000710487366}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/vcip67698.2025.11396819","is_oa":false,"landing_page_url":"https://doi.org/10.1109/vcip67698.2025.11396819","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Conference on Visual Communications and Image Processing (VCIP)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320321001","display_name":"National Natural Science Foundation of China","ror":"https://ror.org/01h0zpd94"}],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":17,"referenced_works":["https://openalex.org/W1580389772","https://openalex.org/W2146395539","https://openalex.org/W2511458122","https://openalex.org/W2769654144","https://openalex.org/W2962785568","https://openalex.org/W3017136408","https://openalex.org/W3031546776","https://openalex.org/W3200120316","https://openalex.org/W4285483958","https://openalex.org/W4285604424","https://openalex.org/W4312774595","https://openalex.org/W4312933868","https://openalex.org/W4386065808","https://openalex.org/W4390873054","https://openalex.org/W4402772372","https://openalex.org/W4413144600","https://openalex.org/W4413332241"],"related_works":[],"abstract_inverted_index":{"In":[0],"this":[1],"work,":[2],"we":[3,54,76],"first":[4],"propose":[5],"DiffVC-OSD,":[6],"a":[7,28,36,56],"One-Step":[8,29],"Diffusion-based":[9],"Perceptual":[10],"Neural":[11],"Video":[12],"Compression":[13],"framework.":[14],"Unlike":[15],"conventional":[16],"multi-step":[17],"diffusion-based":[18,112],"methods,":[19],"DiffVC-OSD":[20,91],"feeds":[21],"the":[22,46,72,109],"reconstructed":[23],"latent":[24,47],"representation":[25],"directly":[26],"into":[27,64],"Diffusion":[30],"Model,":[31],"enhancing":[32],"perceptual":[33,94],"quality":[34],"through":[35],"single":[37],"diffusion":[38],"step":[39],"guided":[40],"by":[41],"both":[42],"temporal":[43,52],"context":[44],"and":[45,102],"itself.":[48],"To":[49],"better":[50],"leverage":[51],"dependencies,":[53],"design":[55],"Temporal":[57],"Context":[58],"Adapter":[59],"that":[60,90],"encodes":[61],"conditional":[62],"inputs":[63],"multi-level":[65],"features,":[66],"offering":[67],"more":[68],"fine-grained":[69],"guidance":[70],"for":[71],"Denoising":[73],"Unet.":[74],"Additionally,":[75],"employ":[77],"an":[78,103],"End-to-End":[79],"Finetuning":[80],"strategy":[81],"to":[82,108],"improve":[83],"overall":[84],"compression":[85,95],"performance.":[86],"Extensive":[87],"experiments":[88],"demonstrate":[89],"achieves":[92],"state-of-the-art":[93],"performance,":[96],"offers":[97],"about":[98],"20\u00d7":[99],"faster":[100],"decoding":[101],"86.92%":[104],"bitrate":[105],"reduction":[106],"compared":[107],"corresponding":[110],"multistep":[111],"variant.":[113]},"counts_by_year":[{"year":2026,"cited_by_count":1}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-02-25T00:00:00"}
