{"id":"https://openalex.org/W7156650203","doi":"https://doi.org/10.48550/arxiv.2604.24123","title":"FDIM: A Feature-distance-based Generic Video Quality Metric for Versatile Codecs","display_name":"FDIM: A Feature-distance-based Generic Video Quality Metric for Versatile Codecs","publication_year":2026,"publication_date":"2026-04-27","ids":{"openalex":"https://openalex.org/W7156650203","doi":"https://doi.org/10.48550/arxiv.2604.24123"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.24123","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.24123","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.24123","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5134788511","display_name":"Jiayi Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Jiayi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134805870","display_name":"Lichun Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Lichun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5055754338","display_name":"Xiaoqi Zhuang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhuang, Xiaoqi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134814030","display_name":"Jiaqi Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Jiaqi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5134811822","display_name":"Lu Yu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yu, Lu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5134809253","display_name":"Yin Zhao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhao, Yin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11165","display_name":"Image and Video Quality Assessment","score":0.9736999869346619,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11165","display_name":"Image and Video Quality Assessment","score":0.9736999869346619,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11019","display_name":"Image Enhancement Techniques","score":0.010900000110268593,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11605","display_name":"Visual Attention and Saliency Detection","score":0.005100000184029341,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/codec","display_name":"Codec","score":0.8866999745368958},{"id":"https://openalex.org/keywords/video-quality","display_name":"Video quality","score":0.5092999935150146},{"id":"https://openalex.org/keywords/feature","display_name":"Feature (linguistics)","score":0.49900001287460327},{"id":"https://openalex.org/keywords/coding","display_name":"Coding (social sciences)","score":0.48980000615119934},{"id":"https://openalex.org/keywords/data-compression","display_name":"Data compression","score":0.4706999957561493},{"id":"https://openalex.org/keywords/metric","display_name":"Metric (unit)","score":0.45239999890327454},{"id":"https://openalex.org/keywords/fidelity","display_name":"Fidelity","score":0.44940000772476196},{"id":"https://openalex.org/keywords/component","display_name":"Component (thermodynamics)","score":0.4075999855995178},{"id":"https://openalex.org/keywords/video-compression-picture-types","display_name":"Video compression picture types","score":0.3840999901294708},{"id":"https://openalex.org/keywords/video-tracking","display_name":"Video tracking","score":0.3571000099182129}],"concepts":[{"id":"https://openalex.org/C161765866","wikidata":"https://www.wikidata.org/wiki/Q184748","display_name":"Codec","level":2,"score":0.8866999745368958},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.828499972820282},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5540000200271606},{"id":"https://openalex.org/C103910844","wikidata":"https://www.wikidata.org/wiki/Q2631256","display_name":"Video quality","level":3,"score":0.5092999935150146},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.49900001287460327},{"id":"https://openalex.org/C179518139","wikidata":"https://www.wikidata.org/wiki/Q5140297","display_name":"Coding (social sciences)","level":2,"score":0.48980000615119934},{"id":"https://openalex.org/C78548338","wikidata":"https://www.wikidata.org/wiki/Q2493","display_name":"Data compression","level":2,"score":0.4706999957561493},{"id":"https://openalex.org/C176217482","wikidata":"https://www.wikidata.org/wiki/Q860554","display_name":"Metric (unit)","level":2,"score":0.45239999890327454},{"id":"https://openalex.org/C2776459999","wikidata":"https://www.wikidata.org/wiki/Q2119376","display_name":"Fidelity","level":2,"score":0.44940000772476196},{"id":"https://openalex.org/C168167062","wikidata":"https://www.wikidata.org/wiki/Q1117970","display_name":"Component (thermodynamics)","level":2,"score":0.4075999855995178},{"id":"https://openalex.org/C106030495","wikidata":"https://www.wikidata.org/wiki/Q1797012","display_name":"Video compression picture types","level":4,"score":0.3840999901294708},{"id":"https://openalex.org/C202474056","wikidata":"https://www.wikidata.org/wiki/Q1931635","display_name":"Video tracking","level":3,"score":0.3571000099182129},{"id":"https://openalex.org/C118505674","wikidata":"https://www.wikidata.org/wiki/Q42586063","display_name":"Encoder","level":2,"score":0.3531999886035919},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.35280001163482666},{"id":"https://openalex.org/C52622490","wikidata":"https://www.wikidata.org/wiki/Q1026626","display_name":"Feature extraction","level":2,"score":0.3522999882698059},{"id":"https://openalex.org/C23431618","wikidata":"https://www.wikidata.org/wiki/Q1404672","display_name":"Multiview Video Coding","level":4,"score":0.35100001096725464},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.3467999994754791},{"id":"https://openalex.org/C43126263","wikidata":"https://www.wikidata.org/wiki/Q128751","display_name":"Source code","level":2,"score":0.34439998865127563},{"id":"https://openalex.org/C2779530757","wikidata":"https://www.wikidata.org/wiki/Q1207505","display_name":"Quality (philosophy)","level":2,"score":0.3416999876499176},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.3346000015735626},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.3334999978542328},{"id":"https://openalex.org/C65483669","wikidata":"https://www.wikidata.org/wiki/Q3536669","display_name":"Video processing","level":2,"score":0.3052000105381012},{"id":"https://openalex.org/C81363708","wikidata":"https://www.wikidata.org/wiki/Q17084460","display_name":"Convolutional neural network","level":2,"score":0.2888000011444092},{"id":"https://openalex.org/C114227958","wikidata":"https://www.wikidata.org/wiki/Q7631422","display_name":"Subjective video quality","level":4,"score":0.2888000011444092},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.28690001368522644},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.2768999934196472},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.27070000767707825},{"id":"https://openalex.org/C169903167","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Test set","level":2,"score":0.2687999904155731},{"id":"https://openalex.org/C115051666","wikidata":"https://www.wikidata.org/wiki/Q6522493","display_name":"Ranging","level":2,"score":0.26489999890327454},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.2639000117778778},{"id":"https://openalex.org/C57273362","wikidata":"https://www.wikidata.org/wiki/Q576722","display_name":"Decoding methods","level":2,"score":0.2590000033378601},{"id":"https://openalex.org/C2776760102","wikidata":"https://www.wikidata.org/wiki/Q5139990","display_name":"Code (set theory)","level":3,"score":0.2587999999523163}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.24123","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.24123","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.24123","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.24123","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Video":[0],"technology":[1],"is":[2],"advancing":[3],"toward":[4],"Ultra":[5],"High":[6,10],"Definition":[7],"(UHD)":[8],"and":[9,40,57,67,91,100,117,123,134,150,195,220,231],"Dynamic":[11],"Range":[12],"(HDR),":[13],"which":[14,60],"intensifies":[15],"the":[16,45,159,232],"need":[17],"for":[18,22,70,114,229],"higher":[19],"compression":[20],"efficiency":[21],"these":[23],"high-specification":[24],"videos.":[25],"Beyond":[26],"advances":[27],"in":[28],"traditional":[29,71,116,190],"codecs,":[30,88],"neural":[31,118,199],"video":[32,72,97,111,119,186,193,200],"codecs":[33,66,120,194,213],"(NVCs)":[34],"have":[35,41],"attracted":[36],"significant":[37],"research":[38,99],"attention":[39],"evolved":[42],"rapidly":[43],"over":[44,184],"past":[46],"few":[47],"years.":[48],"The":[49,137,226],"coding":[50],"artifacts":[51],"of":[52,64,183],"NVCs":[53],"often":[54],"exhibit":[55],"content-varying":[56],"generative":[58],"characteristics,":[59],"differ":[61],"from":[62,148],"those":[63],"conventional":[65],"are":[68,82],"challenging":[69],"quality":[73,112,178],"assessment":[74,179],"(VQA)":[75],"methods":[76],"to":[77,84,94,144,154,167],"capture.":[78],"Therefore,":[79],"VQA":[80,207],"metrics":[81],"required":[83],"generalize":[85],"across":[86,121],"different":[87],"content":[89],"types,":[90],"dynamic":[92],"ranges":[93],"better":[95],"support":[96],"codec":[98],"evaluation.":[101],"In":[102],"this":[103],"paper,":[104],"we":[105],"propose":[106],"FDIM,":[107],"a":[108,128,175],"feature-distance-based":[109],"generic":[110],"metric":[113],"both":[115],"SDR":[122],"HDR":[124],"formats.":[125],"FDIM":[126,173,216,230],"employs":[127],"hybrid":[129,192],"architecture":[130],"that":[131,215],"integrates":[132],"deep":[133,138],"hand-crafted":[135,160],"features.":[136],"feature":[139,161],"component":[140,162],"learns":[141],"multi-scale":[142],"representations":[143],"capture":[145],"distortions":[146],"ranging":[147],"structural":[149],"textural":[151],"fidelity":[152],"degradation":[153],"high-level":[155],"semantic":[156],"deviations,":[157],"while":[158],"provides":[163],"stable":[164],"complementary":[165],"cues":[166],"improve":[168],"overall":[169],"generalization.":[170],"We":[171],"trained":[172],"on":[174,204],"large-scale":[176],"subjective":[177,224],"dataset":[180],"(DCVQA)":[181],"consisting":[182],"16k":[185],"sequences":[187],"encoded":[188],"by":[189],"block-based":[191],"end-to-end":[196],"perceptually":[197],"optimized":[198],"codecs.":[201],"Extensive":[202],"experiments":[203],"ten":[205],"SDR/HDR":[206],"datasets":[208],"containing":[209],"diverse,":[210],"previously":[211],"unseen":[212],"demonstrate":[214],"achieves":[217],"strong":[218],"generalization":[219],"high":[221],"correlation":[222],"with":[223],"assessment.":[225],"source":[227],"code":[228],"DCVQA":[233],"validation":[234],"set":[235],"will":[236],"be":[237],"released":[238],"at":[239],"https://github.com/MCL-ZJU/FDIM.":[240]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-04-29T00:00:00"}
