{"id":"https://openalex.org/W7171872980","doi":"https://doi.org/10.48550/arxiv.2607.26596","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","display_name":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","publication_year":2026,"publication_date":"2026-07-29","ids":{"openalex":"https://openalex.org/W7171872980","doi":"https://doi.org/10.48550/arxiv.2607.26596"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2607.26596","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.26596","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2607.26596","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5144025793","display_name":"Mingkuan Feng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Feng, Mingkuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5143996787","display_name":"Zhengqi Wen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wen, Zhengqi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5144012101","display_name":"Jianhua Tao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tao, Jianhua","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.8600000143051147,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.8600000143051147,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10036","display_name":"Advanced Neural Network Applications","score":0.01810000091791153,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10775","display_name":"Generative Adversarial Networks and Image Synthesis","score":0.01590000092983246,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/transformer","display_name":"Transformer","score":0.8051000237464905},{"id":"https://openalex.org/keywords/security-token","display_name":"Security token","score":0.609499990940094},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.47049999237060547},{"id":"https://openalex.org/keywords/block","display_name":"Block (permutation group theory)","score":0.39469999074935913},{"id":"https://openalex.org/keywords/decoding-methods","display_name":"Decoding methods","score":0.3822000026702881},{"id":"https://openalex.org/keywords/visual-processing","display_name":"Visual processing","score":0.2890999913215637}],"concepts":[{"id":"https://openalex.org/C66322947","wikidata":"https://www.wikidata.org/wiki/Q11658","display_name":"Transformer","level":3,"score":0.8051000237464905},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7684000134468079},{"id":"https://openalex.org/C48145219","wikidata":"https://www.wikidata.org/wiki/Q1335365","display_name":"Security token","level":2,"score":0.609499990940094},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.48989999294281006},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.47049999237060547},{"id":"https://openalex.org/C2777210771","wikidata":"https://www.wikidata.org/wiki/Q4927124","display_name":"Block (permutation group theory)","level":2,"score":0.39469999074935913},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.3828999996185303},{"id":"https://openalex.org/C57273362","wikidata":"https://www.wikidata.org/wiki/Q576722","display_name":"Decoding methods","level":2,"score":0.3822000026702881},{"id":"https://openalex.org/C2778251979","wikidata":"https://www.wikidata.org/wiki/Q7936617","display_name":"Visual processing","level":3,"score":0.2890999913215637},{"id":"https://openalex.org/C36464697","wikidata":"https://www.wikidata.org/wiki/Q451553","display_name":"Visualization","level":2,"score":0.28839999437332153},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.2874999940395355},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.2777000069618225},{"id":"https://openalex.org/C2776359362","wikidata":"https://www.wikidata.org/wiki/Q2145286","display_name":"Representation (politics)","level":3,"score":0.2612999975681305},{"id":"https://openalex.org/C44291984","wikidata":"https://www.wikidata.org/wiki/Q1074173","display_name":"Question answering","level":2,"score":0.25519999861717224},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.25189998745918274},{"id":"https://openalex.org/C178253425","wikidata":"https://www.wikidata.org/wiki/Q162668","display_name":"Visual perception","level":3,"score":0.251800000667572}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2607.26596","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.26596","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2607.26596","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.26596","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Quality Education","score":0.6354544758796692,"id":"https://metadata.un.org/sdg/4"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Multimodal":[0],"large":[1],"language":[2,139],"models":[3,26],"(MLLMs)":[4],"have":[5],"demonstrated":[6],"remarkable":[7],"capabilities":[8],"by":[9],"integrating":[10],"visual":[11,28,42,89,104,110,186],"and":[12,34,43,105,172],"textual":[13,44,106,122],"understanding":[14],"within":[15],"a":[16,75,79,115,178,195],"unified":[17],"transformer":[18,84,119,147],"architecture.":[19],"However,":[20],"fine-tuning":[21],"all":[22],"parameters":[23],"of":[24,52,74,100,155,180],"these":[25],"for":[27,41],"instruction":[29],"tuning":[30],"is":[31,149],"computationally":[32],"expensive":[33],"often":[35],"unnecessary,":[36],"as":[37],"the":[38,49,53,70,97,101,126,138,145,153,160,181],"representation":[39],"requirements":[40],"tokens":[45,107,111,123],"diverge":[46],"significantly":[47],"in":[48,188],"deeper":[50],"layers":[51,73],"network.":[54],"In":[55],"this":[56],"paper,":[57],"we":[58],"propose":[59],"Decoupled":[60],"Visual":[61],"Processing":[62],"(DVP),":[63],"an":[64],"efficient":[65],"training":[66,176],"framework":[67,162],"that":[68,164,185],"replaces":[69],"upper":[71],"decoder":[72,102,129],"pretrained":[76],"LLM":[77],"with":[78],"lightweight,":[80],"independently":[81],"trainable":[82,156],"single":[83,118,146],"block":[85,120,148],"dedicated":[86],"exclusively":[87],"to":[88],"token":[90],"processing.":[91],"Specifically,":[92],"after":[93],"shared":[94],"processing":[95],"through":[96,114,125,194],"first":[98],"half":[99],"layers,":[103],"are":[108,112,134],"split:":[109],"routed":[113],"newly":[116],"initialized":[117],"while":[121,175],"continue":[124],"original":[127],"frozen":[128],"layers.":[130],"The":[131],"two":[132],"streams":[133],"then":[135],"concatenated":[136],"before":[137],"modeling":[140],"head.":[141],"During":[142],"training,":[143],"only":[144,177],"updated,":[150],"dramatically":[151],"reducing":[152],"number":[154],"parameters.":[157],"Experiments":[158],"on":[159,169],"LLaVA-1.5":[161],"demonstrate":[163],"DVP":[165],"achieves":[166],"competitive":[167],"performance":[168],"MME,":[170],"POPE,":[171],"ChartQA":[173],"benchmarks":[174],"fraction":[179],"total":[182],"parameters,":[183],"suggesting":[184],"representations":[187],"MLLMs":[189],"can":[190],"be":[191],"effectively":[192],"learned":[193],"decoupled,":[196],"parameter-efficient":[197],"pathway.":[198]},"counts_by_year":[],"updated_date":"2026-07-31T08:31:51.225901","created_date":"2026-07-31T00:00:00"}
