{"id":"https://openalex.org/W7164040294","doi":"https://doi.org/10.48550/arxiv.2606.09082","title":"Teach Multimodal Recommendation Model to See via Personalized Visual Extraction and Adaptive Learning","display_name":"Teach Multimodal Recommendation Model to See via Personalized Visual Extraction and Adaptive Learning","publication_year":2026,"publication_date":"2026-06-08","ids":{"openalex":"https://openalex.org/W7164040294","doi":"https://doi.org/10.48550/arxiv.2606.09082"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.09082","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.09082","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.09082","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5138206583","display_name":"Yutong Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Yutong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138239661","display_name":"Xinyi Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Xinyi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138212404","display_name":"Ziyi Ye","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ye, Ziyi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138251545","display_name":"Daoguo Dong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Dong, Daoguo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5138225456","display_name":"Yu-Gang Jiang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jiang, Yu-gang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.6589999794960022,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.6589999794960022,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10203","display_name":"Recommender Systems and Techniques","score":0.2004999965429306,"subfield":{"id":"https://openalex.org/subfields/1710","display_name":"Information Systems"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11605","display_name":"Visual Attention and Saliency Detection","score":0.01080000028014183,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/visual-learning","display_name":"Visual learning","score":0.6158999800682068},{"id":"https://openalex.org/keywords/representation","display_name":"Representation (politics)","score":0.5426999926567078},{"id":"https://openalex.org/keywords/encoder","display_name":"Encoder","score":0.4867999851703644},{"id":"https://openalex.org/keywords/feature-learning","display_name":"Feature learning","score":0.4726000130176544},{"id":"https://openalex.org/keywords/code","display_name":"Code (set theory)","score":0.461899995803833},{"id":"https://openalex.org/keywords/visualization","display_name":"Visualization","score":0.4350000023841858},{"id":"https://openalex.org/keywords/adaptive-learning","display_name":"Adaptive learning","score":0.39100000262260437},{"id":"https://openalex.org/keywords/feature-extraction","display_name":"Feature extraction","score":0.3273000121116638}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8209999799728394},{"id":"https://openalex.org/C2779321571","wikidata":"https://www.wikidata.org/wiki/Q7936605","display_name":"Visual learning","level":2,"score":0.6158999800682068},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6072999835014343},{"id":"https://openalex.org/C2776359362","wikidata":"https://www.wikidata.org/wiki/Q2145286","display_name":"Representation (politics)","level":3,"score":0.5426999926567078},{"id":"https://openalex.org/C118505674","wikidata":"https://www.wikidata.org/wiki/Q42586063","display_name":"Encoder","level":2,"score":0.4867999851703644},{"id":"https://openalex.org/C59404180","wikidata":"https://www.wikidata.org/wiki/Q17013334","display_name":"Feature learning","level":2,"score":0.4726000130176544},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4668000042438507},{"id":"https://openalex.org/C2776760102","wikidata":"https://www.wikidata.org/wiki/Q5139990","display_name":"Code (set theory)","level":3,"score":0.461899995803833},{"id":"https://openalex.org/C36464697","wikidata":"https://www.wikidata.org/wiki/Q451553","display_name":"Visualization","level":2,"score":0.4350000023841858},{"id":"https://openalex.org/C125014702","wikidata":"https://www.wikidata.org/wiki/Q4680749","display_name":"Adaptive learning","level":2,"score":0.39100000262260437},{"id":"https://openalex.org/C52622490","wikidata":"https://www.wikidata.org/wiki/Q1026626","display_name":"Feature extraction","level":2,"score":0.3273000121116638},{"id":"https://openalex.org/C2780226545","wikidata":"https://www.wikidata.org/wiki/Q6888030","display_name":"Modality (human\u2013computer interaction)","level":2,"score":0.3255000114440918},{"id":"https://openalex.org/C2776502983","wikidata":"https://www.wikidata.org/wiki/Q690182","display_name":"Contrast (vision)","level":2,"score":0.3249000012874603},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.3224000036716461},{"id":"https://openalex.org/C101738243","wikidata":"https://www.wikidata.org/wiki/Q786435","display_name":"Autoencoder","level":3,"score":0.29809999465942383},{"id":"https://openalex.org/C195807954","wikidata":"https://www.wikidata.org/wiki/Q1662562","display_name":"Information extraction","level":2,"score":0.2888000011444092},{"id":"https://openalex.org/C178253425","wikidata":"https://www.wikidata.org/wiki/Q162668","display_name":"Visual perception","level":3,"score":0.2858999967575073},{"id":"https://openalex.org/C120936955","wikidata":"https://www.wikidata.org/wiki/Q2155640","display_name":"Empirical research","level":2,"score":0.2712000012397766},{"id":"https://openalex.org/C557471498","wikidata":"https://www.wikidata.org/wiki/Q554950","display_name":"Recommender system","level":2,"score":0.2687000036239624},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.2644999921321869},{"id":"https://openalex.org/C160086991","wikidata":"https://www.wikidata.org/wiki/Q5939193","display_name":"Human visual system model","level":3,"score":0.2614000141620636},{"id":"https://openalex.org/C2780910867","wikidata":"https://www.wikidata.org/wiki/Q1952416","display_name":"Multimodality","level":2,"score":0.25609999895095825}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.09082","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.09082","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.09082","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.09082","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/4","display_name":"Quality Education","score":0.7949573993682861}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Multimodal":[0,69],"sequential":[1],"recommendation":[2,11,97,141],"(MSR)":[3],"incorporates":[4],"textual":[5,32],"and":[6,16,52,78,90,114,133,158],"visual":[7,22,42,87,109,122,156,160],"information":[8],"to":[9,38,48,72,124,154],"improve":[10],"quality.":[12],"However,":[13],"recent":[14],"studies":[15],"our":[17],"empirical":[18],"analysis":[19,144],"show":[20],"that":[21,85,137,146],"features":[23,57],"are":[24],"often":[25],"underutilized,":[26],"thereby":[27],"contributing":[28],"far":[29],"less":[30],"than":[31],"signals.":[33],"We":[34],"attribute":[35],"this":[36],"issue":[37],"two":[39],"factors:":[40],"insufficient":[41],"representation":[43,88],"learning":[44,60,89,123],"(pretrained":[45],"encoders":[46],"fail":[47],"capture":[49],"preference-relevant":[50,155],"cues)":[51],"unbalanced":[53],"visual-text":[54],"optimization":[55,92],"(textual":[56],"dominate":[58],"the":[59,95],"process).":[61],"To":[62],"address":[63],"these":[64,147],"issues,":[65],"we":[66],"propose":[67],"Teach":[68],"Recommendation":[70],"Model":[71],"See":[73],"via":[74],"Personalized":[75],"Visual":[76,103,116],"Extraction":[77,104],"Adaptive":[79,115],"Learning":[80,117],"(REVEAL),":[81],"a":[82],"plug-and-play":[83],"framework":[84],"enhances":[86],"cross-modal":[91],"without":[93],"modifying":[94],"original":[96],"backbone.":[98],"REVEAL":[99,138],"consists":[100],"of":[101],"Feedback-Guided":[102],"(FVE),":[105],"which":[106,119],"refines":[107],"prompt-guided":[108],"extraction":[110],"through":[111],"task-level":[112],"feedback,":[113],"(AVL),":[118],"dynamically":[120],"reweights":[121],"alleviate":[125],"modality":[126],"imbalance.":[127],"Experiments":[128],"on":[129],"multiple":[130],"real-world":[131],"datasets":[132],"MSR":[134],"backbones":[135],"demonstrate":[136],"consistently":[139],"improves":[140],"performance.":[142],"Further":[143],"shows":[145],"gains":[148],"arise":[149],"from":[150],"more":[151],"effective":[152],"attention":[153],"regions":[157],"better":[159],"utilization":[161],"during":[162],"training.":[163],"The":[164],"code":[165],"is":[166],"available":[167],"at":[168],"https://github.com/YutongLi2024/REVEAL.":[169]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-06-10T00:00:00"}
