{"id":"https://openalex.org/W7160987930","doi":"https://doi.org/10.48550/arxiv.2605.11760","title":"M$^4$-SAM: Multi-Modal Mixture-of-Experts with Memory-Augmented SAM for RGB-D Video Salient Object Detection","display_name":"M$^4$-SAM: Multi-Modal Mixture-of-Experts with Memory-Augmented SAM for RGB-D Video Salient Object Detection","publication_year":2026,"publication_date":"2026-05-12","ids":{"openalex":"https://openalex.org/W7160987930","doi":"https://doi.org/10.48550/arxiv.2605.11760"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.11760","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.11760","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.11760","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5136067984","display_name":"Jiyuan Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Jiyuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5100508669","display_name":"Jia Lin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lin, Jia","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136058218","display_name":"Xiaofei Zhou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhou, Xiaofei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136035044","display_name":"Runmin Cong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cong, Runmin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136012899","display_name":"Deyang Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Deyang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5136012799","display_name":"Zhi Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Zhi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11605","display_name":"Visual Attention and Saliency Detection","score":0.9919000267982483,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11605","display_name":"Visual Attention and Saliency Detection","score":0.9919000267982483,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10036","display_name":"Advanced Neural Network Applications","score":0.0034000000450760126,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10812","display_name":"Human Pose and Action Recognition","score":0.0006000000284984708,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/feature","display_name":"Feature (linguistics)","score":0.6557999849319458},{"id":"https://openalex.org/keywords/encoder","display_name":"Encoder","score":0.6014000177383423},{"id":"https://openalex.org/keywords/initialization","display_name":"Initialization","score":0.5482000112533569},{"id":"https://openalex.org/keywords/salient","display_name":"Salient","score":0.5221999883651733},{"id":"https://openalex.org/keywords/object-detection","display_name":"Object detection","score":0.5189999938011169},{"id":"https://openalex.org/keywords/pattern-recognition","display_name":"Pattern recognition (psychology)","score":0.5038999915122986},{"id":"https://openalex.org/keywords/object","display_name":"Object (grammar)","score":0.5030999779701233},{"id":"https://openalex.org/keywords/prior-probability","display_name":"Prior probability","score":0.5012000203132629},{"id":"https://openalex.org/keywords/encode","display_name":"ENCODE","score":0.4878999888896942},{"id":"https://openalex.org/keywords/convolutional-neural-network","display_name":"Convolutional neural network","score":0.4668000042438507}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8115000128746033},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.669700026512146},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.6557999849319458},{"id":"https://openalex.org/C118505674","wikidata":"https://www.wikidata.org/wiki/Q42586063","display_name":"Encoder","level":2,"score":0.6014000177383423},{"id":"https://openalex.org/C114466953","wikidata":"https://www.wikidata.org/wiki/Q6034165","display_name":"Initialization","level":2,"score":0.5482000112533569},{"id":"https://openalex.org/C2780719617","wikidata":"https://www.wikidata.org/wiki/Q1030752","display_name":"Salient","level":2,"score":0.5221999883651733},{"id":"https://openalex.org/C2776151529","wikidata":"https://www.wikidata.org/wiki/Q3045304","display_name":"Object detection","level":3,"score":0.5189999938011169},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.5038999915122986},{"id":"https://openalex.org/C2781238097","wikidata":"https://www.wikidata.org/wiki/Q175026","display_name":"Object (grammar)","level":2,"score":0.5030999779701233},{"id":"https://openalex.org/C177769412","wikidata":"https://www.wikidata.org/wiki/Q278090","display_name":"Prior probability","level":3,"score":0.5012000203132629},{"id":"https://openalex.org/C66746571","wikidata":"https://www.wikidata.org/wiki/Q1134833","display_name":"ENCODE","level":3,"score":0.4878999888896942},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.4814000129699707},{"id":"https://openalex.org/C81363708","wikidata":"https://www.wikidata.org/wiki/Q17084460","display_name":"Convolutional neural network","level":2,"score":0.4668000042438507},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.44119998812675476},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.41510000824928284},{"id":"https://openalex.org/C70437156","wikidata":"https://www.wikidata.org/wiki/Q7228652","display_name":"Pooling","level":2,"score":0.36579999327659607},{"id":"https://openalex.org/C59404180","wikidata":"https://www.wikidata.org/wiki/Q17013334","display_name":"Feature learning","level":2,"score":0.3578000068664551},{"id":"https://openalex.org/C52622490","wikidata":"https://www.wikidata.org/wiki/Q1026626","display_name":"Feature extraction","level":2,"score":0.34060001373291016},{"id":"https://openalex.org/C64876066","wikidata":"https://www.wikidata.org/wiki/Q5141226","display_name":"Cognitive neuroscience of visual object recognition","level":3,"score":0.3052999973297119},{"id":"https://openalex.org/C2780226545","wikidata":"https://www.wikidata.org/wiki/Q6888030","display_name":"Modality (human\u2013computer interaction)","level":2,"score":0.3052000105381012},{"id":"https://openalex.org/C83665646","wikidata":"https://www.wikidata.org/wiki/Q42139305","display_name":"Feature vector","level":2,"score":0.3043000102043152},{"id":"https://openalex.org/C32653426","wikidata":"https://www.wikidata.org/wiki/Q3813641","display_name":"Background subtraction","level":3,"score":0.29350000619888306},{"id":"https://openalex.org/C2776502983","wikidata":"https://www.wikidata.org/wiki/Q690182","display_name":"Contrast (vision)","level":2,"score":0.2808000147342682},{"id":"https://openalex.org/C159620131","wikidata":"https://www.wikidata.org/wiki/Q1938983","display_name":"Spatial analysis","level":2,"score":0.2797999978065491},{"id":"https://openalex.org/C45347329","wikidata":"https://www.wikidata.org/wiki/Q5166604","display_name":"Convolution (computer science)","level":3,"score":0.2777999937534332},{"id":"https://openalex.org/C64869954","wikidata":"https://www.wikidata.org/wiki/Q1859747","display_name":"False positive paradox","level":2,"score":0.27639999985694885},{"id":"https://openalex.org/C101814296","wikidata":"https://www.wikidata.org/wiki/Q5439685","display_name":"Feature model","level":3,"score":0.2630000114440918},{"id":"https://openalex.org/C168167062","wikidata":"https://www.wikidata.org/wiki/Q1117970","display_name":"Component (thermodynamics)","level":2,"score":0.2624000012874603},{"id":"https://openalex.org/C2776760102","wikidata":"https://www.wikidata.org/wiki/Q5139990","display_name":"Code (set theory)","level":3,"score":0.2587999999523163},{"id":"https://openalex.org/C89600930","wikidata":"https://www.wikidata.org/wiki/Q1423946","display_name":"Segmentation","level":2,"score":0.2565999925136566},{"id":"https://openalex.org/C2781122975","wikidata":"https://www.wikidata.org/wiki/Q16928266","display_name":"Semantic feature","level":2,"score":0.2533000111579895},{"id":"https://openalex.org/C144986985","wikidata":"https://www.wikidata.org/wiki/Q871236","display_name":"Hierarchical database model","level":2,"score":0.2531000077724457},{"id":"https://openalex.org/C163836022","wikidata":"https://www.wikidata.org/wiki/Q6771326","display_name":"Markov model","level":3,"score":0.2522999942302704}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.11760","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.11760","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.11760","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.11760","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/8","score":0.550619900226593,"display_name":"Decent work and economic growth"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"The":[0],"Segment":[1],"Anything":[2],"Model":[3],"2":[4],"(SAM2)":[5],"has":[6,22],"emerged":[7],"as":[8,161],"a":[9,107,152,156,162],"foundation":[10],"model":[11],"for":[12,110],"universal":[13],"segmentation.":[14],"Owing":[15],"to":[16,26,33,100,135,143,167],"its":[17],"generalizable":[18],"visual":[19],"representations,":[20],"SAM2":[21,32,80],"been":[23],"successfully":[24],"applied":[25],"various":[27],"downstream":[28],"tasks.":[29],"However,":[30],"extending":[31],"the":[34,68,169,178],"RGB-D":[35,188],"video":[36],"salient":[37],"object":[38],"detection":[39],"(RGB-D":[40],"VSOD)":[41],"task":[42],"encounters":[43],"three":[44,186],"challenges":[45],"including":[46],"limited":[47],"spatial":[48,103,137],"modeling":[49],"of":[50,55,61],"linear":[51],"LoRA,":[52],"insufficient":[53],"employment":[54],"SAM's":[56],"multi-scale":[57,127],"features,":[58],"and":[59,87,105,139,165],"dependence":[60],"initialization":[62],"on":[63,185],"explicit":[64],"prompts.":[65],"To":[66],"address":[67],"issues,":[69],"we":[70,92,118,150],"present":[71],"Multi-Modal":[72],"Mixture-of-Experts":[73],"with":[74,81,130],"Memory-Augmented":[75],"SAM":[76],"(M$^4$-SAM),":[77],"which":[78,96,124],"equips":[79],"modality-related":[82],"PEFT,":[83],"hierarchical":[84],"feature":[85],"fusion,":[86],"prompt-free":[88],"memory":[89,170],"initialization.":[90],"Firstly,":[91],"inject":[93],"Modality-Aware":[94],"MoE-LORA,":[95],"employs":[97],"convolutional":[98],"experts":[99],"encode":[101],"local":[102],"priors":[104],"introduces":[106],"modality":[108],"dispatcher":[109],"efficient":[111],"multi-modal":[112],"fine-tuning,":[113],"into":[114],"SAM2's":[115],"encoder.":[116],"Secondly,":[117],"deploy":[119],"Gated":[120],"Multi-Level":[121],"Feature":[122],"Fusion,":[123],"hierarchically":[125],"aggregates":[126],"encoder":[128],"features":[129],"an":[131],"adaptive":[132],"gating":[133],"mechanism,":[134],"balance":[136],"details":[138],"semantic":[140],"context.":[141],"Finally,":[142],"conduct":[144],"zero-shot":[145],"VSOD":[146,189],"without":[147],"manual":[148],"prompts,":[149],"utilize":[151],"Pseudo-Guided":[153],"Initialization,":[154],"where":[155],"coarse":[157],"mask":[158],"is":[159],"regarded":[160],"pseudo":[163],"prior":[164],"used":[166],"bootstrap":[168],"bank.":[171],"Extensive":[172],"experiments":[173],"demonstrate":[174],"that":[175],"M$^4$-SAM":[176],"achieves":[177],"state-of-the-art":[179],"performance":[180],"across":[181],"all":[182],"evaluation":[183],"metrics":[184],"public":[187],"datasets.":[190]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-05-14T00:00:00"}
