{"id":"https://openalex.org/W7130581313","doi":"https://doi.org/10.48550/arxiv.2602.16590","title":"A Contrastive Learning Framework Empowered by Attention-based Feature Adaptation for Street-View Image Classification","display_name":"A Contrastive Learning Framework Empowered by Attention-based Feature Adaptation for Street-View Image Classification","publication_year":2026,"publication_date":"2026-02-18","ids":{"openalex":"https://openalex.org/W7130581313","doi":"https://doi.org/10.48550/arxiv.2602.16590"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2602.16590","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2602.16590","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2602.16590","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5126365589","display_name":"Qi You","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"You, Qi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5068421344","display_name":"Yitai Cheng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cheng, Yitai","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5126440192","display_name":"Zichao Zeng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zeng, Zichao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5146598087","display_name":"James Haworth","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Haworth, James","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10036","display_name":"Advanced Neural Network Applications","score":0.3725999891757965,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10036","display_name":"Advanced Neural Network Applications","score":0.3725999891757965,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.29260000586509705,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.05040000006556511,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/image","display_name":"Image (mathematics)","score":0.569100022315979},{"id":"https://openalex.org/keywords/contextual-image-classification","display_name":"Contextual image classification","score":0.5526000261306763},{"id":"https://openalex.org/keywords/feature","display_name":"Feature (linguistics)","score":0.5511000156402588},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.5285000205039978},{"id":"https://openalex.org/keywords/adaptation","display_name":"Adaptation (eye)","score":0.510699987411499},{"id":"https://openalex.org/keywords/bottleneck","display_name":"Bottleneck","score":0.5001000165939331},{"id":"https://openalex.org/keywords/pattern-recognition","display_name":"Pattern recognition (psychology)","score":0.44029998779296875},{"id":"https://openalex.org/keywords/code","display_name":"Code (set theory)","score":0.40049999952316284},{"id":"https://openalex.org/keywords/feature-extraction","display_name":"Feature extraction","score":0.397599995136261}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7965999841690063},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.642799973487854},{"id":"https://openalex.org/C115961682","wikidata":"https://www.wikidata.org/wiki/Q860623","display_name":"Image (mathematics)","level":2,"score":0.569100022315979},{"id":"https://openalex.org/C75294576","wikidata":"https://www.wikidata.org/wiki/Q5165192","display_name":"Contextual image classification","level":3,"score":0.5526000261306763},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.5511000156402588},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.5285000205039978},{"id":"https://openalex.org/C139807058","wikidata":"https://www.wikidata.org/wiki/Q352374","display_name":"Adaptation (eye)","level":2,"score":0.510699987411499},{"id":"https://openalex.org/C2780513914","wikidata":"https://www.wikidata.org/wiki/Q18210350","display_name":"Bottleneck","level":2,"score":0.5001000165939331},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.44029998779296875},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.43619999289512634},{"id":"https://openalex.org/C2776760102","wikidata":"https://www.wikidata.org/wiki/Q5139990","display_name":"Code (set theory)","level":3,"score":0.40049999952316284},{"id":"https://openalex.org/C52622490","wikidata":"https://www.wikidata.org/wiki/Q1026626","display_name":"Feature extraction","level":2,"score":0.397599995136261},{"id":"https://openalex.org/C188198153","wikidata":"https://www.wikidata.org/wiki/Q1613840","display_name":"Limiting","level":2,"score":0.38420000672340393},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.3682999908924103},{"id":"https://openalex.org/C77618280","wikidata":"https://www.wikidata.org/wiki/Q1155772","display_name":"Scheme (mathematics)","level":2,"score":0.34459999203681946},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.32089999318122864},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.3181999921798706},{"id":"https://openalex.org/C9417928","wikidata":"https://www.wikidata.org/wiki/Q1070689","display_name":"Image processing","level":3,"score":0.3158000111579895},{"id":"https://openalex.org/C124504099","wikidata":"https://www.wikidata.org/wiki/Q56933","display_name":"Image segmentation","level":3,"score":0.31130000948905945},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.2985000014305115},{"id":"https://openalex.org/C2776502983","wikidata":"https://www.wikidata.org/wiki/Q690182","display_name":"Contrast (vision)","level":2,"score":0.2833000123500824},{"id":"https://openalex.org/C2776151529","wikidata":"https://www.wikidata.org/wiki/Q3045304","display_name":"Object detection","level":3,"score":0.2808000147342682},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.2685999870300293},{"id":"https://openalex.org/C81363708","wikidata":"https://www.wikidata.org/wiki/Q17084460","display_name":"Convolutional neural network","level":2,"score":0.26109999418258667},{"id":"https://openalex.org/C89600930","wikidata":"https://www.wikidata.org/wiki/Q1423946","display_name":"Segmentation","level":2,"score":0.2565000057220459}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2602.16590","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2602.16590","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2602.16590","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2602.16590","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.8451811671257019,"display_name":"Sustainable cities and communities","id":"https://metadata.un.org/sdg/11"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Street-view":[0],"image":[1,10,49,61],"attribute":[2,123],"classification":[3,124],"is":[4,142],"a":[5,83,94],"vital":[6],"downstream":[7],"task":[8],"of":[9,85],"classification,":[11],"enabling":[12],"applications":[13],"such":[14,44],"as":[15,45],"autonomous":[16],"driving,":[17],"urban":[18],"analytics,":[19],"and":[20],"high-definition":[21],"map":[22],"construction.":[23],"It":[24],"remains":[25],"computationally":[26],"demanding":[27],"whether":[28],"training":[29],"from":[30,33],"scratch,":[31],"initialising":[32],"pre-trained":[34,41],"weights,":[35],"or":[36,53,118],"fine-tuning":[37,54],"large":[38],"models.":[39],"Although":[40],"vision-language":[42],"models":[43],"CLIP":[46,89],"offer":[47],"rich":[48],"representations,":[50],"existing":[51],"adaptation":[52,90],"methods":[55],"often":[56],"rely":[57],"on":[58,102,126],"their":[59,64],"global":[60],"embeddings,":[62],"limiting":[63],"ability":[65],"to":[66,105],"capture":[67],"fine-grained,":[68],"localised":[69],"attributes":[70],"essential":[71],"in":[72],"complex,":[73],"cluttered":[74],"street":[75],"scenes.":[76],"To":[77],"address":[78],"this,":[79],"we":[80],"propose":[81],"CLIP-MHAdapter,":[82],"variant":[84],"the":[86,127],"current":[87],"lightweight":[88],"paradigm":[91],"that":[92],"appends":[93],"bottleneck":[95],"MLP":[96],"equipped":[97],"with":[98],"multi-head":[99],"self-attention":[100],"operating":[101],"patch":[103],"tokens":[104],"model":[106],"inter-patch":[107],"dependencies.":[108],"With":[109],"approximately":[110],"1.4":[111],"million":[112],"trainable":[113],"parameters,":[114],"CLIP-MHAdapter":[115],"achieves":[116],"superior":[117],"competitive":[119],"accuracy":[120],"across":[121],"eight":[122],"tasks":[125],"Global":[128],"StreetScapes":[129],"dataset,":[130],"attaining":[131],"new":[132],"state-of-the-art":[133],"results":[134],"while":[135],"maintaining":[136],"low":[137],"computational":[138],"cost.":[139],"The":[140],"code":[141],"available":[143],"at":[144],"https://github.com/SpaceTimeLab/CLIP-MHAdapter.":[145]},"counts_by_year":[],"updated_date":"2026-08-16T07:02:28.622633","created_date":"2026-02-20T00:00:00"}
