{"id":"https://openalex.org/W7154485406","doi":"https://doi.org/10.1109/upinlbs68186.2025.11468446","title":"Balancing Accuracy and Efficiency: A ResNet\u2013Sinkhorn Framework for Extracting Global Image Descriptors in Indoor Visual Place Recognition","display_name":"Balancing Accuracy and Efficiency: A ResNet\u2013Sinkhorn Framework for Extracting Global Image Descriptors in Indoor Visual Place Recognition","publication_year":2025,"publication_date":"2025-12-17","ids":{"openalex":"https://openalex.org/W7154485406","doi":"https://doi.org/10.1109/upinlbs68186.2025.11468446"},"language":null,"primary_location":{"id":"doi:10.1109/upinlbs68186.2025.11468446","is_oa":false,"landing_page_url":"https://doi.org/10.1109/upinlbs68186.2025.11468446","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Ubiquitous Positioning, Indoor Navigation and Location-Based Services Conference (UPINLBS)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5101349449","display_name":"Yida Wei","orcid":null},"institutions":[{"id":"https://openalex.org/I37461747","display_name":"Wuhan University","ror":"https://ror.org/033vjfk17","country_code":"CN","type":"education","lineage":["https://openalex.org/I37461747"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Yida Wei","raw_affiliation_strings":["LIESMARS, Wuhan University,Wuhan,China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"LIESMARS, Wuhan University,Wuhan,China","institution_ids":["https://openalex.org/I37461747"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5133629089","display_name":"You Li","orcid":null},"institutions":[{"id":"https://openalex.org/I37461747","display_name":"Wuhan University","ror":"https://ror.org/033vjfk17","country_code":"CN","type":"education","lineage":["https://openalex.org/I37461747"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"You Li","raw_affiliation_strings":["LIESMARS, Wuhan University,Wuhan,China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"LIESMARS, Wuhan University,Wuhan,China","institution_ids":["https://openalex.org/I37461747"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5011966833","display_name":"Zhenqi Zheng","orcid":"https://orcid.org/0000-0001-9126-3620"},"institutions":[{"id":"https://openalex.org/I37461747","display_name":"Wuhan University","ror":"https://ror.org/033vjfk17","country_code":"CN","type":"education","lineage":["https://openalex.org/I37461747"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Zhenqi Zheng","raw_affiliation_strings":["LIESMARS, Wuhan University,Wuhan,China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"LIESMARS, Wuhan University,Wuhan,China","institution_ids":["https://openalex.org/I37461747"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I37461747"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.72210345,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"6"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10627","display_name":"Advanced Image and Video Retrieval Techniques","score":0.5849999785423279,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10627","display_name":"Advanced Image and Video Retrieval Techniques","score":0.5849999785423279,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10036","display_name":"Advanced Neural Network Applications","score":0.1014999970793724,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.08100000023841858,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/image","display_name":"Image (mathematics)","score":0.48510000109672546},{"id":"https://openalex.org/keywords/pattern-recognition","display_name":"Pattern recognition (psychology)","score":0.38679999113082886},{"id":"https://openalex.org/keywords/feature","display_name":"Feature (linguistics)","score":0.3677000105381012},{"id":"https://openalex.org/keywords/image-processing","display_name":"Image processing","score":0.32030001282691956},{"id":"https://openalex.org/keywords/feature-extraction","display_name":"Feature extraction","score":0.30649998784065247},{"id":"https://openalex.org/keywords/image-segmentation","display_name":"Image segmentation","score":0.3061000108718872}],"concepts":[{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6577000021934509},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6351000070571899},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.5803999900817871},{"id":"https://openalex.org/C115961682","wikidata":"https://www.wikidata.org/wiki/Q860623","display_name":"Image (mathematics)","level":2,"score":0.48510000109672546},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.38679999113082886},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.3677000105381012},{"id":"https://openalex.org/C9417928","wikidata":"https://www.wikidata.org/wiki/Q1070689","display_name":"Image processing","level":3,"score":0.32030001282691956},{"id":"https://openalex.org/C52622490","wikidata":"https://www.wikidata.org/wiki/Q1026626","display_name":"Feature extraction","level":2,"score":0.30649998784065247},{"id":"https://openalex.org/C124504099","wikidata":"https://www.wikidata.org/wiki/Q56933","display_name":"Image segmentation","level":3,"score":0.3061000108718872},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.299699991941452},{"id":"https://openalex.org/C36464697","wikidata":"https://www.wikidata.org/wiki/Q451553","display_name":"Visualization","level":2,"score":0.2937999963760376},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.28940001130104065},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.25519999861717224}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/upinlbs68186.2025.11468446","is_oa":false,"landing_page_url":"https://doi.org/10.1109/upinlbs68186.2025.11468446","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Ubiquitous Positioning, Indoor Navigation and Location-Based Services Conference (UPINLBS)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Indoor":[0],"Visual":[1],"Place":[2],"Recognition":[3],"(VPR)":[4],"remains":[5],"highly":[6],"challenging":[7],"due":[8],"to":[9,25,84],"significant":[10],"illumination":[11],"changes,":[12],"dynamic":[13],"object":[14],"movements,":[15],"and":[16,48,78,123,166],"large":[17],"viewpoint":[18],"variations.":[19],"Existing":[20],"CNN-based":[21],"methods":[22],"often":[23],"fail":[24],"capture":[26],"long-range":[27],"spatial":[28],"dependencies,":[29],"while":[30,129],"Transformer-based":[31],"models,":[32],"though":[33],"accurate,":[34],"are":[35],"computationally":[36],"expensive":[37],"for":[38,151],"real-time":[39,152],"deployment.":[40,153],"To":[41],"achieve":[42],"an":[43,74],"optimal":[44,75],"balance":[45],"between":[46,164],"accuracy":[47,116,165],"efficiency,":[49],"a":[50,57,62,79,141],"lightweight":[51],"framework":[52,159],"is":[53,71,82],"introduced":[54],"that":[55,157],"employs":[56],"ResNet":[58],"backbone":[59],"together":[60],"with":[61],"Sinkhorn-based":[63],"global":[64,95],"feature":[65,142],"aggregation":[66],"module.":[67],"The":[68,111],"feature-to-cluster":[69],"assignment":[70],"formulated":[72],"as":[73],"transport":[76],"problem,":[77],"dustbin":[80],"class":[81],"incorporated":[83],"suppress":[85],"non-informative":[86],"features,":[87],"enabling":[88],"the":[89,158,162],"generation":[90],"of":[91,145],"compact":[92],"yet":[93],"discriminative":[94],"descriptors.":[96],"Extensive":[97],"experiments":[98],"conducted":[99],"across":[100],"multiple":[101],"indoor":[102],"VPR":[103],"benchmarks":[104],"demonstrate":[105],"clear":[106],"improvements":[107],"over":[108,121,127],"representative":[109],"baselines.":[110],"proposed":[112],"method":[113],"improves":[114],"recognition":[115],"by":[117],"11":[118],"percentage":[119,125],"points":[120,126],"NetVLAD":[122],"3":[124,138],"AnyLoc,":[128],"reducing":[130],"descriptor":[131],"dimension":[132],"by$\\text{7":[133],"5":[134],"\\%":[135],"-":[136],"8":[137],"\\%}$.":[139],"Moreover,":[140],"extraction":[143],"speed":[144],"40":[146],"FPS":[147],"confirms":[148],"its":[149],"suitability":[150],"These":[154],"findings":[155],"indicate":[156],"effectively":[160],"optimizes":[161],"trade-off":[163],"efficiency.":[167]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-04-16T00:00:00"}
