{"id":"https://openalex.org/W7140291908","doi":"https://doi.org/10.48550/arxiv.2603.23370","title":"Object Pose Transformer: Unifying Unseen Object Pose Estimation","display_name":"Object Pose Transformer: Unifying Unseen Object Pose Estimation","publication_year":2026,"publication_date":"2026-03-24","ids":{"openalex":"https://openalex.org/W7140291908","doi":"https://doi.org/10.48550/arxiv.2603.23370"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.23370","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.23370","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.23370","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5130621046","display_name":"Weihang Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Weihang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5014520592","display_name":"Lorenzo Garattoni","orcid":"https://orcid.org/0000-0002-6382-0335"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Garattoni, Lorenzo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5130563998","display_name":"Fabien Despinoy","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Despinoy, Fabien","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5130564962","display_name":"Nassir Navab","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Navab, Nassir","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5067135033","display_name":"Benjamin Busam","orcid":"https://orcid.org/0000-0002-0620-5774"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Busam, Benjamin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.894599974155426,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.894599974155426,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10812","display_name":"Human Pose and Action Recognition","score":0.032499998807907104,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10191","display_name":"Robotics and Sensor-Based Localization","score":0.010900000110268593,"subfield":{"id":"https://openalex.org/subfields/2202","display_name":"Aerospace Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/pose","display_name":"Pose","score":0.8398000001907349},{"id":"https://openalex.org/keywords/intrinsics","display_name":"Intrinsics","score":0.6093999743461609},{"id":"https://openalex.org/keywords/articulated-body-pose-estimation","display_name":"Articulated body pose estimation","score":0.5564000010490417},{"id":"https://openalex.org/keywords/3d-pose-estimation","display_name":"3D pose estimation","score":0.5098000168800354},{"id":"https://openalex.org/keywords/ambiguity","display_name":"Ambiguity","score":0.46869999170303345},{"id":"https://openalex.org/keywords/object","display_name":"Object (grammar)","score":0.4650999903678894},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.4242999851703644},{"id":"https://openalex.org/keywords/rgb-color-model","display_name":"RGB color model","score":0.41280001401901245}],"concepts":[{"id":"https://openalex.org/C52102323","wikidata":"https://www.wikidata.org/wiki/Q1671968","display_name":"Pose","level":2,"score":0.8398000001907349},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.7821000218391418},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6672000288963318},{"id":"https://openalex.org/C2908650547","wikidata":"https://www.wikidata.org/wiki/Q20999234","display_name":"Intrinsics","level":2,"score":0.6093999743461609},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.6010000109672546},{"id":"https://openalex.org/C22100474","wikidata":"https://www.wikidata.org/wiki/Q4800952","display_name":"Articulated body pose estimation","level":4,"score":0.5564000010490417},{"id":"https://openalex.org/C36613465","wikidata":"https://www.wikidata.org/wiki/Q4636322","display_name":"3D pose estimation","level":3,"score":0.5098000168800354},{"id":"https://openalex.org/C2780522230","wikidata":"https://www.wikidata.org/wiki/Q1140419","display_name":"Ambiguity","level":2,"score":0.46869999170303345},{"id":"https://openalex.org/C2781238097","wikidata":"https://www.wikidata.org/wiki/Q175026","display_name":"Object (grammar)","level":2,"score":0.4650999903678894},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.4242999851703644},{"id":"https://openalex.org/C82990744","wikidata":"https://www.wikidata.org/wiki/Q166194","display_name":"RGB color model","level":2,"score":0.41280001401901245},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.3605000078678131},{"id":"https://openalex.org/C2776151529","wikidata":"https://www.wikidata.org/wiki/Q3045304","display_name":"Object detection","level":3,"score":0.35440000891685486},{"id":"https://openalex.org/C2776359362","wikidata":"https://www.wikidata.org/wiki/Q2145286","display_name":"Representation (politics)","level":3,"score":0.34790000319480896},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.34310001134872437},{"id":"https://openalex.org/C64876066","wikidata":"https://www.wikidata.org/wiki/Q5141226","display_name":"Cognitive neuroscience of visual object recognition","level":3,"score":0.33880001306533813},{"id":"https://openalex.org/C2776436953","wikidata":"https://www.wikidata.org/wiki/Q5163215","display_name":"Consistency (knowledge bases)","level":2,"score":0.2937999963760376},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.29089999198913574},{"id":"https://openalex.org/C45340560","wikidata":"https://www.wikidata.org/wiki/Q215382","display_name":"Disjoint sets","level":2,"score":0.2799000144004822},{"id":"https://openalex.org/C59404180","wikidata":"https://www.wikidata.org/wiki/Q17013334","display_name":"Feature learning","level":2,"score":0.2750000059604645},{"id":"https://openalex.org/C52622490","wikidata":"https://www.wikidata.org/wiki/Q1026626","display_name":"Feature extraction","level":2,"score":0.257999986410141},{"id":"https://openalex.org/C28719098","wikidata":"https://www.wikidata.org/wiki/Q44946","display_name":"Point (geometry)","level":2,"score":0.25619998574256897}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.23370","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.23370","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.23370","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.23370","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Learning":[0],"model-free":[1],"object":[2,84,137],"pose":[3,39,95,150,197],"estimation":[4,198],"for":[5,108,170],"unseen":[6],"instances":[7],"remains":[8],"a":[9,29,59,71,122,201],"fundamental":[10],"challenge":[11],"in":[12,28,154,177,192],"3D":[13],"vision.":[14],"Existing":[15],"methods":[16,40],"typically":[17],"fall":[18],"into":[19],"two":[20],"disjoint":[21],"paradigms:":[22],"category-level":[23,92],"approaches":[24],"predict":[25],"absolute":[26,48,93,149,194],"poses":[27],"canonical":[30],"space":[31],"but":[32,44],"rely":[33],"on":[34,182],"predefined":[35],"taxonomies,":[36],"while":[37,173],"relative":[38,98,128,142,196],"estimate":[41],"cross-view":[42],"transformations":[43],"cannot":[45],"recover":[46],"single-view":[47,155],"pose.":[49,100],"In":[50],"this":[51],"work,":[52],"we":[53],"propose":[54],"Object":[55],"Pose":[56],"Transformer":[57],"(\\ours{}),":[58],"unified":[60,203],"feed-forward":[61],"framework":[62],"that":[63],"bridges":[64],"these":[65],"paradigms":[66],"through":[67],"task":[68],"factorization":[69],"within":[70,200],"single":[72,202],"model.":[73],"\\ours{}":[74,158],"jointly":[75],"predicts":[76],"depth,":[77],"point":[78,119],"maps,":[79],"camera":[80,162],"parameters,":[81],"and":[82,96,117,135,165,195],"normalized":[83],"coordinates":[85],"(NOCS)":[86],"from":[87],"RGB":[88],"inputs,":[89],"enabling":[90],"both":[91,193],"SA(3)":[94],"unseen-object":[97],"SE(3)":[99],"Our":[101],"approach":[102],"leverages":[103,141],"contrastive":[104],"object-centric":[105],"latent":[106],"embeddings":[107],"canonicalization":[109],"without":[110],"requiring":[111],"semantic":[112],"labels":[113],"at":[114],"inference":[115],"time,":[116],"uses":[118],"maps":[120],"as":[121],"camera-space":[123],"representation":[124],"to":[125,147],"enable":[126],"multi-view":[127],"geometric":[129,143],"reasoning.":[130],"Through":[131],"cross-frame":[132],"feature":[133],"interaction":[134],"shared":[136],"embeddings,":[138],"our":[139],"model":[140],"consistency":[144],"across":[145],"views":[146],"improve":[148],"estimation,":[151],"reducing":[152],"ambiguity":[153],"predictions.":[156],"Furthermore,":[157],"is":[159],"camera-agnostic,":[160],"learning":[161],"intrinsics":[163],"on-the-fly":[164],"supporting":[166],"optional":[167],"depth":[168],"input":[169],"metric-scale":[171],"recovery,":[172],"remaining":[174],"fully":[175],"functional":[176],"RGB-only":[178],"settings.":[179],"Extensive":[180],"experiments":[181],"diverse":[183],"benchmarks":[184],"(NOCS,":[185],"HouseCat6D,":[186],"Omni6DPose,":[187],"Toyota-Light)":[188],"demonstrate":[189],"state-of-the-art":[190],"performance":[191],"tasks":[199],"architecture.":[204]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-03-26T00:00:00"}
