{"id":"https://openalex.org/W4415063188","doi":"https://doi.org/10.1109/iccv51701.2025.02497","title":"AlignDiff: Learning Physically-Grounded Camera Alignment via Diffusion","display_name":"AlignDiff: Learning Physically-Grounded Camera Alignment via Diffusion","publication_year":2025,"publication_date":"2025-10-19","ids":{"openalex":"https://openalex.org/W4415063188","doi":"https://doi.org/10.1109/iccv51701.2025.02497"},"language":"en","primary_location":{"id":"doi:10.1109/iccv51701.2025.02497","is_oa":false,"landing_page_url":"https://doi.org/10.1109/iccv51701.2025.02497","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE/CVF International Conference on Computer Vision (ICCV)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["arxiv","crossref","datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://arxiv.org/pdf/2503.21581","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5023074455","display_name":"Liuyue Xie","orcid":"https://orcid.org/0000-0001-7125-5084"},"institutions":[{"id":"https://openalex.org/I74973139","display_name":"Carnegie Mellon University","ror":"https://ror.org/05x2bcf33","country_code":"US","type":"education","lineage":["https://openalex.org/I74973139"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Liuyue Xie","raw_affiliation_strings":["Carnegie Mellon University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Carnegie Mellon University","institution_ids":["https://openalex.org/I74973139"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5045954220","display_name":"Jincheng Guo","orcid":"https://orcid.org/0000-0002-8321-1676"},"institutions":[{"id":"https://openalex.org/I1291425158","display_name":"Google (United States)","ror":"https://ror.org/00njsd438","country_code":"US","type":"company","lineage":["https://openalex.org/I1291425158","https://openalex.org/I4210128969"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Jiancong Guo","raw_affiliation_strings":["Google"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Google","institution_ids":["https://openalex.org/I1291425158"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5081745711","display_name":"Ozan Cakmakci","orcid":null},"institutions":[{"id":"https://openalex.org/I1291425158","display_name":"Google (United States)","ror":"https://ror.org/00njsd438","country_code":"US","type":"company","lineage":["https://openalex.org/I1291425158","https://openalex.org/I4210128969"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Ozan Cakmakci","raw_affiliation_strings":["Google"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Google","institution_ids":["https://openalex.org/I1291425158"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5101666068","display_name":"Andr\u00e9 Araujo","orcid":"https://orcid.org/0000-0002-4214-6185"},"institutions":[{"id":"https://openalex.org/I1291425158","display_name":"Google (United States)","ror":"https://ror.org/00njsd438","country_code":"US","type":"company","lineage":["https://openalex.org/I1291425158","https://openalex.org/I4210128969"]},{"id":"https://openalex.org/I4210090411","display_name":"Google DeepMind (United Kingdom)","ror":"https://ror.org/00971b260","country_code":"GB","type":"company","lineage":["https://openalex.org/I4210090411","https://openalex.org/I4210128969"]}],"countries":["GB","US"],"is_corresponding":false,"raw_author_name":"Andre Araujo","raw_affiliation_strings":["Google DeepMind"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Google DeepMind","institution_ids":["https://openalex.org/I1291425158","https://openalex.org/I4210090411"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5045790971","display_name":"L\u00e1szl\u00f3 A. Jeni","orcid":"https://orcid.org/0000-0002-2830-700X"},"institutions":[{"id":"https://openalex.org/I74973139","display_name":"Carnegie Mellon University","ror":"https://ror.org/05x2bcf33","country_code":"US","type":"education","lineage":["https://openalex.org/I74973139"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"L\u00e1szl\u00f3 A. Jeni","raw_affiliation_strings":["Carnegie Mellon University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Carnegie Mellon University","institution_ids":["https://openalex.org/I74973139"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5113910610","display_name":"Zhiheng Jia","orcid":null},"institutions":[{"id":"https://openalex.org/I1291425158","display_name":"Google (United States)","ror":"https://ror.org/00njsd438","country_code":"US","type":"company","lineage":["https://openalex.org/I1291425158","https://openalex.org/I4210128969"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Zhiheng Jia","raw_affiliation_strings":["Google"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Google","institution_ids":["https://openalex.org/I1291425158"]}]}],"institutions":[],"countries_distinct_count":2,"institutions_distinct_count":3,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.30155927,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"26901","last_page":"26911"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10627","display_name":"Advanced Image and Video Retrieval Techniques","score":0.9990000128746033,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10627","display_name":"Advanced Image and Video Retrieval Techniques","score":0.9990000128746033,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10824","display_name":"Image Retrieval and Classification Techniques","score":0.9889000058174133,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11439","display_name":"Video Analysis and Summarization","score":0.98089998960495,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/calibration","display_name":"Calibration","score":0.6123999953269958},{"id":"https://openalex.org/keywords/camera-resectioning","display_name":"Camera resectioning","score":0.6108999848365784},{"id":"https://openalex.org/keywords/distortion","display_name":"Distortion (music)","score":0.5489000082015991},{"id":"https://openalex.org/keywords/generalizability-theory","display_name":"Generalizability theory","score":0.5227000117301941},{"id":"https://openalex.org/keywords/focus","display_name":"Focus (optics)","score":0.5174999833106995},{"id":"https://openalex.org/keywords/camera-auto-calibration","display_name":"Camera auto-calibration","score":0.43860000371932983},{"id":"https://openalex.org/keywords/image","display_name":"Image (mathematics)","score":0.43529999256134033},{"id":"https://openalex.org/keywords/lens","display_name":"Lens (geology)","score":0.4253999888896942}],"concepts":[{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.6952999830245972},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6952999830245972},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6736999750137329},{"id":"https://openalex.org/C165838908","wikidata":"https://www.wikidata.org/wiki/Q736777","display_name":"Calibration","level":2,"score":0.6123999953269958},{"id":"https://openalex.org/C110898773","wikidata":"https://www.wikidata.org/wiki/Q2933935","display_name":"Camera resectioning","level":2,"score":0.6108999848365784},{"id":"https://openalex.org/C126780896","wikidata":"https://www.wikidata.org/wiki/Q899871","display_name":"Distortion (music)","level":4,"score":0.5489000082015991},{"id":"https://openalex.org/C27158222","wikidata":"https://www.wikidata.org/wiki/Q5532422","display_name":"Generalizability theory","level":2,"score":0.5227000117301941},{"id":"https://openalex.org/C192209626","wikidata":"https://www.wikidata.org/wiki/Q190909","display_name":"Focus (optics)","level":2,"score":0.5174999833106995},{"id":"https://openalex.org/C94816000","wikidata":"https://www.wikidata.org/wiki/Q5026006","display_name":"Camera auto-calibration","level":3,"score":0.43860000371932983},{"id":"https://openalex.org/C115961682","wikidata":"https://www.wikidata.org/wiki/Q860623","display_name":"Image (mathematics)","level":2,"score":0.43529999256134033},{"id":"https://openalex.org/C15336307","wikidata":"https://www.wikidata.org/wiki/Q1766051","display_name":"Lens (geology)","level":2,"score":0.4253999888896942},{"id":"https://openalex.org/C2778022956","wikidata":"https://www.wikidata.org/wiki/Q192234","display_name":"Camera lens","level":3,"score":0.3783999979496002},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.3587000072002411},{"id":"https://openalex.org/C23903533","wikidata":"https://www.wikidata.org/wiki/Q17122739","display_name":"Reprojection error","level":3,"score":0.3384000062942505},{"id":"https://openalex.org/C104065381","wikidata":"https://www.wikidata.org/wiki/Q1002535","display_name":"Geometric modeling","level":2,"score":0.32019999623298645},{"id":"https://openalex.org/C3018868555","wikidata":"https://www.wikidata.org/wiki/Q2918907","display_name":"Single camera","level":2,"score":0.30160000920295715},{"id":"https://openalex.org/C199996500","wikidata":"https://www.wikidata.org/wiki/Q14369636","display_name":"Pinhole camera model","level":4,"score":0.29910001158714294},{"id":"https://openalex.org/C110277352","wikidata":"https://www.wikidata.org/wiki/Q467980","display_name":"Geometrical optics","level":2,"score":0.2955999970436096},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.2732999920845032},{"id":"https://openalex.org/C69357855","wikidata":"https://www.wikidata.org/wiki/Q163214","display_name":"Diffusion","level":2,"score":0.2669000029563904},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.2612999975681305},{"id":"https://openalex.org/C75291252","wikidata":"https://www.wikidata.org/wiki/Q1315756","display_name":"TRACE (psycholinguistics)","level":2,"score":0.2542000114917755},{"id":"https://openalex.org/C89600930","wikidata":"https://www.wikidata.org/wiki/Q1423946","display_name":"Segmentation","level":2,"score":0.2500999867916107}],"mesh":[],"locations_count":3,"locations":[{"id":"doi:10.1109/iccv51701.2025.02497","is_oa":false,"landing_page_url":"https://doi.org/10.1109/iccv51701.2025.02497","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE/CVF International Conference on Computer Vision (ICCV)","raw_type":"proceedings-article"},{"id":"pmh:oai:arXiv.org:2503.21581","is_oa":true,"landing_page_url":"http://arxiv.org/abs/2503.21581","pdf_url":"https://arxiv.org/pdf/2503.21581","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},{"id":"doi:10.48550/arxiv.2503.21581","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2503.21581","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:oai:arXiv.org:2503.21581","is_oa":true,"landing_page_url":"http://arxiv.org/abs/2503.21581","pdf_url":"https://arxiv.org/pdf/2503.21581","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Accurate":[0],"camera":[1,54,63,98],"calibration":[2,31,178],"is":[3],"a":[4,44,60,86,133,151],"fundamental":[5],"task":[6],"for":[7],"3D":[8],"perception,":[9],"especially":[10],"when":[11],"dealing":[12],"with":[13],"real-world,":[14],"in-the-wild":[15],"environments":[16],"where":[17],"complex":[18],"optical":[19],"distortions":[20,99],"are":[21],"common.":[22],"Existing":[23],"methods":[24],"often":[25],"rely":[26],"on":[27,90,114,183],"pre-rectified":[28],"images":[29],"or":[30],"patterns,":[32],"which":[33],"limits":[34],"their":[35],"applicability":[36],"and":[37,56,100,176],"flexibility.":[38],"In":[39],"this":[40],"work,":[41],"we":[42,107,131],"introduce":[43],"novel":[45],"framework":[46],"that":[47,160],"addresses":[48],"these":[49],"challenges":[50],"by":[51,173],"jointly":[52],"modeling":[53,79],"intrinsic":[55],"extrinsic":[57],"parameters":[58],"using":[59],"generic":[61],"ray":[62,171],"model.":[64],"Unlike":[65],"previous":[66],"approaches,":[67],"AlignDiff":[68],"shifts":[69],"focus":[70],"from":[71],"semantic":[72,122],"to":[73,125,128],"geometric":[74,91,115],"features,":[75],"enabling":[76,93],"more":[77],"accurate":[78],"of":[80,97,136,154,169],"local":[81],"distortions.":[82],"We":[83],"propose":[84],"AlignDiff,":[85],"diffusion":[87],"model":[88,113],"conditioned":[89],"priors,":[92],"the":[94,112,147,161,166],"simultaneous":[95],"estimation":[96],"scene":[101],"geometry.":[102],"To":[103],"enhance":[104,126],"distortion":[105,148],"prediction,":[106],"incorporate":[108,132],"edge-aware":[109],"attention,":[110],"focusing":[111],"features":[116],"around":[117],"image":[118],"edges,":[119],"rather":[120],"than":[121],"content.":[123],"Furthermore,":[124],"generalizability":[127],"real-world":[129,185],"captures,":[130],"large":[134],"database":[135,145],"ray-traced":[137],"lenses":[138],"containing":[139],"over":[140],"three":[141],"thousand":[142],"samples.":[143],"This":[144],"characterizes":[146],"inherent":[149],"in":[150],"diverse":[152],"variety":[153],"lens":[155],"forms.":[156],"Our":[157],"experiments":[158],"demonstrate":[159],"proposed":[162],"method":[163],"significantly":[164],"reduces":[165],"angular":[167],"error":[168],"estimated":[170],"bundles":[172],"~8.2":[174],"degrees":[175],"overall":[177],"accuracy,":[179],"outperforming":[180],"existing":[181],"approaches":[182],"challenging,":[184],"datasets.":[186]},"counts_by_year":[],"updated_date":"2026-08-05T07:39:15.569665","created_date":"2025-10-11T00:00:00"}
