DUSt3R
Wang 2024 · 논문
한 줄 요약 — 쌍별 3D 재구성을 피드포워드 Transformer가 이미지 쌍으로부터 밀집 포인트맵을 직접 회귀하는 문제로 재정의하여, 카메라 보정, 특징 매칭, 명시적 기하학적 모델이 전혀 필요하지 않습니다.
문제
실제 환경에서의 다중 뷰 스테레오는 먼저 카메라 내부/외부 파라미터를 추정해야 하는데, 이는 얻기 번거롭지만 대응 픽셀을 3D로 삼각측량하기 위해 필수적입니다. 보정, 검출, 매칭, 포즈 추정, 삼각측량으로 이어지는 전체 고전적 파이프라인은 취약한 단계들의 연쇄로, 각 단계가 실패할 수 있습니다. DUSt3R(“Dense and Unconstrained Stereo 3D Reconstruction”)는 반대의 입장을 취합니다: 보정이나 시점 포즈에 대한 사전 정보가 전혀 없이 임의의 이미지 집합을 재구성하며, 3D 구조를 직접 회귀합니다.
방법 및 아키텍처
포인트맵 표현: 네트워크 는 두 개의 RGB 이미지 를 입력받아 두 개의 포인트맵 — 픽셀별 3D 좌표 — 를 신뢰도 지도 와 함께 출력합니다. 두 포인트맵 모두 카메라 1의 좌표계로 표현되므로, 한 번의 순전파가 보정, 대응, 재구성을 함께 풀어냅니다. 동일한 이미지를 두 번 입력하면 단안 깊이가 나옵니다; 이 공식화는 단안과 양안의 경우를 통합합니다.
아키텍처 (CroCo 스타일, CroCo 사전학습으로 초기화): 가중치를 공유하는 샴 ViT-Large 인코더 , 가 있으며, 이어서 서로 얽혀 있는 두 개의 ViT-Base 디코더가 있는데, 각 블록은 자기-주의, 다른 뷰의 토큰에 대한 교차-주의, MLP를 수행합니다:
입니다. 각 분기마다 하나의 DPT 회귀 헤드가 모든 디코더 토큰을 포인트맵 + 신뢰도 지도로 매핑합니다. 어떤 기하학적 제약도 전혀 강제되지 않습니다 — 네트워크는 기하학적으로 일관된 학습 데이터로부터 사전 정보를 학습합니다.
학습 목적함수: 뷰 의 각 유효 픽셀 에 대한 스케일 정규화 3D 회귀:
여기서 는 원점까지의 모든 유효 점들의 평균 거리이며, 예측을 신뢰할 수 있는 위치를 학습하는 신뢰도 가중 손실로 감싸집니다:
모든 것이 부산물로 얻어집니다: 3D 포인트맵 공간에서의 상호 최근접 이웃을 통한 픽셀 매칭; 에 대한 픽셀 재투영 잔차의 Weiszfeld 방식 최소화를 통한 초점 거리; 의 Procrustes 정렬 또는 PnP-RANSAC을 통한 상대 포즈; 참조 포인트맵에 대한 스케일링을 통한 절대 포즈(시각 위치화).
개 뷰에 대한 전역 정렬: 이미지 쌍에 대한 연결성 그래프 를 구축(네트워크 추론은 H100에서 쌍당 약 40 ms)한 다음, 전역 포인트맵 , 엣지당 하나의 강체 포즈 와 스케일 를 최적화합니다:
번들 조정과 달리 이는 2D 재투영 오차가 아니라 3D 투영 오차를 최소화하며, 단순한 경사 하강으로 실행됩니다 — 몇백 단계, GPU에서 단 몇 초 만에 끝납니다. 에 대해 핀홀 파라미터화를 대입하면 모든 포즈 , 내부 파라미터 , 깊이 지도 이 복원됩니다.
학습 데이터: 여덟 개의 데이터셋(Habitat, MegaDepth, ARKitScenes, Static Scenes 3D, Blended MVS, ScanNet++, CO3D-v2, Waymo)에서 얻은 850만 개의 쌍이며, 먼저 224px에서 학습한 다음 다양한 종횡비로 512px에서 학습합니다.
실험 결과
- 다중 뷰 포즈 추정 (시퀀스당 무작위 10개 프레임): CO3Dv2에서, 전역 정렬을 사용한 DUSt3R-512는 RRA@15 96.2 / RTA@15 86.8 / mAA(30) 76.7을 기록하며, PnP를 사용하면 94.3 / 88.4 / 77.2를 기록합니다 — PoseDiffusion의 80.5 / 79.8 / 66.5와 PixSfM의 33.7 / 32.9 / 30.1과 비교됩니다. 학습에서 전혀 본 적이 없는 RealEstate10K에서는 mAA(30) 67.7(GA) / 61.2(PnP)에 도달하는데, PoseDiffusion의 48.0과 비교됩니다.
- 단안 및 다중 뷰 깊이: (작업별로 미세조정되지 않은) 동일한 단일 모델이 KITTI, ScanNet, ETH3D, DTU, Tanks & Temples 벤치마크 전체에서, 자기지도 및 지도 학습 비교 설정 모두에서 최고 수준 또는 이에 준하는 결과를 냅니다.
- 시각 위치화: 포즈가 부여된 참조 이미지에 단순히 매칭시키는 것만으로 7-Scenes와 Cambridge Landmarks에서 경쟁력 있는 절대 포즈 정확도를 냅니다.
- 더 깊은 영향은 패러다임 수준이었습니다: 충분한 3D 데이터로 학습된 하나의 피드포워드 네트워크가 보정-검출-매칭-삼각측량 파이프라인을 대체하며, “3D 파운데이션 모델” 계보를 열었습니다 — MASt3R(매칭), MASt3R-SLAM(온라인), MonST3R(동적 장면), VGGT 계열(다중 뷰 피드포워드) 모두가 이 포인트맵 표현 위에 구축됩니다.
SLAM에서의 의미
DUSt3R는 기하학적 비전의 “3D 파운데이션 모델” 시대를 열었습니다: 하나의 사전학습된 네트워크가 고전적인 검출-매칭-삼각측량 파이프라인을 대체하며, 보정되지 않은 이미지에서도, 단 두 개의 뷰만으로도 동작합니다. 이는 MASt3R와 MASt3R-SLAM을 직접적으로 낳았고, VGGT와 같은 피드포워드 다중 뷰 모델에 영향을 미쳤으며, 이제는 학습된 포인트맵 회귀기가 프론트엔드이고 고전적 최적화가 백엔드인 SLAM 연구의 한 갈래 전체의 근간이 되었습니다. 그 가정들(오프라인 페어링, 전역 정렬 비용, 쌍별 스케일 모호성)을 아는 것은 후속 시스템들이 무엇을 고치는지를 설명해 줍니다.