VGGT
Wang (Meta) 2025 · 논문
한 줄 요약 — 하나에서 수백 개에 이르는 뷰로부터 카메라 파라미터, 깊이 맵, 밀집 포인트맵, 3D 점 트랙을 1초 이내에 직접 추론하는 단일 피드포워드 Transformer입니다 — CVPR 2025 최우수 논문이며, 기하학적 파이프라인을 하나의 네트워크로 대체하는 모범 사례입니다.
문제
3D 비전 모델은 전형적으로 단일 작업에 한정되고 특화되어 왔습니다: 깊이용 네트워크 하나, 포즈용 네트워크 하나, 점 추적용 네트워크 하나. 그리고 완전한 다중 뷰 재구성은 후처리로서 시각적-기하학 최적화(번들 조정, 삼각측량, DUSt3R 방식의 전역 정렬)를 포함하는 다단계 파이프라인이 필요했습니다. VGGT는 하나의 네트워크가 임의의 수의 뷰로부터 장면의 모든 핵심 3D 속성을 직접 추론할 수 있는지, 그것도 최적화 단계를 선택적으로 만들 수 있을 만큼 충분히 빠르고 정확하게 할 수 있는지를 묻습니다.
방법 및 아키텍처
하나의 함수, 네 가지 출력: 장면의 개 이미지가 주어지면, Transformer 는 프레임마다 다음을 예측합니다
여기서 는 회전 쿼터니언, 병진, 시야각을 담고, 는 깊이 맵이며, 는 포인트맵으로 (DUSt3R에서처럼) 첫 번째 카메라의 좌표 프레임으로 표현되고, 는 추적 모듈 가 소비하는 밀집 특징입니다.
- 교차 어텐션(Alternating-Attention) 백본: 이미지는 DINOv2로 토큰화된 후, 약 12억 파라미터의 표준 셀프 어텐션에 의해 처리됩니다 — 쌍의 프레임 단위 셀프 어텐션(각 이미지 내부의 토큰들)과 전역 셀프 어텐션(모든 프레임에 걸친 토큰들)이 교차됩니다. 교차 어텐션(cross-attention) 레이어는 없으며 3D 귀납적 편향은 최소한입니다. 다중 뷰 기하학은 학습되는 것이며, 미리 내재되어 있는 것이 아닙니다.
- 토큰과 헤드: 각 프레임은 카메라 토큰과 4개의 레지스터 토큰을 얻습니다. 첫 번째 프레임의 토큰은 별도의 학습 가능한 파라미터인데, 이것이 네트워크가 어떤 카메라를 세계 프레임으로 정의할지 아는 방법입니다(그래서 , 입니다). 카메라는 출력 카메라 토큰으로부터 4개의 셀프 어텐션 레이어 + 선형 레이어에 의해 예측됩니다. 밀집 출력은 DPT 헤드 뒤에 3×3 컨볼루션이 이어져 나오며, 우연적 불확실성 맵 도 함께 나옵니다.
- 추적 헤드: CoTracker2 스타일의 모듈이 질의 점의 특징을 다른 모든 프레임의 특징 맵 와 상관시켜, (순서 없는) 임의의 이미지 집합에 대한 대응 관계 를 출력합니다. 와 는 함께 학습됩니다.
- 다중 작업 손실:
여기서 Huber 카메라 손실은 이고, 불확실성 가중 밀집 손실은 형태입니다(포인트맵도 마찬가지).
- 과잉 완전(over-complete) 예측: 카메라, 깊이, 포인트맵은 서로 연관되어 있습니다(포인트맵 = 깊이 + 카메라). 그런데도 학습 중 이들 모두를 예측하는 것이 각각을 측정 가능하게 개선합니다. 추론 시, 깊이 헤드와 카메라 헤드를 결합하면 전용 포인트맵 헤드보다 더 나은 3D 점을 산출합니다.
- 학습: 64개의 A100에서 9일에 걸쳐 16만 번의 AdamW 반복, 배치당 2–24프레임, 최대 518px, 17개 데이터셋(Co3Dv2, BlendMVS, DL3DV, MegaDepth, Kubric, WildRGB, ScanNet, HyperSim, Mapillary, Habitat, Replica 등)에서 학습되었습니다 — MASt3R의 학습 규모 및 다양성과 유사합니다.
실험 결과
- 카메라 포즈(10개의 무작위 프레임, AUC@30): CO3Dv2 88.2, RealEstate10K(학습에서 보지 않은 데이터셋) 85.3을 순수 피드포워드 모드로 약 0.2초에 달성합니다 — MASt3R 81.8/76.4(~9초), VGGSfM v2 83.4/78.9(~10초), 그리고 빠른 동시대 모델 Fast3R 82.5/72.7과 CUT3R 82.8/75.3과 대비됩니다. VGGT의 예측을 초기화로 사용해 번들 조정에 공급하면 이것이 91.8/93.5로 약 1.8초에 향상됩니다(삼각측량/반복적 정제가 필요 없음).
- 다중 뷰 깊이(DTU, 카메라 미지): 전체 Chamfer 거리 0.382로 DUSt3R의 1.741과 대비되며, 실측 카메라를 사용하는 GeoMVSNet(0.295)에 근접합니다.
- 포인트맵(ETH3D): 전체 0.677(깊이+카메라 결합)로 DUSt3R의 1.005, 전역 정렬을 사용하는 MASt3R의 0.826과 대비되며, 7–9초 대신 0.2초에 실행됩니다.
- 두 뷰 매칭(ScanNet-1500): AUC@5 33.9로 RoMa의 31.8보다 우수합니다 — 추적 헤드가 두 뷰 매칭에 특화되지 않았음에도 그렇습니다.
- 사전 학습된 VGGT 특징은 동적 점 추적(파인튜닝된 CoTracker) 및 피드포워드 새로운 뷰 합성을 포함한 다운스트림 작업을 크게 향상시킵니다. CVPR 2025 최우수 논문을 수상했으며, 코드와 모델이 공개되어 있습니다.
SLAM에서의 의미
VGGT는 3D 비전을 위한 피드포워드 파운데이션 모델 패러다임을 검증했습니다: 잘 학습된 Transformer가 전체 SfM/SLAM 프론트엔드(검출, 매칭, 포즈 추정, 삼각측량, 밀집 깊이)를 대체할 수 있습니다. 이는 DUSt3R/MASt3R 포인트맵 계보를 이미지 쌍에서 임의 개수의 뷰로 확장하며, VGGT-SLAM, VGGT-Geo 등을 비롯해 이 모델을 중심으로 구축된 SLAM 시스템들을 즉시 낳았습니다 — 네트워크가 즉각적인 기하학을 제공하고, 경량 백엔드가 일관성을 제공하는 구조입니다. 손수 만든 기하학 이후 SLAM이 어디로 향하고 있는지를 탐색한다면, 반드시 읽어야 할 논문입니다.