VGGT-SLAM

Maggio 2025 · 논문

한 줄 요약 — VGGT를 프론트엔드로 사용하는 밀집 단안 RGB SLAM으로, 피드포워드 서브맵 재구성을 SL(4) 매니폴드 위에서 최적화된 팩터 그래프로 점진적으로 정렬합니다 — 캘리브레이션되지 않은 서브맵은 단순한 유사변환이 아니라 완전한 15-DoF 사영변환만큼 서로 다를 수 있기 때문입니다.

문제

VGGT는 한 번의 순전파로 한 배치의 프레임을 재구성하지만, GPU 메모리는 RTX 4090(24GB)에서 한 번의 추론을 대략 60프레임으로 제한하므로, 긴 영상은 서브맵으로 나뉘어야 하고 이후 하나의 지도로 정렬되어야 합니다. 관련 연구들은 서브맵을 유사변환(회전 + 병진 + 스케일)으로 정렬하지만, VGGT-SLAM은 캘리브레이션되지 않은 카메라에는 이것이 부적합함을 보입니다: 사영 재구성 정리(Projective Reconstruction Theorem)에 의해, 카메라 운동, 장면 구조, 내부 파라미터에 대한 가정이 전혀 없다면, 장면은 실제 기하학의 15자유도 사영변환까지만 복원 가능합니다. 따라서 7-DoF Sim(3) 정렬은 두 서브맵을 항상 일치시킬 수 없습니다 — 특히 프레임 간 시차가 작아 VGGT의 학습된 미터 단위 사전 정보가 신뢰할 수 없게 될 때, 서브맵 사이에 전단(shear), 스트레치, 원근 왜곡이 잔여로 남습니다.

방법 및 아키텍처

실험 결과

RTX 4090에서 5회 실행 평균으로, 7-Scenes와 TUM RGB-D(evo로 계산한 ATE RMSE)에서 평가되었습니다. 파라미터: wloop=1w_{\text{loop}}=1, τdisparity=25\tau_{\text{disparity}}=25px, τconf=25%\tau_{\text{conf}}=25\%, RANSAC 반복 300회.

SLAM에서의 의미

VGGT-SLAM은 다중 뷰 피드포워드 파운데이션 모델을 제대로 된 SLAM 루프에 감싸는 최초의 시스템입니다 — 서브맵, 루프 클로저, 그리고 이러한 모델들이 해결하지 않고 남기는 재구성 모호성에 대한 원칙적인 처리를 갖췄습니다. 캘리브레이션되지 않은 피드포워드 서브맵은 Sim(3)이 아니라 SL(4) 위에서 정렬되어야 한다는 핵심 관찰은, 학습된 기하학 위에 SLAM을 구축하려는 누구에게나 개념적으로 중요하며, 그 SL(4) 팩터 그래프 솔버는 이후 GTSAM에 병합되었습니다. 이 시스템은 DROID-SLAM과 MASt3R-SLAM으로부터 점점 더 학습화되는 SLAM 스택으로 향하는 직선 계보 위에 위치합니다.

관련 문서