VGGT-SLAM 2.0
Maggio 2026 · 논문
한 줄 요약 — VGGT-SLAM의 후속작으로, 15-DoF 드리프트와 평면 퇴화를 제거하는 키프레임 단위 팩터 그래프, VGGT의 어텐션 레이어에서 그대로 읽어내는 학습 불필요 루프 클로저 검증, Jetson Thor 상에서의 실시간 동작을 도입합니다.
문제
VGGT-SLAM은 SL(4) 위에서 15-DoF 호모그래피를 최적화함으로써 캘리브레이션되지 않은 서브맵 정렬 문제를 해결했지만, 이 해법 자체에도 비용이 있습니다: 고차원 정렬은 루프 클로저 사이에 빠른 드리프트를 유발하여 장면을 심하게 왜곡할 수 있고, 완전한 호모그래피를 구하는 것은 평면 장면(벽이나 바닥을 향한 카메라)에서 퇴화되어 발산을 일으킵니다. 또한 그 팩터 그래프는 서브맵당 호모그래피만을 추정했기 때문에, VGGT로부터 나오는 키프레임 단위 회전/병진 오차가 최적으로 처리되지 못했고, 루프 클로저를 위한 이미지 검색은 외부 네트워크(SALAD)를 어떤 검증도 없이 신뢰했습니다. VGGT-SLAM 2.0은 이러한 실패 모드를 제거하도록 백엔드를 재설계하면서도, 알려지지 않은 내부 파라미터 하에서 VGGT가 남기는 재구성 모호성을 여전히 존중합니다 — 그리고 시스템 전체가 로봇 위에서 온라인으로 동작하게 만듭니다.
방법 및 아키텍처
- 설정: 각 서브맵은 개의 키프레임에 대한 하나의 VGGT 패스로부터 나오며, 캘리브레이션 , 포즈 , 깊이 , 신뢰도 를 제공합니다. 점들은 과 를 사용하여 카메라별로 로 역투영됩니다. 연속된 서브맵은 하나의 겹치는 프레임을 공유합니다. 일반적인 정렬 대상은 완전한 호모그래피입니다 15 DoF를 가집니다: 병진 3, 회전 3, 스케일 1, 어파인(캘리브레이션 ) 5, 사영(projective, ) 3.
- 새로운 팩터 그래프 — 노드로서의 키프레임: 모든 키프레임이 하나의 노드입니다. 내부(intra) 엣지는 서브맵 내부의 키프레임들을 연결하며 성분만을 담습니다. 이는 VGGT의 포즈로부터 직접 얻어집니다: — 사영 왜곡은 서브맵 내부에서 일관되며, 이 엣지들이 최적화가 VGGT 자체의 포즈 드리프트를 보정하도록 허용합니다. 외부(inter) 엣지는 겹치는 프레임의 두 추정치를 연결하며 캘리브레이션과 스케일만을 담습니다: 이는 동일한 물리적 카메라에 대한 두 서브맵의 추정치가 포즈와 캘리브레이션에서 일치할 것을 강제합니다(VGGT의 캘리브레이션 추측이 틀렸다 해도, 그것은 동일해야 합니다). SL(4) 부분군으로의 이러한 제한이 15-DoF 드리프트와 평면 퇴화를 제거합니다. 스케일 는 두 점 구름을 공통 캘리브레이션으로 워핑한 후 대응하는 3D 점 거리의 중앙값 비율입니다 — 원본 VGGT 점이 사용되는 유일한 곳입니다.
- VGGT의 어텐션으로부터 공짜로 얻는 루프 클로저 검증: VGGT의 22번째 레이어는 두 이미지의 대응 영역 사이에 “스포트라이트” 어텐션 패턴을 보입니다(21번/23번 레이어에는 없으며, 무질감 벽에서도 나타납니다). 매치 점수는 다음으로 계산됩니다 여기서 , 는 검색된 이미지와 질의 이미지의 (헤드 평균화된) 질의/키 토큰입니다. SALAD 후보는 가 임계값을 통과할 때만 수락되며, 이는 SALAD 임계값을 완화(0.80 → 0.95)하여 더 많은 루프 클로저를 확보하면서 오탐을 걸러낼 수 있게 합니다. 루프 클로저는 두 프레임짜리 미니 서브맵으로 취급되어 VGGT에 전달되고, 외부 엣지로 연결됩니다.
- 전역 최적화와 지도 복원: 그래프는 GTSAM으로 SL(4) 매니폴드 위에서 최적화됩니다(SL(4) 솔버는 GTSAM에 업스트림으로 병합되었습니다). 투영 행렬은 로 복원되어 전역 포즈로 분해됩니다. 전역 점들은 를 적용함으로써 얻어집니다.
실험 결과
모든 실험에서 일정한 파라미터(최소 시차 50px, 신뢰도 임계값 25%, SALAD 0.95, 0.85).
- TUM RGB-D(캘리브레이션 없음, 32프레임 서브맵): 최고 평균 ATE RMSE 0.041m — VGGT-SLAM SL(4)(0.053m)보다 약 23% 낮고, ViSTA-SLAM(0.052m)보다 22% 낮으며, MASt3R-SLAM*는 0.060m입니다. 평면 장면인
floor에서는: 0.102m 대 VGGT-SLAM의 0.141m. - 루프 클로저 검증: Clio 데이터셋에서 검증은 수락된 루프 클로저를 2 → 5(Cubicle)와 0 → 9(Apartment)로 증가시키고, 발산하던 Office 실행(비슷한 책상 칸막이로부터의 오탐)을 오탐 0개인 정확한 클로저 4개로 바꿉니다. LaMAR HGE에서 Recall@1은 SALAD 88.45 → 90.13, NetVLAD 85.92 → 89.08로 개선됩니다.
- 런타임: RTX 3090에서 16프레임 서브맵으로 약 8.4 FPS(오픈셋 CLIP 임베딩 사용 시 6.3 FPS). 서브맵당 시간은 VGGT 추론(1248ms)이 대부분을 차지합니다. 동일한 머신에서 MASt3R-SLAM은 7.2 FPS, VGGT-SLAM은 6.9 FPS로 동작합니다. RealSense D455를 장착한 Jackal 지상 로봇에서 Jetson Thor 상에 완전히 온보드로 실행할 경우: 4프레임 서브맵으로 3.5 FPS의 실시간 동작.
- 오픈셋 물체 감지: Perception Encoder CLIP 임베딩(키프레임별) + SAM 3 분할이 텍스트 질의로부터 3D 지향 바운딩 박스를 질의당 약 0.36초(RTX 3090)에 제공합니다.
- 규모: 4,200평방피트 규모의 헛간(서브맵 34개)과, VGGT-SLAM이 발산하는 KITTI 주행 시퀀스(서브맵 44개)를 재구성합니다 — 둘 다 원본 논문에서 가장 큰 장면(서브맵 22개)보다 큽니다.
SLAM에서의 의미
파운데이션 모델 SLAM의 첫 물결(MASt3R-SLAM, VGGT-SLAM)은 개념을 증명했지만 오프라인으로 동작하거나 센서 속도보다 낮은 속도로 동작했습니다. VGGT-SLAM 2.0은 남은 간극을 메웁니다 — 임베디드 로봇 하드웨어에서 온라인으로 동작하는 밀집 피드포워드 재구성 — 이것이 로보틱스와 AR의 실제 요구사항입니다. 그 어텐션 레이어 분석 또한 눈에 띄는 발견입니다: 어떤 학습도 없이 동결된 파운데이션 모델로부터 루프 클로저 검증을 추출한다는 것은 이 모델들이 이미 얼마나 많은 잠재적 SLAM 메커니즘을 담고 있는지를 암시합니다. 아무것도 학습되지 않았기 때문에, 더 빠르거나 더 나은 VGGT 변형을 바로 대체해 넣을 수 있습니다.
관련 문서
- VGGT-SLAM — 이 버전이 대체하는 원본 시스템
- VGGT — 기반이 되는 피드포워드 기하학 모델
- MASt3R-SLAM — 동시대의 파운데이션 모델 SLAM
- DROID-SLAM — 이 계보에서 앞선 학습 기반 SLAM 기준선
- Visual Place Recognition (VPR) — VGGT의 어텐션이 공짜로 검증해 주는 검색 문제
- Clio — 루프 클로저 평가에 사용된 작업 지향 장면 그래프 데이터셋