AMB3R

Wang 2025 · 논문

한 줄 요약 — DUSt3R/VGGT 계열의 피드포워드 3D 재구성 모델로, 고정된(frozen) VGGT에 메트릭 스케일 헤드와 희소 볼류메트릭 백엔드를 추가하여, 미세조정이나 테스트 시점 최적화 없이 하나의 네트워크가 다중 뷰 재구성, 보정되지 않은 시각 오도메트리, 대규모 SfM을 모두 처리하게 합니다.

문제

포인트맵 모델(DUSt3R, MASt3R, VGGT)은 픽셀별 3D 기하를 회귀하지만, 네트워크는 2D 격자 위에서 동작합니다: TSDF, 특징 격자, 좌표 네트워크가 공유하는 속성인 공간적 압축성(spatial compactness) — 하나의 3D 위치는 하나의 값을 가지며, 이것이 동일한 점에 대한 여러 관측을 일관된 기하로 융합해준다는 성질 — 이 강제되지 않습니다. 겹치는 픽셀들의 포인트맵 예측은 서로 일치하도록 암묵적으로만 유도됩니다. 이 모델들을 배치 가능한 SfM/SLAM 엔진에서 두 걸음 더 떨어뜨리는 간극도 있습니다: 예측이 메트릭 스케일이 아니라 정규화되어 있다는 점, 그리고 기존 시스템이 VO/SfM으로 동작하기 위해 최적화 기반 백엔드(예: VGGT-SLAM의 SL(4) 팩터 그래프)나 과제별 튜닝이 필요했다는 점입니다. AMB3R(“Accurate feed-forward Metric-scale 3D reconstruction with Backend”)은 하나의 모델 안에서 이 세 가지 모두를 목표로 합니다.

방법 및 아키텍처

실험 결과

13개 데이터셋에 걸쳐 7가지 과제로 평가(모든 거리는 cm 단위; ATE RMSE는 evo로 계산):

SLAM에서의 의미

포인트맵 계열은 점진적으로 고전적인 SfM/SLAM 스택을 흡수하고 있으며, AMB3R은 하나의 경계선을 표시합니다: 보정 없는 피드포워드 시스템이 TUM에서 보정된 최적화 기반 SLAM을 능가한 것입니다. 두 가지 아이디어가 독립적으로 중요합니다 — 고정된 특징으로부터 복원된 메트릭 스케일은 IMU나 스테레오 없이 단안 스케일 모호성을 해결하며, 콤팩트한 3D 백엔드는 포인트맵 회귀가 잃어버린 공간적 압축성 사전(prior)을 학문적 규모의 학습 비용으로 복원합니다. 남아 있는 한계(명시적인 루프 클로저나 재지역화 없음, 뷰 수에 대한 2차 어텐션 비용, 기준 프레임 사전에 대한 의존)는 최적화 백엔드가 여전히 제 값을 하는 지점을 정확히 보여줍니다.

관련 문서