MASt3R-SLAM

Murai 2024 · 논문

한 줄 요약 — 2-뷰 3D 재구성 사전 모델(MASt3R)로부터 밑바닥부터 설계된 최초의 실시간 밀도 SLAM 시스템으로, 보정되지 않은 단안 비디오로부터 15FPS로 전역적으로 일관된 포즈와 밀도 지도를 생성한다.

문제

고전적 밀도 단안 SLAM은 보정된 카메라를 필요로 하며, 기하는 깊이 센서 또는 취약한 다중 뷰 스테레오로부터 얻는다; 이는 실세계 비디오에서 성능이 크게 저하된다. MASt3R는 그 반대의 트레이드오프를 제공한다: 강건하고 보정이 필요 없는 강력한 2-뷰 재구성 및 매칭 사전 모델이지만, 키프레임, 전역 일관성, 실시간 동작이라는 개념이 전혀 없다 — 그 자체의 밀집 매칭만으로도 쌍당 약 2초가 걸린다. MASt3R-SLAM은 이 사전 모델 위에 밑바닥부터 완전한 SLAM 시스템을 구축하여, 그 범용성을 유지하면서 SLAM이 요구하는 모든 것을 추가한다.

방법 및 아키텍처

파이프라인: 각 프레임은 현재 키프레임과 짝지어져 MASt3R, FM(If,Ik)\mathcal{F}_M(\mathcal{I}^f, \mathcal{I}^k)를 통과하며, 포인트맵 X\mathbf{X}, 신뢰도 C\mathbf{C}, 매칭 특징 D\mathbf{D}, 특징 신뢰도 Q\mathbf{Q}를 산출한다. 추적은 상대 포즈를 추정하고 기하를 키프레임에 융합한다; 백엔드는 검색을 통해 루프 클로저 에지를 추가하고 2차 전역 최적화를 실행한다.

Er=m,nmf,kψ(X~k,nk)ψ(TkfXf,mf)w(qm,n,σr2)ρ,E_r = \sum_{m,n \in \mathbf{m}_{f,k}} \left\| \frac{\psi\big(\tilde{\mathbf{X}}^k_{k,n}\big) - \psi\big(\mathbf{T}_{kf} \mathbf{X}^f_{f,m}\big)}{w(\mathbf{q}_{m,n}, \sigma_r^2)} \right\|_\rho ,

Gauss–Newton IRLS로 풀린다, (JWJ)τ=JWr(\mathbf{J}^\top \mathbf{W} \mathbf{J}) \boldsymbol{\tau} = -\mathbf{J}^\top \mathbf{W} \mathbf{r}, 순수 회전 퇴화를 피하기 위한 작은 거리 항이 추가된다.

실험 결과

i9-12900K + RTX 4090에서 ~15FPS로 실행(실시간을 모사하기 위해 프레임을 2배로 서브샘플링); 스케일 정렬된 궤적에 대한 ATE RMSE(미터 단위):

SLAM에서의 의미

MASt3R-SLAM은 플러그 앤 플레이다: 줌이나 왜곡이 변화하는 임의의 카메라로 촬영한 비디오를 넣으면, 깊이 센서도, 보정 절차도, 장면별 학습도 없이 밀도가 높고 전역적으로 일관된 기하를 얻을 수 있다. 이는 단안 밀도 SLAM이 무엇을 해낼 수 있어야 하는지에 대한 기준선을 재정의했으며, 그 아키텍처(학습된 2-뷰 사전 모델 + 고전적 Sim(3) 그래프 최적화)는 대부분의 파운데이션 모델 기반 SLAM 시스템이 따르는 틀이 되었다.

실습

관련 문서