Visual-SLAM why filter?

Strasdat 2012 · 논문

한 줄 요약 — 키프레임 기반 번들 조정이 동일한 계산 시간당 필터링보다 더 높은 정확도를 준다는 것을 엄밀하게 보여, visual SLAM이 필터링에서 최적화로 이동한 패러다임 전환을 공식화했습니다.

문제

2012년 당시 실시간 단안 SLAM에 대해 두 가지 검증된 방법이 있었습니다: MonoSLAM(2007)은 EKF로 카메라 포즈와 랜드마크를 결합 추정했고, PTAM(2007)은 키프레임 기반 번들 조정을 도입했습니다. 둘 다 실시간으로 동작했지만, 커뮤니티는 원리적인 비교 결과를 갖고 있지 않았습니다. 두 패러다임은 SLAM 그래프에 대해 정반대의 구조적 선택을 합니다: 필터링은 과거의 모든 포즈를 마지널라이즈하여 현재 포즈와 모든 랜드마크에 대한 밀집 결합 분포를 남기는 반면, 키프레임 BA는 키프레임이 아닌 포즈와 그 관측값들을 단순히 버려서 문제를 희소하게 유지합니다. Strasdat, Montiel, Davison은 물었습니다: 동일한 계산 예산에서 어느 선택이 더 많은 정확도를 사는가?

방법 및 아키텍처

신중하게 대응시킨 두 파이프라인을 모두 구현하여 몬테카를로 시뮬레이션에서 실행했습니다.

BA-SLAM: 각 키프레임에서, 특징점이 시야를 벗어난 곳에 대체 포인트를 초기화하고, 모션만의 BA로 포즈를 추정하고, 구조만의 BA로 포인트를 정제한 다음, 모든 것을 결합 최적화합니다(g2o, Schur complement를 이용한 Levenberg–Marquardt):

χ2(y)=zi,jZ0:i(zi,jz^(Ti,xj))2,χ2(Ti)=zjZi(zjz^(Ti,xj))2,\chi^2(\mathbf{y}) = \sum_{\mathbf{z}_{i,j} \in Z_{0:i}} \big(\mathbf{z}_{i,j} - \hat{\mathbf{z}}(\mathbf{T}_i, \mathbf{x}_j)\big)^2, \qquad \chi^2(\mathbf{T}_i) = \sum_{\mathbf{z}_j \in Z_i} \big(\mathbf{z}_j - \hat{\mathbf{z}}(\mathbf{T}_i, \mathbf{x}_j)\big)^2,

y=(T1,...,Ti,X)\mathbf{y} = (\mathbf{T}_1, ..., \mathbf{T}_i, \mathcal{X})^\top 위에서, 첫 프레임을 게이지(gauge)로 고정합니다.

Filter-SLAM: 필터링에 가장 유리한 조건이 되도록 의도적으로 구축된, 최신 기술 수준의 Gauss–Newton 정보 필터입니다: 포인트는 앵커링된 역깊이 좌표 ψj:=inv_d(Aa(j)xj)\boldsymbol{\psi}_j := \mathrm{inv\_d}(A_{a(j)}\, \mathbf{x}_j)를 사용하며 inv_d(a)=1a3(a1,a2,1)\mathrm{inv\_d}(\mathbf{a}) = \frac{1}{a_3}(a_1, a_2, 1)^\top이고, 각 업데이트는 가우시안 지도 사전 분포에 대한 관측 잔차를 최소화합니다:

χ2(Φi,Ti)=(ΦiΦi1)ΛΦi1(ΦiΦi1)+zjZidjΛzdj,\chi^2(\Phi_i, \mathbf{T}_i) = (\Phi_i \boxminus \Phi_{i-1})^\top \Lambda_{\Phi_{i-1}} (\Phi_i \boxminus \Phi_{i-1}) + \sum_{\mathbf{z}_j \in Z_i} \mathbf{d}_j^\top \Lambda_z \mathbf{d}_j,

이어서 정보 행렬 업데이트 Λi=Λi1+Ddiag(Σz1,)D\Lambda_i = \Lambda_{i-1} + D^\top \mathrm{diag}(\Sigma_z^{-1}, \ldots)\, D가 이루어지며, 여기서 DD는 재투영 야코비안을 쌓은 것입니다. 필터의 결정적인 특성: 흡수된 관측치의 선형화 지점은 영원히 고정되는 반면, BA는 매 반복마다 모든 것을 재선형화합니다.

평가지표. 정확도는 최종 포즈의 이동 오차이며, RMSE와 가장 약한 설정에 대한 상대적 엔트로피 감소량(비트 단위)으로 측정됩니다,

E=12log2det(ΣMmin,15)det(ΣM,N),E = \frac{1}{2} \log_2 \frac{\det(\Sigma_{\langle M_{\min},\,15 \rangle})}{\det(\Sigma_{\langle M,N \rangle})},

중간 프레임 수 MM과 포인트 수 NN을 다양하게 바꾸며 측정합니다; 효율성은 계산 초당 엔트로피 감소량(E/cE/c, 초당 비트)입니다. 시간복잡도: BA는 O(NM2+M3)O(NM^2 + M^3)이고(Schur complement + 축소 카메라 시스템), 필터링은 O(MN3)O(MN^3)입니다 — 포인트 수에 대해 선형 대 3차. 네 가지 카메라 모션이 테스트됩니다(전체 장면 겹침이 있는 측면 이동; 부분 겹침만 있는 측면 이동; 측면 이동 + 30° 회전; 급격한 전진 회전), 각각 단안과 스테레오로, 관측 잡음은 σz=12\sigma_z = \frac{1}{2} 픽셀입니다.

실험 결과

SLAM에서의 의미

이 논문은 PTAM이 경험적으로 보여준 전환에 대한 이론적 정당성을 제공하여, 키프레임 기반 번들 조정을 표준 visual SLAM 백엔드로 확립했습니다. ORB-SLAM, LSD-SLAM, DSO 그리고 본질적으로 이후의 모든 시스템이 이 결론 위에 세워져 있으며, 정확도 대 예산이라는 방법론은 SLAM 설계 선택을 논증하는 표준적인 방식이 되었습니다. 오늘날에도 중요한 뉘앙스에 주목하십시오: 이 논증은 랜드마크가 많은 시각 전용 SLAM에 관한 것입니다 — 밀결합(tightly-coupled) VIO 시스템은 트레이드오프가 다른 상황에서 여전히 필터를 사용하며(예: MSCKF), 저자들 스스로도 이 주장의 범위를 지역 SLAM으로 한정하고 루프 클로저는 외관 기반 방법에 맡겼습니다.

관련 문서