UndeepVO

Li 2018 · 논문

한 줄 요약비지도 심층 학습으로 학습된 단안 visual odometry 시스템으로, 스테레오 이미지 쌍으로 학습하여 절대 메트릭 스케일을 복원하면서도 테스트 시에는 단안 입력만으로 동작합니다.

문제

지도 학습 기반 학습형 VO(DeepVO)는 대규모로 수집하기에 비용이 큰 정답 6-DoF 포즈가 필요하며, 최초의 자기 지도 대안(SfM-Learner)은 단안 비디오만으로 학습하기 때문에 근본적인 단안 한계를 그대로 물려받습니다: 깊이와 궤적은 알려지지 않은 스케일까지만 복원됩니다. UnDeepVO의 답은 다음과 같습니다: 런타임 센서나 후처리가 아니라 학습 시점의 스테레오 기하가 스케일을 제공하도록 하자 — 저자들이 주장하는 두 가지 “핵심 특징”은 비지도 학습 방식과 절대 스케일 복원입니다.

방법 및 아키텍처

Dp=Bf/Ddep,D_{p}=Bf/D_{dep},

(ff는 초점 거리, DdepD_{dep}는 예측된 깊이) — 여기서 메트릭 스케일이 들어옵니다. 한 이미지가 spatial transformer를 통해 다른 이미지로부터 합성되고, SSIM + L1을 결합한 광도 손실로 벌점을 받습니다. 예를 들어:

Lphol=λsLSSIM(Il,Il)+(1λs)Ll1(Il,Il),L_{pho}^{l}=\lambda_{s}L^{SSIM}(I_{l},I^{\prime}_{l})+(1-\lambda_{s})L^{l_{1}}(I_{l},I^{\prime}_{l}),

여기에 disparity 맵 일관성 손실과, 좌측·우측 시퀀스의 포즈 예측이 일치하도록 강제하는 포즈 일관성 손실 Lpos=λpLl1(xl,xr)+λoLl1(φl,φr)L_{pos}=\lambda_{p}L^{l_{1}}(\mathbf{x}^{\prime}_{l},\mathbf{x}^{\prime}_{r})+\lambda_{o}L^{l_{1}}(\varphi^{\prime}_{l},\varphi^{\prime}_{r})가 추가됩니다.

pk+1=KTk,k+1DdepK1pk,p_{k+1}=KT_{k,k+1}D_{dep}K^{-1}p_{k},

동일한 SSIM+L1 광도 손실로 벌점을 받고, 여기에 Tk,k+1T_{k,k+1} 하에서 두 프레임의 점 구름을 정렬하는 ICP 유사 3D 기하 정합 손실 Lgeok=Ll1(Pk,Pk)L_{geo}^{k}=L^{l_{1}}(P_{k},P^{\prime}_{k})가 추가됩니다.

실험 결과

SLAM에서의 의미

UndeepVO는 단안 스케일 문제를 런타임의 추가 센서가 아니라 학습 데이터의 기하로 공략할 수 있음을 보여준 최초의 연구 중 하나입니다: 스테레오 지도를 한 번만 사용하고, 영원히 단안으로 배포합니다. 이 스테레오 지도 자기 지도 학습 기법은 이후의 자기 지도 깊이 및 VO 방법들(포즈 네트워크와 결합된 MonoDepth 스타일의 광도 손실, 이후 정제되어 D3VO에서 직접 VO에 통합됨)의 표준 요소가 되었습니다. 고전적인 다중 뷰 기하 제약이 학습을 위한 무료 지도 신호로 사용될 수 있음을 보여주는 유용한 사례 연구입니다.

관련 문서