Ultimate-SLAM

Vidal 2018 · 논문

한 줄 요약 — Ultimate-SLAM은 이벤트, 표준 프레임, IMU를 하나의 키프레임 기반 비선형 최적화에 긴밀하게 융합하는 최초의 상태 추정 파이프라인으로, 세 센서의 상호 보완적인 강점을 활용하여 어느 한 모달리티라도 실패하는 HDR 및 고속 시나리오에서도 정확도를 유지합니다.

문제

단일 센서로는 전체 동작 범위를 다 다룰 수 없습니다. 표준 카메라는 대부분의 경우 — 저속, 조명이 좋은 시나리오에서 — 즉각적이고 풍부한 정보를 제공하지만 빠른 동작(동기식 노출로 인한 모션 블러)과 까다로운 조명(약 60 dB의 동적 범위 대 이벤트 카메라의 140 dB)에서는 심각하게 실패합니다. 이벤트 카메라는 모션 블러를 겪지 않고 매우 높은 동적 범위를 가지지만, 거의 정지 상태의 호버링처럼 동작이 제한적일 때는 정보를 거의 출력하지 않습니다. IMU는 고속 동역학을 제공하지만 시각적 보정 없이는 드리프트됩니다. 이전의 이벤트+프레임 시스템은 프레임 밝기를 이벤트를 정렬하기 위한 템플릿으로 사용했기 때문에 — 정확히 이벤트가 강점을 가지는 지점에서 실패했습니다. 이 연구 이전에는 세 모달리티를 모두 긴밀하게 융합한 파이프라인이 없었습니다.

방법 및 아키텍처

Rebecq 등(BMVC 2017)의 이벤트-관성 파이프라인을 기반으로, 표준 프레임을 병렬 시각 모달리티로 확장했습니다:

J=i=01k=1KjJ(i,k)ei,j,kTWri,j,kei,j,k+k=1K1eskTWskeskJ = \sum_{i=0}^{1}\sum_{k=1}^{K}\sum_{j\in\mathcal{J}(i,k)} {\mathbf{e}^{i,j,k}}^{T}\mathbf{W}_r^{i,j,k}\,\mathbf{e}^{i,j,k} + \sum_{k=1}^{K-1} {\mathbf{e}_s^{k}}^{T}\mathbf{W}_s^{k}\,\mathbf{e}_s^{k}

재투영 잔차 eri,j,k=zi,j,kπi(TCiSkTSWkli,j)\mathbf{e}_r^{i,j,k} = \mathbf{z}^{i,j,k} - \pi_i(\mathbf{T}_{C_i S}^{k}\mathbf{T}_{SW}^{k}\,\mathbf{l}^{i,j})는 센서 인덱스 ii(이벤트/표준 카메라), 프레임 kk, 랜드마크 jj에 걸쳐 있으며, 여기에 표준 IMU 운동학 및 바이어스 오차항 es\mathbf{e}_s가 더해집니다. 명시적인 전환 정책은 없습니다 — 최적화가 현재 정보가 풍부한 모달리티를 자연스럽게 더 무겁게 가중합니다.

실험 결과

SLAM에서의 의미

Ultimate-SLAM은 이벤트 카메라 분야의 초기 전략적 질문 하나를 해결했습니다: 이벤트는 프레임과 IMU를 전면적으로 대체하는 것이 아니라 보완하는 것으로서 가장 강력하다는 것입니다 — 각 모달리티가 서로의 사각지대를 메우며, (픽셀이 아닌) 추정기 수준에서 융합하면 성능 저하가 완만해집니다. 이 논문의 긴밀 결합 이벤트+프레임+IMU 인자 그래프 정식화는 이후의 이벤트 VIO 연구(ESVIO, EDS 스타일 하이브리드)의 표준 템플릿이 되었으며, 쿼드로터 실험은 이벤트 센싱이 실제 로봇의 안전한 동작 범위를 확장한다는 것을 보인 획기적인 시연이었습니다.

관련 문서