ESVO
Zhou 2021 · 논문
한 줄 요약 — ESVO는 최초로 발표된 이벤트 기반 스테레오 시각적 오도메트리 시스템입니다: 타임 서페이스 위에 전적으로 구축된 병렬 추적-매핑 설계로, 스테레오 시공간 일관성이 계량적 반밀집 깊이를 만들어내고 포즈는 이벤트를 그 맵에 등록하여 얻으며 — CPU에서 실시간으로 동작합니다.
문제
단안 이벤트 VO는 스케일까지만 포즈를 복원합니다; 알려진 베이스라인을 가진 스테레오 리그는 IMU 없이 절대 계량적 깊이를 제공합니다. 하지만 이벤트 카메라를 위한 스테레오 매칭은 간단하지 않습니다: 시간적 동시성이 픽셀 수준에서 엄밀하게 성립하지 않고(지연, 지터, 서로 다른 이벤트 발화율), 이벤트는 상관 관계를 계산할 강도 정보를 담고 있지 않습니다 — 고전적인 동기화된 강도 패치 매칭이 적용되지 않습니다. ESVO는 일반적인 6자유도 움직임 아래 자연 장면에서 스테레오 이벤트 리그로부터 VO를 풀고자 했으며, 원칙적이면서도 상용 하드웨어에서 실시간 동작이 가능할 만큼 효율적인 해법을 목표로 했습니다.
방법 및 아키텍처
공통 통화(currency)가 **타임 서페이스(TS)**인 병렬 추적-매핑 시스템입니다: 각 픽셀 에서, 를 그곳의 마지막 이벤트 타임스탬프라 하면,
붕괴율 ms를 가지며 — 최근 엣지 움직임을 압축한 2D 맵으로, 100 Hz로 갱신됩니다.
- 매핑 — 이벤트별 역깊이: 좌측 카메라의 에 있는 이벤트에 대해, 역깊이 는 깊이 가설을 두 타임 서페이스로 투영한 지점 를 중심으로 한 패치 사이의 부호 있는 픽셀별 잔차 를 사용해 시간적 비일관성 를 최소화합니다. 이는 전방 투영입니다: 깊이 가설이 곧 후보 스테레오 매칭이므로, 매칭과 삼각측량이 한 단계에서 일어납니다. Gauss-Newton 업데이트 로 풀며, 에피폴라 블록 매칭으로 초기화됩니다.
- 매핑 — 확률적 융합: 잔차는 경험적으로 Student’s 분포를 따르므로, 각 추정값은 불확도 를 가지며 분산은 입니다; 강인한 IRLS가 단순 최소자승을 대체합니다. 20회 스테레오 관측으로부터의 추정값은 공통 시각으로 전파되어 Student’s- 베이지안 필터로 융합됩니다(가설은 일 때 호환되며, 그렇지 않으면 분산이 더 낮은 것을 유지), 20 Hz의 반밀집 역깊이 맵을 만들어냅니다.
- 추적 — 거리장으로서의 TS 네거티브: “네거티브” 는 현재 엣지 위치에 대한 비등방성 거리장으로 작동합니다. 리그 포즈는 깊이 맵의 지지 영역 에 대해 을 최소화하는 워프 (Cayley 회전 + 이동)입니다 — 전방 합성 Lucas-Kanade 방법, Huber 노름 IRLS, 확률적 LM 샘플링(반복당 개 포인트, ~5회 반복)으로 풀립니다. 왼쪽 TS만 사용합니다(오른쪽을 추가하면 비용이 두 배가 되지만 정확도 향상은 미미함).
실험 결과
- 설정: DAVIS240C 리그(14.7 cm 베이스라인), DAVIS346 드론 데이터(MVSEC/upenn, 10 cm), 시뮬레이터, 저자들의 자체 DAVIS346 리그(7.5 cm 베이스라인); C++/ROS, Intel Core i7-8750H 노트북 CPU에서 실시간(매핑 ~20 Hz).
- 매핑: Student’s- IRLS 솔버가 표준 LS를 능가합니다(합성 3-평면 데이터에서 평균 깊이 오차 2.15 cm 대 2.76 cm, 표준편차 1.29 대 2.94 cm, 게다가 융합된 추정값 ~52% 더 많음). LiDAR 실측값이 있는 시퀀스에서 스테레오 기준선 GTS, SGM, CopNet과 비교 시 ESVO가 모든 기준에서 최고입니다 — 예: upenn_flying1: 평균 오차 0.16 m, 상대 오차 3.05% 대 0.31 m / 5.64%(GTS), 0.31 m / 5.58%(SGM), 0.59 m / 10.93%(CopNet).
- 전체 VO: 6개 시퀀스 모두에서 이벤트 기반 SGM+ICP 기준선을 능가합니다(예: upenn_flying1에서 ATE 13.9 cm 대 95.8 cm); rpg 핸드헬드 시퀀스에서는 스테레오 ORB-SLAM2(전역 BA 없음)보다 약간 뒤처지지만, 프레임이 어려움을 겪는 upenn 드론 시퀀스에서는 명확히 우수합니다(ATE 13.9 대 49.8 cm, 11.1 대 50.2 cm).
- 저자들의 자체 녹화 데이터로 저조도 및 HDR 조건에서 VO를 시연; 소프트웨어, 리그 설계, 데이터셋이 오픈소스로 공개됨(T-RO 2021에 게재), ESVO를 표준 스테레오 이벤트 VO 기준선으로 만들었습니다.
SLAM에서의 의미
ESVO는 프레임 기반 SLAM을 성숙시킨 스테레오 레시피(베이스라인으로부터의 계량적 스케일, IMU 불필요)가 이벤트 카메라로도 전이됨을 보여주었습니다 — 다만 스테레오 매칭을 강도가 아닌 이벤트 타이밍을 중심으로 재고한 뒤에야 가능했습니다. 핵심 아이디어 두 가지 — 깊이를 위한 스테레오 타임 서페이스 간 시공간 일관성, 그리고 추적을 위한 거리장으로서의 타임 서페이스 네거티브 — 는 표준 도구가 되었습니다. 이는 스테레오 이벤트 설계 위에 긴밀 결합된 IMU 및 이미지 융합을 추가하는 ESVIO에 직접적인 동기를 부여했으며, DEVO 같은 학습 기반 시스템을 포함해 더 최신 시스템들이 비교하는 기준점으로 남아 있습니다.