DEVO
Klenk 2024 · 논문
한 줄 요약 — DEVO(Deep Event Visual Odometry)는 DPVO 스타일의 학습된 희소 패치 오도메트리 아키텍처를 단안 이벤트 스트림에 적용하고, 순전히 시뮬레이션된 이벤트로만 학습하면서도 실제 이벤트 벤치마크로 일반화하여, 기존 이벤트 전용 방법 대비 포즈 추적 오차를 최대 97%까지 줄입니다.
문제
이벤트 카메라는 고속 움직임과 불리한 조명 조건에서도 카메라 추적을 가능하게 할 것으로 기대되지만, 기존의 이벤트 기반 단안 VO는 최근 벤치마크에서 제한된 성능을 보였습니다. 이를 보완하기 위해 많은 시스템이 IMU, 스테레오 이벤트 카메라, 프레임 기반 카메라 등 추가 센서를 도입했지만, 이는 비용을 높이고 시스템 요구사항(공간, 전력, 캘리브레이션)을 복잡하게 만들며, 프레임 카메라에 의존하는 것은 이벤트가 회피하고자 했던 모션 블러와 HDR 취약성을 정확히 다시 끌어옵니다. DEVO는 다음을 묻습니다: 추가 센서 없이 일반적인 실세계 단안 이벤트 전용 VO의 한계는 어디까지인가?
방법 및 아키텍처
이벤트 표현. 이벤트 는 복셀 그리드 로 비닝됩니다(5개 시간 빈에 걸친 이벤트 개수의 이중 선형 보간, 평균 0/단위 분산으로 정규화). 학습 시 각각은 실측 포즈 와 역깊이 맵 와 짝지어집니다.
DPVO 스타일 백본. DEVO는 DPVO의 동적 패치 그래프와 순환 업데이트 연산자를 재사용합니다: 위의 희소 이벤트 패치는 인접한 복셀 그리드에 연결되고, 업데이트 연산자는 광학 흐름 보정 와 신뢰도 가중치 를 반복적으로 예측하며, 미분 가능한 번들 조정(DBA) 레이어가 키프레임의 슬라이딩 윈도우에 걸쳐 카메라 포즈와 패치 깊이를 업데이트합니다.
심층 이벤트 패치 선택(핵심 혁신). 이벤트는 이미지 평면을 희소하게 덮으므로, 무작위 또는 그래디언트 기반 패치 샘플링은 빈 영역이나 잡음이 많은 영역에 용량을 낭비합니다. 작은 CNN(8/16/32 채널의 3×3 conv+ReLU 레이어 세 개, 이어서 1채널 레이어, 4×4 최대 풀링, 시그모이드)이 추적 가능한 좌표를 강조하는 점수 맵 을 예측합니다. 이는 점수 레이블 없이 자기 지도 손실로 학습됩니다:
이는 흐름 잔차 가 크거나 DBA 가중치 가 작은 곳에서 점수 를 낮춥니다. 전체 손실은 입니다. 추론 시 패치는 **풀링된 다항 샘플링(pooled multinomial sampling)**으로 뽑힙니다: 점수 맵을 4×4 평균 풀링한 뒤, 비복원으로 그리드 셀에 대한 다항 분포에서 좌표를 샘플링하고, 각 4×4 창 안에서 정밀화합니다 — top- 선택보다 점수 맵의 이상치에 더 강인합니다.
시뮬레이션 전용 학습. 이벤트는 이벤트 생성 모델 를 사용하여 모든 TartanAir 시퀀스에서 ESIM으로 시뮬레이션되며, 대비 임계값은 시퀀스마다 무작위화됩니다(), 여기에 시뮬레이션-실제 간극을 줄이기 위한 광도계 복셀 증강이 추가됩니다. 학습: A40 GPU 2개로 240k 반복, 시퀀스 길이 , 패치(~2.5일).
실험 결과
- 7개 실세계 벤치마크(UZH-FPV, VECtor, HKU, EDS, TUM-VIE, RPG, MVSEC)에서 5회 실행의 중앙값으로 평가하며, 모든 곳에서 동일한 파라미터 사용(키프레임 임계값만 데이터셋별로 다름); 지표는 ATE [cm], 회전 RMSE, MPE [%/m]. 핵심 결과: 기존 이벤트 전용 방법 대비 포즈 추적 오차 최대 97% 감소.
- UZH-FPV(드론 레이싱): 다른 모든 성공적인 방법이 IMU를 사용함에도 9개 시퀀스 중 4개에서 최고 성능; DPVO와 EVO는 모든 시퀀스에서 실패.
- VECtor: EVO와 ESVO는 각각 시퀀스의 88%와 76%에서 실패; DEVO는 시퀀스의 70%에서 ESVIO(스테레오 이벤트 + 스테레오 프레임 + IMU)조차 능가.
- HKU: 9개 시퀀스 중 5개에서 최고 성능; EVO와 ESVO는 모두 실패.
- TUM-VIE: 모든 이벤트 전용 방법 대비 ATE 최소 44% 낮음; RPG: 이벤트 전용 방법 대비 ATE 최소 63% 낮음, USLAM 대비 평균 ATE 88% 낮고 EDS 대비 28% 낮음.
- 코드, 학습, 이벤트 데이터 생성이 오픈소스로 공개됨(github.com/tum-vision/DEVO).
SLAM에서의 의미
DEVO는 심층 VO 혁명이 이벤트 카메라에 도달한 순간을 나타냅니다: 고전적 이벤트 오도메트리(EVO, ESVO)는 수작업으로 설계된 정렬 목적함수에 의존하여 잡음과 희소성에 취약한 반면, DEVO의 학습된 프론트엔드는 이러한 영향을 데이터로부터 흡수합니다. 시뮬레이션 전용 학습 전략은 아마도 가장 영향력 있는 부분입니다 — 이는 이벤트 데이터 병목을 우회하는 실용적인 경로를 보여주며, 프레임 기반 방법을 변모시킨 스케일링 동역학을 이벤트 SLAM에도 열어줍니다.