Event-based Vision Survey
Gallego 2020 · 论文
一句话总结 — 这是事件相机视觉领域的权威综述(发表于TPAMI),将传感器、事件表示、算法和应用组织成一个连贯的分类体系,成为该领域的标准入门读物。
问题
事件相机具有对机器人在复杂场景中极具变革性的特性——微秒级的时间分辨率与延迟、极高的动态范围(140 dB,相比之下传统相机约为60 dB)、以及低功耗(芯片级约10 mW,完整嵌入式系统低于100 mW)。但其非常规的输出——一个稀疏、异步的逐像素亮度变化流——与传统计算机视觉工具箱不兼容:数据是异步且稀疏的,而图像是同步且稠密的;每个事件只携带二值的变化信息,该信息同时依赖于运动和场景亮度;而对时间对比度量化过程中噪声的建模也并不完善。到2010年代末,相关文献已经快速增长且高度碎片化;该领域急需一个统一的概览和共享的词汇体系。
方法与架构
这篇综述将一切都建立在事件生成模型之上:一个具有对数亮度 的像素,当其自上一次事件以来的亮度增量
达到对比度阈值时,就会触发一个事件 :即 ,其中极性 ,(通常为10-50%的光照变化)。这引出了两个贯穿整个领域的推论:事件近似于时间导数,;并且——借助亮度恒定假设——事件是由移动的边缘引起的:,因此一个沿自身方向平行移动的梯度不会产生任何事件。基于这一基础,该综述构建了以下分类体系:
- 事件表示:单个事件(用于滤波器和脉冲神经网络)、事件包、事件帧/二维直方图、时间面(每个像素记录最近一次事件的时间戳,即运动历史)、体素网格(保留时间戳的时空直方图)、三维点集,以及运动补偿事件图像——按照运动假设对事件进行扭曲变换,并最大化所得扭曲事件图像的清晰度/对比度(即对比度最大化框架)。
- 处理范式:逐事件方法(概率滤波器、脉冲神经网络——延迟最小)与针对事件组/事件包的方法(信噪比更好,但有一定延迟);此外还有正交的基于模型方法与数据驱动方法之分。
- 按任务分类的算法:特征检测与跟踪、光流、三维重建(用于SLAM的瞬时立体和单目多视图重建)、位姿估计与SLAM(从仅旋转和平面场景设置追溯到如EVO这样的完整6自由度纯事件系统)、图像重建、分割、识别,以及神经形态控制。
- 硬件背景:传感器家族(DVS、DAVIS、ATIS及更高分辨率的后继产品)及厂商规格对比,以及神经形态处理器(脉冲神经网络硬件)和基于事件的控制,将算法与其所依赖的硬件联系起来。
实验结果
作为一篇综述,其贡献在于组织归纳而非实验:它将该领域数百篇参考文献提炼为一个连贯的、以模型为基础的分类体系,其术语(时间面、体素网格、运动补偿)成为标准词汇。其讨论部分诚实地指出,目前对于最佳表示方法或算法尚无共识——各种权衡(延迟与功耗与精度;灵敏度与带宽)都取决于具体应用,且大多未被量化——并列出了尚存的开放挑战:运动依赖的外观变化破坏数据关联、噪声建模、端到端的事件感知到控制系统,以及将深度学习适配到事件数据上。该综述由该领域的领军团队(Gallego、Delbruck、Scaramuzza、Davison、Leutenegger、Daniilidis等)撰写,自发表以来几乎成为每一篇事件视觉论文的默认首要引用文献。
对SLAM的意义
如果你在接触基于事件的SLAM之前只想读一篇文献,那就读这篇综述:本级别中几乎每一个系统(EVO、ESVO、Ultimate-SLAM、EKLT、EDS、DEVO)都最容易通过它所建立的词汇和分类体系来理解,而其事件生成方程正是这些系统前端所依赖的物理模型。它还梳理了尚未解决的问题——绝对光强信息的丢失、噪声、运动依赖外观下的数据关联、在事件数据上的学习——这些至今仍是研究前沿所关注的问题。可以将其与社区维护的Awesome-Event-based-Vision仓库搭配阅读,以获取数据集(Event Camera Dataset、MVSEC、DSEC)、仿真器(ESIM、v2e)和代码。