Ultimate-SLAM
Vidal 2018 · 论文
一句话总结 — Ultimate-SLAM是第一个在单一基于关键帧的非线性优化中紧密融合事件、标准帧和IMU的状态估计流水线,利用三种传感器的互补优势,在任一单一模态都会失效的HDR和高速场景中依然保持精度。
问题
没有任何单一传感器能覆盖全部工作场景。标准相机在大多数情形下——即低速、光照良好的场景中——能提供即时且丰富的信息,但在快速运动(同步曝光带来的运动模糊)和困难光照条件下(其约60 dB动态范围相较事件相机的140 dB而言)会严重失效。事件相机不受运动模糊的影响,且具有极高的动态范围,但在运动有限的情况下(例如近乎静止悬停时)只能输出很少的信息。IMU能提供高频率的动态信息,但若无视觉校正就会产生漂移。此前的事件+帧融合系统使用帧亮度作为模板来对齐事件——这恰恰使它们在事件相机具有优势的场景中失效。在本工作之前,还没有任何流水线能将这三种模态紧密融合在一起。
方法与架构
建立在Rebecq等人(BMVC 2017)的事件-惯性流水线之上,并扩展加入标准帧作为并行的视觉模态:
- 时空事件窗口:在每个标准帧的时刻 ,选取最近 个事件构成的窗口 (窗口持续时间会随事件速率自动调整;在四旋翼实验中 )。
- 运动补偿事件帧:每个窗口被压缩为一张合成图像 ,其中每个事件利用IMU积分得到的增量位姿和场景深度被扭曲到参考相机帧:,其中 是事件相机的投影, 是由IMU积分得到的增量变换, 用可见地标的中值深度来近似。
- 双重特征跟踪:FAST角点分别在运动补偿事件帧和标准帧上独立检测并用KLT跟踪(2个金字塔层级,的图像块,的分桶网格),得到两组异构的轨迹集合 、;可靠的轨迹经线性三角化生成持久的三维地标。
- 紧耦合后端:两组轨迹以及IMU项共同进入一个覆盖 个关键帧以及最近 帧滑动窗口的联合代价函数,使用Ceres求解:
其中重投影残差为 ,涵盖传感器索引 (事件相机/标准相机)、帧 、地标 ,再加上标准IMU运动学与偏置误差项 。这里没有显式的切换策略——优化过程会自然地对当前信息量最大的模态赋予更大权重。
- 实际细节:静态初始化估计初始俯仰/横滚角以及IMU偏置;一旦事件速率降至约 事件/秒以下(近乎静止运动,此时事件几乎消失),就会加入一个强的零速度先验。
实验结果
- 在Event Camera Dataset(DAVIS 240C:事件阵列 + 24 Hz帧 + 1 kHz IMU,硬件同步)上进行评估,排除了仅旋转序列和无IMU序列;轨迹按SE3在5秒时间段上对齐,误差以行驶距离的百分比报告。
- Fr+E+I与同一流水线单模态变体的对比:相较于事件+IMU平均位置精度提升130%,相较于帧+IMU提升85%。示例平均位置误差(Fr+E+I / E+I / Fr+I):dynamic_6dof为0.19% / 0.38% / 0.62%,hdr_boxes为0.37% / 0.67% / 0.78%,shapes_6dof为0.10% / 0.48% / 0.17%。
- 相较于最先进的事件+IMU方法(Rebecq等人2017):在几乎所有序列上都更优,例如poster_translation为0.12%对0.46%,shapes_6dof为0.10%对0.42%。
- 首次使用事件相机进行状态估计的自主四旋翼飞行,在Odroid XU4(2.0 GHz四核)上机载运行:(i) 在房间灯光中途关闭再打开的情况下飞行(帧完全变黑,但事件仍能保持跟踪);(ii) 在弱光房间中以高达1.68米/秒(约340像素/秒的光流)快速转圈,此时帧会模糊,但事件帧依然清晰;(iii) 悬停时,事件跟踪失效,但帧跟踪能保持无漂移。
对SLAM的意义
Ultimate-SLAM解决了事件相机领域早期的一个战略性问题:事件最强大的作用是作为帧和IMU的补充,而不是彼此的替代——每种模态都能弥补其他模态的盲区,而在估计器层面(而非像素层面)进行融合能带来更平滑的性能退化。它提出的事件+帧+IMU紧耦合因子图公式成为后续事件VIO工作(ESVIO、EDS风格的混合系统)的标准模板,其四旋翼实验也是证明事件感知能够拓展真实机器人安全工作范围的里程碑式演示。