DeepVO

Wang 2017 · 论文

一句话总结 — DeepVO(ICRA 2017)是端到端学习式视觉里程计的开创性工作:一个循环卷积网络(RCNN)直接从原始单目视频回归6自由度相机位姿,取代了整个经典VO流程。

问题

经典单目VO由一套标准流程构成——相机标定、特征检测、特征匹配/跟踪、异常值剔除(RANSAC)、运动估计、尺度估计、局部优化(BA)——其各个组件”需要被精心设计并针对不同环境专门调优才能表现良好”,而且恢复绝对尺度需要先验知识(例如相机高度)。DeepVO提出了在当时颇为激进的问题:一个深度网络能否端到端地学习从原始图像序列到相机位姿的整个映射,“不采用经典VO流程中的任何模块(甚至连相机标定也不需要)”?

方法与架构

hk=H(Wxhxk+Whhhk1+bh),yk=Whyhk+by,\mathbf{h}_{k}=\mathcal{H}(\mathbf{W}_{xh}\mathbf{x}_{k}+\mathbf{W}_{hh}\mathbf{h}_{k-1}+\mathbf{b}_{h}), \qquad \mathbf{y}_{k}=\mathbf{W}_{hy}\mathbf{h}_{k}+\mathbf{b}_{y},

但这里使用了LSTM(带记忆单元 ck\mathbf{c}_{k} 的输入门、遗忘门和输出门)来捕捉长期依赖关系——隐式地建模运动动力学以及纯逐帧对方法所忽略的帧间关系。每个时间步都会输出一个位姿估计。

θ=argminθ1Ni=1Nk=1tp^kpk22+κφ^kφk22,\boldsymbol{\theta}^{*}=\operatorname*{argmin}_{\boldsymbol{\theta}}\frac{1}{N}\sum_{i=1}^{N}\sum_{k=1}^{t}\left\|\hat{\mathbf{p}}_{k}-\mathbf{p}_{k}\right\|_{2}^{2}+\kappa\left\|\hat{\boldsymbol{\varphi}}_{k}-\boldsymbol{\varphi}_{k}\right\|_{2}^{2},

其中尺度因子 κ=100\kappa=100 用于平衡朝向与位置。选用欧拉角而非四元数,因为四元数的单位范数约束会阻碍优化过程。

实验结果

对SLAM的意义

在大多数课程体系中,“学习式SLAM”正是从DeepVO开始的:它既展示了希望(无需手工工程、隐式尺度、通过RNN获得的时间先验),也暴露了核心局限(对训练域的记忆化——论文自己在高速场景下的失败案例)——这正是端到端位姿回归的问题所在。理解DeepVO为何难以泛化——网络中完全没有显式几何——正是自监督路线(SfM-Learner、UnDeepVO)以及后续几何-学习混合系统最好的出发点。

相关条目