UndeepVO

Li 2018 · 论文

一句话总结 — 一种通过无监督深度学习训练的单目视觉里程计系统,通过在立体图像对上训练来恢复绝对度量尺度,而在测试时仅使用单目输入运行。

问题

监督学习的VO(DeepVO)需要真值6自由度位姿,而大规模采集这类数据代价高昂;第一个自监督替代方案(SfM-Learner)仅依靠单目视频进行训练,因而继承了单目方法的根本局限:深度和轨迹只能恢复到一个未知的尺度。UnDeepVO给出的答案是:让训练阶段的立体几何(而非运行时的传感器或后处理)来提供尺度信息——其两大所声称的”显著特点”是无监督训练方案和绝对尺度恢复。

方法与架构

Dp=Bf/Ddep,D_{p}=Bf/D_{dep},

(ff为焦距,DdepD_{dep}为预测深度)——度量尺度正是从这里进入模型的。一幅图像通过空间变换器由另一幅合成,并用SSIM与L1相结合的光度损失进行惩罚,例如:

Lphol=λsLSSIM(Il,Il)+(1λs)Ll1(Il,Il),L_{pho}^{l}=\lambda_{s}L^{SSIM}(I_{l},I^{\prime}_{l})+(1-\lambda_{s})L^{l_{1}}(I_{l},I^{\prime}_{l}),

再加上一个视差图一致性损失,以及一个位姿一致性损失Lpos=λpLl1(xl,xr)+λoLl1(φl,φr)L_{pos}=\lambda_{p}L^{l_{1}}(\mathbf{x}^{\prime}_{l},\mathbf{x}^{\prime}_{r})+\lambda_{o}L^{l_{1}}(\varphi^{\prime}_{l},\varphi^{\prime}_{r}),强制左、右序列的位姿预测保持一致。

pk+1=KTk,k+1DdepK1pk,p_{k+1}=KT_{k,k+1}D_{dep}K^{-1}p_{k},

并用相同的SSIM+L1光度损失进行惩罚,再加上一个类似ICP的三维几何配准损失Lgeok=Ll1(Pk,Pk)L_{geo}^{k}=L^{l_{1}}(P_{k},P^{\prime}_{k}),在Tk,k+1T_{k,k+1}下对齐两帧的点云。

实验结果

对SLAM的意义

UndeepVO是最早展示单目尺度问题可以借助训练数据的几何信息(而非运行时额外传感器)来解决的工作之一:一次性使用立体监督,之后永久以单目方式部署。这种立体监督式自监督方案后来成为自监督深度和VO方法中的标准要素(MonoDepth风格的光度损失结合位姿网络,后来经过改进并整合进D3VO的直接VO中)。它是一个很好的案例,展示了经典多视图几何约束如何可以充当学习的免费监督信号。

相关条目