DeepSLAM

Li 2020 · 论文

一句话总结 — DeepSLAM用神经网络搭建出一个完整的单目SLAM流程——用于位姿估计的Tracking-Net、用于深度估计的Mapping-Net、用于回环检测的Loop-Net,再加上g2o位姿图优化——整套系统在双目影像上以完全无监督的方式训练,并部署在单目视频上。

问题

到2020年,学习式视觉里程计已经存在监督式(DeepVO/ESP-VO)和自监督式(SfM-Learner)两种形式,但监督变体需要昂贵的真值轨迹,单目自监督又会丢失度量尺度,而且几乎所有学习式系统都只是里程计:没有回环检测,因此漂移会无限增长。与此同时,几何方法在挑战性场景(雨天、夜晚、过曝)下十分脆弱,且无法从数据中改进。DeepSLAM探讨的问题是:经典SLAM的整套分解——跟踪、建图、回环检测、图优化——能否用完全不需要标注真值训练的网络来复现。

方法与架构

前端网络(测试时,单目输入)。 Tracking-Net是一个RCNN——由VGGNet卷积层向一个跨图像序列(长度为5)的LSTM输入特征——输出相对6自由度位姿及每个估计的不确定度,直接产生每个窗口内 (n1)(n-1) 个相对位姿构成的局部位姿图Mapping-Net是一个编码器-解码器,预测具有度量尺度的稠密深度图(每5帧运行一次)。Loop-Net是一个ImageNet预训练的Inception-ResNet-V2(未做任何SLAM专门训练),将图像嵌入为特征向量;当一对图像的余弦距离 dcos=cos(v1,v2)d_{cos}=\cos(v_{1},v_{2}) 低于某阈值时,即被判定为一次回环,此后Tracking-Net(序列长度为2)计算回环变换,并由g2o对局部图与全局图组合而成的位姿图进行优化。

在双目序列上的无监督训练。 空间(左-右)与时间(帧到帧)几何一致性构成损失函数,双目提供度量尺度,因此不需要位姿或深度标签。给定双目基线 BB 和焦距 ff,预测深度 DiD_i 给出对应距离 Hi=Bf/DiH_{i}=Bf/D_{i},据此对图像进行交叉变形。左-右光度损失(右到左类似,视差图 Q=H×wQ = H \times w 亦类似)为

Ll,rp=λsfs(Il,Il)+(1λs)IlIl1,fs()=1SSIM()2L_{l,r}^{p}=\sum \lambda_{s}\, f_{s}(I_{l},I_{l}') + (1-\lambda_{s})\,\lVert I_{l}-I_{l}'\rVert_{1}, \qquad f_{s}(\cdot)=\tfrac{1-\mathrm{SSIM}(\cdot)}{2}

再加上左右两条流估计出的位姿之间的一致性损失 Lo=λpx^lx^r1+λrφ^lφ^r1L^{o}=\lambda_{p}\lVert\hat{x}_{l}-\hat{x}_{r}\rVert_{1}+\lambda_{r}\lVert\hat{\varphi}_{l}-\hat{\varphi}_{r}\rVert_{1}。在时间维度上,像素通过下式在帧间变形:

pk+1=KT^k,k+1D^kK1pkp_{k+1}' = K\,\hat{T}_{k,k+1}\,\hat{D}_{k}\,K^{-1}p_{k}

(KK为内参,T^k,k+1\hat{T}_{k,k+1}为预测位姿,D^k\hat{D}_k为预测深度),从而得到带遮罩的光度损失以及一个类似ICP的3D几何配准损失 Lk,k+1g=MgkEgk1L_{k,k+1}^{g}=\sum\lVert M_{g}^{k}E_{g}^{k}\rVert_{1},其中 Egk=PkPkE_{g}^{k}=P_{k}-P_{k}' 建立在反投影点云之上。

不确定度与异常剔除。 光度/几何误差的均值定义了一个不确定度 σk,k+1=2×S(μpk+μpk+1+λe(μgk+μgk+1))1\sigma_{k,k+1}=2\times S\big(\mu_{p}^{k}+\mu_{p}^{k+1}+\lambda_{e}(\mu_{g}^{k}+\mu_{g}^{k+1})\big)-1(Sigmoid函数 SS,取值范围0.5–1),它用于监督Tracking-Net的不确定度输出,并通过百分位数 qth=q0+(1q0)(1σk,k+1)q_{th}=q_{0}+(1-q_{0})(1-\sigma_{k,k+1}) 自适应地调整二值误差图掩膜的大小——在训练中剔除运动物体(光度掩膜)以及天空、物体边缘等不可靠深度区域(几何掩膜)。

实验结果

对SLAM的意义

DeepSLAM将”用网络替换每个模块,但保留架构”这一策略推向了极致,甚至包括了纯学习式VO论文所省略的回环检测和位姿图阶段——并展示了无监督训练的收益:仅通过摄取监督对手无法使用的无标签KITTI序列,它就能持续提升性能。它”双目训练、单目部署”的方案至今仍是获得具有尺度感知能力的自监督的标准方法,而它在RobotCar上的鲁棒性结果也预示了学习式SLAM相对于几何方法的主要卖点:在手工特征失效的条件下依然能够优雅地工作。

相关条目