SfM-Learner

Zhou 2017 · 论文

一句话总结 — 仅使用光度视图合成作为监督信号,从无标签单目视频中联合训练单视角深度网络和多视角位姿网络,开创了自监督深度+自运动这一研究方向。

问题

有监督的深度和位姿估计需要昂贵的真值——用于深度的LiDAR扫描,用于位姿的动作捕捉或高精度GPS/INS——这将训练数据限制在少数装备了传感器的数据集上。然而非结构化的单目视频基本上是免费且无限的。

其核心洞见是:视图合成系统”只有当其对场景几何和相机位姿的中间预测与物理真值相符时,才能持续表现良好”。因此,在视图合成这一”元任务”上训练网络,深度和自运动必然会作为中间预测涌现出来。

方法与架构

Lvs=spIt(p)I^s(p),\mathcal{L}_{vs}=\sum_{s}\sum_{p}\left|I_{t}(p)-\hat{I}_{s}(p)\right|,

其中I^s\hat{I}_{s}是被warp到目标帧坐标系的IsI_s。每个目标像素ptp_t通过下式投影到源视角:

psKT^tsD^t(pt)K1pt,p_{s}\sim K\hat{T}_{t\rightarrow s}\hat{D}_{t}(p_{t})K^{-1}p_{t},

(KK为内参,D^t\hat{D}_t为预测深度),I^s(pt)\hat{I}_s(p_t)通过对4个相邻像素的可微双线性采样(空间变换网络)填充得到。只有深度位姿都正确,warp结果才能保持光度一致性。

Lfinal=lLvsl+λsLsmoothl+λesLreg(E^sl).\mathcal{L}_{final}=\sum_{l}\mathcal{L}_{vs}^{l}+\lambda_{s}\mathcal{L}_{smooth}^{l}+\lambda_{e}\sum_{s}\mathcal{L}_{reg}(\hat{E}_{s}^{l}).

实验结果

对SLAM的意义

SfM-Learner表明经典SfM/SLAM目标——跨视角的光度一致性——可以作为训练信号,而不仅仅是运行时的代价函数,让网络从原始视频中学习深度和自运动。它的视图合成损失成为Monodepth2、D3VO以及众多自监督VO/深度系统的模板,这些系统现在将学习到的深度先验反馈回SLAM流水线。它标志着直接法SLAM与端到端学习型里程计之间的概念桥梁。

相关条目