DeMoN

Ummenhofer 2017 · 论文

一句话总结 — DeMoN(CVPR 2017)将双视图运动恢复结构(structure-from-motion)表述为一个学习问题:一串堆叠的编码器-解码器网络从一对不受约束的图像中联合估计深度和相机运动,并通过强制预测光流来学习对应关系。

问题

经典的双视图SfM流程依次串联特征点检测、描述子匹配、本质矩阵估计和稠密立体匹配——运动首先是从稀疏且容易出现外点的对应关系中估计出来的,因此一个糟糕的运动估计会污染深度估计,弱纹理区域会失败,并且在相机平移量很小时所有现有流程都会崩溃。单图深度网络避免了匹配问题,但由于完全依赖外观先验,在训练分布之外泛化能力很差。DeMoN端到端地训练一个网络,从连续的、不受约束的图像对中计算深度和运动——并证明了朴素方法会失败:一个简单的编码器-解码器接收两帧图像后会走单图捷径,直接忽略第二张图像。

方法与架构

gh[f]=(f(i+h,j)f(i,j)f(i+h,j)+f(i,j), f(i,j+h)f(i,j)f(i,j+h)+f(i,j)),\mathbf{g}_{h}[f]=\left(\tfrac{f(i+h,j)-f(i,j)}{|f(i+h,j)|+|f(i,j)|},\ \tfrac{f(i,j+h)-f(i,j)}{|f(i,j+h)|+|f(i,j)|}\right)^{\top},

Lgradξ=h{1,2,4,8,16}i,j gh[ξ]gh[ξ^] 2,\mathcal{L}_{\text{grad}\,\xi}=\sum_{h\in\{1,2,4,8,16\}}\sum_{i,j}\left\|\ \mathbf{g}_{h}[\xi]-\mathbf{g}_{h}[\hat{\xi}]\ \right\|_{2},

该损失在5种间距上惩罚相邻像素间的相对深度误差——使深度不连续处更锐利,同质区域更平滑。

实验结果

对SLAM的意义

DeMoN是”给网络输入两张图像,输出几何信息”这一系列方法的先祖。它证明了学习双视图几何需要匹配,而不仅仅是识别——这一教训至今仍影响着前端设计——其学习式迭代精化预示了BA-Net、DeepV2D和RAFT风格的系统,而其不受约束的双视图设置正是DUSt3R在基础模型规模上重新探索的方向。

相关条目