DSAC++

Brachmann 2018 · 论文

一句话总结 — “学得更少即更多”:将DSAC流水线精简为单一可学习组件——一个回归场景坐标的FCN——由一个无参数的软内点计数打分,并证明它可以仅从RGB图像和真值位姿训练,而无需任何3D模型即可发现场景几何。

问题

DSAC存在三个缺点。其评分CNN容易过拟合——它记住的是重投影误差在图像中出现的位置这一模式,而这种模式无法泛化到未见过的视角。其初始化需要来自RGB-D数据或3D场景模型的场景坐标真值,而这种真值可能并不存在(尤其是室外场景,重建往往需要繁琐的参数搜索)。而且其端到端训练不稳定,因为位姿精化的梯度是通过有限差分计算的,梯度方差很高。DSAC++探究的问题是:是否只学习定位流水线中的单一组件就足够——以及它能否仅从相机位姿中学习。

方法与架构

DSAC风格的流水线被保留——场景坐标回归、通过4元组PnP进行假设采样、概率化选择、精化——但只保留一个可学习组件:

s(h)=isig(τβri(h,w))s(\mathbf{h})=\sum_i \mathrm{sig}\left(\tau-\beta\, r_i(\mathbf{h},\mathbf{w})\right)

假设jj通过softmax选出,P(j;w,α)exp(αs(hj(w)))P(j;\mathbf{w},\alpha) \propto \exp(\alpha\, s(\mathbf{h}_j(\mathbf{w}))),其中α\alpha通过对S(α)S|S(\alpha)-S^{*}|做梯度下降自动调节,S(α)S(\alpha)PP的Shannon熵——这样能保持分布较宽,使端到端训练保持稳定而不至于坍缩。

实验结果

对SLAM的意义

DSAC++消除了场景坐标回归在实践中最大的障碍——对3D真值的需求——使该方法能够兼容任何提供位姿的SLAM/SfM系统的输出。它的方案(单一FCN+经典几何求解、软内点评分、解析Gauss-Newton梯度、基于重投影的自监督)成为DSAC*和ACE系列所采用的模板,并早早证明了仅凭单视图重投影约束就能发现一个隐式神经场景地图——这一思想在神经建图领域反复出现。

相关条目