DSAC

Brachmann 2017 · 论文

一句话总结 — 用概率化选择取代确定性假设选择,使RANSAC变得可微,从而能够通过鲁棒位姿估计器端到端训练一个基于场景坐标的相机定位流水线。

问题

RANSAC是几何视觉(多视图几何、位姿估计、SLAM)中鲁棒估计的核心工具,遵循”局部预测、全局拟合”的模式。但它的假设选择——选取具有最高一致性得分的模型假设,hAM=argmaxhJs(hJ,Y)\mathbf{h}_{\mathrm{AM}}=\arg\max_{\mathbf{h}_J} s(\mathbf{h}_J,Y)——是不可微的,因此RANSAC无法嵌入端到端训练的深度流水线中。具体到相机重定位任务,深度学习此前一直未能超越传统方法:直接位姿回归(PoseNet)不够精确(每个场景的平移误差中位数约40厘米),而场景坐标回归虽保留了几何结构,但其可学习组件只能用替代损失训练,而不能用真正重要的位姿损失来训练。

方法与架构

该流水线遵循场景坐标回归(SCoRF)框架,估计一张RGB图像在已知场景中的6自由度位姿h~\tilde{\mathbf{h}}:

论文比较了两条使选择步骤可微的路线:

w~,v~=argminw,vIIEJP(Jv,w)[(R(hJw,Yw))]\tilde{\mathbf{w}},\tilde{\mathbf{v}}=\arg\min_{\mathbf{w},\mathbf{v}}\sum_{I\in\mathcal{I}}\mathbb{E}_{J\sim P(J|\mathbf{v},\mathbf{w})}\left[\ell(\mathbf{R}(\mathbf{h}_J^{\mathbf{w}},Y^{\mathbf{w}}))\right]

其梯度本身也是一个期望:

wEJ[()]=EJ[()wlogP(Jv,w)+w()]\frac{\partial}{\partial\mathbf{w}}\mathbb{E}_{J}\left[\ell(\cdot)\right]=\mathbb{E}_{J}\left[\ell(\cdot)\frac{\partial}{\partial\mathbf{w}}\log P(J|\mathbf{v},\mathbf{w})+\frac{\partial}{\partial\mathbf{w}}\ell(\cdot)\right]

训练损失是位姿误差pose(h,h)=max((θ,θ),tt)\ell_{\text{pose}}(\mathbf{h},\mathbf{h}^{*})=\max(\measuredangle(\boldsymbol{\theta},\boldsymbol{\theta}^{*}),\lVert\mathbf{t}-\mathbf{t}^{*}\rVert)(旋转以度为单位,平移以厘米为单位)。两个CNN先分别单独训练(坐标损失用L1L_1;得分回归目标为βpose-\beta\,\ell_{\text{pose}},β=10\beta{=}10),再进行端到端训练;PnP和精化的导数通过中心差分计算。

实验结果

在7-Scenes数据集上(精度=5厘米/5度以内的测试帧百分比):

对SLAM的意义

DSAC确立了场景坐标回归作为室内相机重定位领域主流的学习范式,大幅超越绝对位姿回归,因为它在闭环中保留了几何求解器,并针对任务真正关心的位姿损失进行训练。可微RANSAC这一思想在几何深度学习中广泛传播——论文明确提出将其作为端到端学习SfM或SLAM的鲁棒优化组件——而DSAC正是DSAC++、DSAC*以及当今快速训练重定位方法ACE系列的直接源头。

相关条目