LM-Reloc

von Stumberg 2020 · 论文

一句话总结 — 深度直接法重定位:学习专为基于Levenberg-Marquardt的直接图像配准而设计的CNN特征,在无需特征匹配或RANSAC的情况下估计查询图像与参考图像之间的相对位姿。

问题

视觉重定位几乎普遍采用基于特征的方法来解决——检测特征点、匹配描述子、用RANSAC剔除外点、求解位姿。这条流水线除了角点之外抛弃了所有信息。直接图像配准可以利用任何具有梯度的图像区域,但原始的光度配准在光照、天气和季节变化下会失效,其狭窄的收敛域也使其在重定位常见的大基线下变得脆弱。LM-Reloc提出的问题是:如何在保留直接法表述的同时,使其在不同条件下保持鲁棒。

方法与架构

LM-Reloc在给定来自直接法SLAM系统(Stereo DSO)的稀疏深度的情况下,估计图像IIII'之间的6自由度位姿ξSE(3)\boldsymbol{\xi} \in SE(3)。三个组件协同工作:LM-Net(生成多尺度特征图Fl,FlF_l, F'_ll=1,,4l = 1,\dots,4的孪生编码器-解码器)、CorrPoseNet(粗略位姿初始化),以及一个经典的Levenberg-Marquardt优化器

在学习特征上进行直接配准。 优化器最小化的不是原始像素强度,而是粗到细金字塔中的特征度量能量(F1F_1位于(w/8,h/8)(w/8, h/8),直至F4F_4位于全分辨率):

E(ξ)=pPFl(p)Fl(p)γ,p=Π(RΠ1(p,dp)+t),E(\boldsymbol{\xi})=\sum_{\mathbf{p}\in P}\big\lVert F_{l}^{\prime}(\mathbf{p}^{\prime})-F_{l}(\mathbf{p})\big\rVert_{\gamma}, \qquad \mathbf{p}^{\prime}=\Pi\left(\mathbf{R}\,\Pi^{-1}(\mathbf{p},d_{\mathbf{p}})+\mathbf{t}\right),

采用Huber范数γ\lVert\cdot\rVert_\gamma以及逐点深度dpd_{\mathbf{p}}。每次LM迭代构建高斯-牛顿系统H=JTWJ\mathbf{H}=\mathbf{J}^{T}\mathbf{W}\mathbf{J}b=JTWr\mathbf{b}=-\mathbf{J}^{T}\mathbf{W}\mathbf{r},通过H=H+λI\mathbf{H}'=\mathbf{H}+\lambda\mathbf{I}(Levenberg)或H=H+λdiag(H)\mathbf{H}'=\mathbf{H}+\lambda\,\mathrm{diag}(\mathbf{H})(Marquardt)对其进行阻尼处理,并更新δ=H1b\boldsymbol{\delta}=\mathbf{H}'^{-1}\mathbf{b}ξi=δξi1\boldsymbol{\xi}^{i}=\boldsymbol{\delta}\boxplus\boldsymbol{\xi}^{i-1}λ\lambda在成功步骤后减半,在失败步骤后翻两番。

围绕优化器设计的损失。 核心思想:训练特征使LM在其上表现良好,区分投影点在优化过程中可能处于的四种状态,每种状态有各自采样的对应关系和损失项:

  1. 正确位置:Epos=F(pgt)F(p)2E_{\text{pos}}=\lVert F^{\prime}(\mathbf{p}_{\text{gt}}^{\prime})-F(\mathbf{p})\rVert^{2}应趋于零。
  2. 外点(在任意位置采样的负样本):Eneg=max(MF(pneg)F(p)2,0)E_{\text{neg}}=\max\left(M-\lVert F^{\prime}(\mathbf{p}_{\text{neg}}^{\prime})-F(\mathbf{p})\rVert^{2},0\right),边界M=1M=1——错误匹配必须产生较大的残差。
  3. 远离最优解(负样本约5像素外,λ\lambda较大,处于梯度下降区域):一次阻尼后的逐点光流步pafter=p+(Hp+λfI)1bp\mathbf{p}_{\text{after}}^{\prime}=\mathbf{p}_{\nabla}^{\prime}+(\mathbf{H}_{\mathbf{p}}+\lambda_{f}\mathbf{I})^{-1}\mathbf{b}_{\mathbf{p}}必须朝真值方向移动:EGD=max(pafterpgt2ppgt2+δ,0)E_{\text{GD}}=\max\left(\lVert\mathbf{p}_{\text{after}}^{\prime}-\mathbf{p}_{\text{gt}}^{\prime}\rVert^{2}-\lVert\mathbf{p}_{\nabla}^{\prime}-\mathbf{p}_{\text{gt}}^{\prime}\rVert^{2}+\delta,0\right)(扩大收敛域;λf=2.0\lambda_f{=}2.0δ=0.1\delta{=}0.1)。
  4. 接近最优解(负样本在1像素以内,λ\lambda较小,处于高斯-牛顿区域):来自GN-Net的概率性高斯-牛顿损失,EGN=12(pafterpgt)THp(pafterpgt)+log(2π)12log(Hp)E_{\text{GN}}=\frac{1}{2}(\mathbf{p}_{\text{after}}^{\prime}-\mathbf{p}_{\text{gt}}^{\prime})^{T}\mathbf{H}_{\mathbf{p}}(\mathbf{p}_{\text{after}}^{\prime}-\mathbf{p}_{\text{gt}}^{\prime})+\log(2\pi)-\frac{1}{2}\log(|\mathbf{H}_{\mathbf{p}}|)(使最小值更陡峭,提升亚像素精度)。

用于初始化的CorrPoseNet。 一个带相关层的回归网络,c(i,j,(i,j))=fcorr(i,j)Tfcorr(i,j)\mathbf{c}(i,j,(i^{\prime},j^{\prime}))=\mathbf{f}_{\text{corr}}(i,j)^{T}\mathbf{f}_{\text{corr}}^{\prime}(i^{\prime},j^{\prime}),回归欧拉角和平移量,用于在大基线/大旋转下为LM提供初始化;它鲁棒但不精确,因此最终估计始终来自几何优化。

实验结果

在重定位跟踪基准(CARLA + Oxford RobotCar)上评估,报告累积位姿误差曲线在0.5米/0.5°以内的AUC:

对SLAM的意义

LM-Reloc源自TUM直接法SLAM谱系(DSO及其衍生系统),解决了直接法的一个核心弱点:外观变化下的重定位与地图复用。它展示了一种富有成效的设计模式——保留经典的几何优化器,但学习其运算所依赖的表征,并围绕优化器实际的收敛行为来设计训练损失。当你需要直接法的精度,但又必须跨会话或跨条件重定位时,可以采用这一类思路。

相关条目