CNN Pose Regression Limitations

Sattler 2019 · 论文

一句话总结 — 这篇CVPR 2019的分析文章(“Understanding the Limitations of CNN-based Absolute Camera Pose Regression”)表明,PoseNet风格的绝对位姿回归方法,其行为更像是带位姿插值的图像检索,而不是真正基于3D几何的定位。

问题

视觉定位——在已知场景中精确估计相机位姿——传统上是通过3D几何求解的:建立2D-3D匹配,然后在RANSAC框架内运行PnP求解器。将图像直接映射到位姿的端到端绝对位姿回归(APR)网络(PoseNet及其后续工作)因其速度快、结构简单而流行起来,但始终未能达到基于结构方法的精度。这篇论文追问的是为什么:APR网络究竟学到了什么,这种方法的根本局限又在哪里?

方法与架构

论文建立了一个涵盖所有PoseNet类架构的理论模型,这些架构共享三个阶段:一个卷积特征提取器 F(I)F(\mathcal{I}),一个(非线性)嵌入 E(F(I))=αIRnE(F(\mathcal{I})) = \alpha^{\mathcal{I}} \in \mathbb{R}^n(倒数第二层),以及一个将嵌入投影到位姿空间的最终线性层。学习到的定位函数为

L(I)=b+PE(F(I))=b+j=1nαjIPj,L(\mathcal{I}) = \mathbf{b} + \mathtt{P} \cdot E(F(\mathcal{I})) = \mathbf{b} + \sum_{j=1}^{n} \alpha_j^{\mathcal{I}} \mathbf{P}_j,

其中 PR(3+r)×n\mathtt{P} \in \mathbb{R}^{(3+r)\times n} 是最后一层的投影矩阵,b\mathbf{b} 是偏置,Pj=(cjT,rjT)T\mathbf{P}_j = (\mathbf{c}_j^T, \mathbf{r}_j^T)^T 是其按平移和朝向部分拆分的列。分解后,预测的位姿为

(c^Ir^I)=(cb+j=1nαjIcjrb+j=1nαjIrj).\begin{pmatrix}\hat{\mathbf{c}}_{\mathcal{I}}\\ \hat{\mathbf{r}}_{\mathcal{I}}\end{pmatrix}=\begin{pmatrix}\mathbf{c}_{b}+\sum_{j=1}^{n}\alpha_{j}^{\mathcal{I}}\mathbf{c}_{j}\\ \mathbf{r}_{b}+\sum_{j=1}^{n}\alpha_{j}^{\mathcal{I}}\mathbf{r}_{j}\end{pmatrix}.

解读:APR学到的是一组基础位姿(base poses) B={(cj,rj)}\mathcal{B} = \{(\mathbf{c}_j, \mathbf{r}_j)\},并将每一个预测表示为它们的线性组合(实际上由于ReLU,是锥形组合),而图像外观只是在调节系数 αjI\alpha_j^{\mathcal{I}}。输出结果与场景的3D结构没有任何关联。由此推导出两个预测,并在实验中得到了验证:

(c^Ir^I)=(c^Jr^J)+(j=1nΔjIcjj=1nΔjIrj),\begin{pmatrix}\hat{\mathbf{c}}_{\mathcal{I}}\\ \hat{\mathbf{r}}_{\mathcal{I}}\end{pmatrix} = \begin{pmatrix}\hat{\mathbf{c}}_{\mathcal{J}}\\ \hat{\mathbf{r}}_{\mathcal{J}}\end{pmatrix} + \begin{pmatrix}\sum_{j=1}^{n}\Delta_j^{\mathcal{I}}\mathbf{c}_{j}\\ \sum_{j=1}^{n}\Delta_j^{\mathcal{I}}\mathbf{r}_{j}\end{pmatrix},

也就是说,APR在结构上预测的是一个相对于相似训练图像的位姿——这正是图像检索加位姿插值所做的事情,并与相对位姿回归密切相关。

实验工具包括:作为APR代表的PoseNet(带学习的损失权重)和MapNet,作为基于结构方法金标准的Active Search(RootSIFT + P3P-RANSAC),以及作为检索基线的DenseVLAD(手工设计的密集RootSIFT汇聚成4096维VLAD描述子),另外还有一个对检索到的前 kk 张图像的位姿进行插值的变体。

实验结果

对SLAM的意义

这篇论文是解释”仅用CNN回归位姿”为何不能替代几何式重定位的标准参考文献。SLAM中的重定位和回环检测候选需要能够泛化到已建图轨迹之外的位姿,而这项分析阐明了哪些学习方法能够做到这一点(基于结构的方法:场景坐标回归、特征匹配+PnP),哪些方法做不到(直接回归)。它所引入的检索基线合理性检查现已成为评估任何学习式重定位方法的标准做法。

相关条目