PoseNet

Kendall 2015 · 论文

一句话总结 — 第一个直接从单张RGB图像回归完整6自由度相机位姿(平移+四元数)的CNN,开创了用于视觉重定位的绝对位姿回归(Absolute Pose Regression, APR),每帧仅需5毫秒、模型仅50MB。

问题

经典的重定位方法要么是度量式的(将特征与3D地图匹配,求解PnP——需要良好的初始估计、数GB的存储空间,并且在模糊、弱光或纹理稀少的场景下SIFT类匹配会失效),要么是基于外观的(在一组离散地点中进行分类——只能得到粗略的位置)。PoseNet针对的是”迷失/被劫持机器人”问题,探究一个卷积网络能否将单张224x224图像直接映射为连续的6自由度位姿,做到端到端、无需特征工程、无需地图、无需图优化——并探究在位姿标注数据稀缺(每个场景仅几百到几千帧,由SfM自动标注)的情况下,这是否可训练。

方法与架构

p=[x,q]\mathbf{p} = [\mathbf{x}, \mathbf{q}]

其中位置xR3\mathbf{x} \in \mathbb{R}^3,朝向四元数qR4\mathbf{q} \in \mathbb{R}^4;选用四元数是因为任意4维值经单位归一化即可映射为有效的旋转(比对旋转矩阵做正交归一化更简单);测试时对q\mathbf{q}做归一化。

loss(I)=x^x2+βq^qq2loss(I) = \lVert\hat{\mathbf{x}}-\mathbf{x}\rVert_2 + \beta\,\left\lVert\hat{\mathbf{q}}-\frac{\mathbf{q}}{\lVert\mathbf{q}\rVert}\right\rVert_2

最优的β\beta是训练结束时位置误差与朝向误差期望值的比值,通过网格搜索得到:室内120–750,室外250–2000。将位置和朝向分开训练,或放在不同分支中训练,效果都更差——每个输出都有助于分解出另一个的因素。

实验结果

对SLAM的意义

PoseNet开创了学习式重定位的研究方向,并定义了APR问题的设定,证明了卷积网络可以通过迁移学习求解超出图像平面的回归问题。其局限性与其成果同样具有影响力:与基于结构的方法相比米级的精度差距,推动了场景坐标回归方法(DSAC、ACE)的发展,这类方法在流程中保留几何求解器,能达到厘米级精度;后续分析也表明APR的行为更接近图像检索而非几何计算。在SLAM中,PoseNet式的回归作为粗略重定位先验得以延续,其紧凑的常量内存”权重中的地图”预示了后来的隐式神经地图。

相关条目