MRS-Map

Stückler 2014 · 论文

一句话总结 — 一种基于八叉树的多分辨率面元地图,用于RGB-D SLAM,每个面元存储联合的形状与颜色统计量,从而支持具有噪声感知能力的概率配准、基于关键视图的位姿图SLAM,以及在CPU上的实时物体跟踪。

问题

以单一固定分辨率进行稠密RGB-D建图存在一个不可避免的权衡:精细分辨率能捕获细节但浪费内存,粗糙分辨率则会丢失细节。RGB-D传感器的噪声也随深度呈二次方增长,因此以同一分辨率处理所有测量在统计上是错误的。像KinectFusion这类依赖GPU的系统还进一步排除了轻量级或低成本的机器人平台。当时所需要的是一种紧凑的表示方式,能够根据测量质量自适应地调整细节层次,并支持对图像、地图和多视角物体模型进行快速、鲁棒的配准——而且完全在CPU上运行。

方法与架构

S2(PAB)S2(PA)+S2(PB)+δδTNANB(NA+NB),δ:=NBS(PA)NAS(PB),\mathcal{S}^2(\mathcal{P}^{A\cup B}) \leftarrow \mathcal{S}^2(\mathcal{P}^A) + \mathcal{S}^2(\mathcal{P}^B) + \frac{\delta\delta^T}{N_A N_B (N_A + N_B)}, \qquad \delta := N_B\,\mathcal{S}(\mathcal{P}^A) - N_A\,\mathcal{S}(\mathcal{P}^B),

据此可推出均值 μ=1PS\mu = \frac{1}{\lvert\mathcal{P}\rvert}\mathcal{S} 和协方差 Σ=1P1S2μμT\Sigma = \frac{1}{\lvert\mathcal{P}\rvert-1}\mathcal{S}^2 - \mu\mu^T。该分布是6维的——位置与颜色(在一个把亮度和色度分离开的Lαβ\alpha\beta色彩空间中)联合表示。最多六个正交视图方向能够把同一个体素内不同的表面区分开来;面元至少需要10个点才能建立。

p(ss,ix,sm,j)=N(di,j(x);0,Σi,j(x)),di,j(x):=μm,jT(x)μs,i,Σi,j(x):=Σm,j+R(x)Σs,iR(x)T,p(s_{s,i} \mid x, s_{m,j}) = \mathcal{N}\big(d_{i,j}(x);\, 0,\, \Sigma_{i,j}(x)\big), \quad d_{i,j}(x) := \mu_{m,j} - T(x)\,\mu_{s,i}, \quad \Sigma_{i,j}(x) := \Sigma_{m,j} + R(x)\,\Sigma_{s,i}\,R(x)^T,

因此从数据中学到的协方差会自动为可靠的几何结构加权——不需要提取关键点。对数似然 L(x)=aAlogΣa(x)+daT(x)Σa1(x)da(x)L(x) = \sum_{a\in\mathcal{A}} \log\lvert\Sigma_a(x)\rvert + d_a^T(x)\,\Sigma_a^{-1}(x)\,d_a(x) 先通过快速近似Levenberg-Marquardt优化(通常10-20次迭代),再配合约5次牛顿迭代(对模型面元做三线性插值)进行优化;评估在CPU多核上并行化进行。位姿协方差的闭式估计能够捕获不可观测维度上的不确定性(例如观察一个平面时)。

实验结果

所有计时均在一台笔记本Intel Core i7-3610QM(2.3 GHz四核)上完成,分辨率为完整的640×480,最大地图分辨率为0.0125米。增量配准(TUM RGB-D基准数据集,相对位姿误差的平移中位数):在fr1/desk上为4.4毫米,相比warp的5.8毫米、GICP的10.2毫米、3D-NDT的7.9毫米、fovis的6.3毫米;在大多数fr1序列上表现最佳(例如fr1/plant为3.5毫米,fr1/xyz为2.6毫米,fr2/xyz为1.4毫米)。在fr1/desk上平均运行时间为75.15毫秒,相比warp的108.64毫秒、GICP的4015.4毫秒、3D-NDT的414.87毫秒——约15 Hz,并且在跳帧情况下仍保留了类似ICP的鲁棒性,而warp在这种情况下会发散。SLAM:在处理所有帧的情况下,在十一个序列中的八个上,RMSE相对位姿误差优于RGB-D SLAM,例如freiburg1_room为0.111米相比0.219米,freiburg2_desk为0.100米相比0.143米,freiburg1_teddy为0.066米相比0.138米;在freiburg1_floor(纹理稀少的地面)和freiburg2_large_loop(距离远、深度不确定)上失败。一次图优化迭代最多耗时几毫秒(freiburg2_desk:在最多64个关键视图、138条边的情况下中位数为0.79毫秒)。物体建模/跟踪:360度模型构建的中位ATE约为1-2厘米;对已学习模型的跟踪,中位ATE为16-30毫米,每帧耗时32-50毫秒;在RoboCup@Home 2011/2012(两次均获胜)上,在机器人Cosero上进行了实时演示。

对SLAM的意义

MRS-Map表明,统计性的面元表示——而不是稠密的体素网格——能够以适度的内存和无需GPU的条件支持精确的RGB-D跟踪,使得在真实机器人硬件上实现类稠密SLAM和物体跟踪成为可能。它对不确定性有感知的面元配准方法(可视为NDT在RGB-D领域的一个后代)以及多分辨率八叉树设计,影响了后续基于面元的系统,例如ElasticFusion,以及基于面元的LiDAR建图,并在2010年代中期成为稠密RGB-D SLAM系统(DVO-SLAM、ElasticFusion)的标准比较基线。

相关条目