DXSLAM

Li 2020 · 论文

一句话总结 — 在ORB-SLAM2流程中用HF-Net的深度局部特征与全局特征替换手工设计的ORB特征,显著提升了对光照变化和终身SLAM场景变化的鲁棒性——同时仍能在CPU上实时运行。

问题

对于视觉SLAM而言,“尽管理论框架在大多数方面已经相当成熟,但特征提取与关联在多数情况下仍依赖经验设计,在复杂环境中可能十分脆弱”——当场景或视角发生变化时,ORB-SLAM2常常无法识别之前访问过的场景。CNN特征的鲁棒性要好得多,但多数深度特征系统需要GPU,这在很多机器人上并不现实。DXSLAM证明深度特征”可以无缝集成到现代SLAM框架中”,并做到了CPU实时:更换特征,保留经过验证的几何方法。

方法与架构

该框架是ORB-SLAM2的跟踪/局部建图/回环检测流程,其中特征提取、重定位和回环检测均围绕一个CNN重新构建:

s(v1,v2)=i=1Nv1,i+v2,iv1,iv2,i,s(v_{1},v_{2})=\sum_{i=1}^{N}|v_{1,i}|+|v_{2,i}|-|v_{1,i}-v_{2,i}|,

该得分基于视觉向量v1,v2v_1,v_2计算;由于BoW忽略了空间关系,第二阶段会计算与每个候选帧的全局描述子内积距离,只有低于阈值的最接近者才被接受——以精度优先,因为一次错误的回环会破坏地图。

实验结果

在OpenLORIS-Scene重定位测试(办公室场景,受控挑战因素)中,DXSLAM在光照变化下得分0.862(ORB-SLAM2:0.764),在低光照下得分0.994(ORB-SLAM2和DS-SLAM均为0),在物体和人员变化下得分0.999;所有方法在完全视角反转下均失败(0)。New College和City Center上的回环检测PR曲线显示,完整方法(HF-FBoW-GLB)明显优于ORB-SLAM2的ORB-BoW,全局描述子阶段带来了显著的额外提升。在TUM RGB-D动态序列上,ATE RMSE从0.3900 m(ORB-SLAM2)降至fr3_walking_static上的0.0167 m,以及从0.4863 m降至fr3_walking_half上的0.0759 m——与显式处理动态目标的DS-SLAM相当。在一台15 W的i7-10710U上,使用OpenVINO进行特征提取每张图像耗时46.2 ms(比纯HF-Net的144.2 ms快68%;SuperPoint需387.5 ms,D2-Net需2484.6 ms),完整ROS系统在Intel NUC上以约15 Hz的频率发布位姿。

对SLAM的意义

DXSLAM清晰地展示了革新经典SLAM最简单的方式:保留经过验证的几何后端,替换为学习到的特征。它证明了在动态和终身SLAM场景下相较ORB-SLAM2有显著的鲁棒性提升,而无需重新设计整个系统——而且难得的是,证明了这一方案可以部署在没有GPU的机器人上。它衔接了第3级的经典系统与第5级的学习特征研究(SuperPoint、HF-Net);许多生产系统正是遵循这种混合方案。

相关条目