MAC-VO
Qiu 2024 · 论文
一句话总结 — 一种基于学习的双目视觉里程计,预测具有度量意义的匹配协方差,并将其同时用于选择关键点和在位姿优化中加权残差。
问题
基于学习的VO模型在可靠性方面表现不佳:以无监督方式学习到的置信权重(DROID-SLAM、DPVO)是与尺度无关的——它们只在匹配之间进行相对排序,却不能反映以米为单位的真实3D估计误差,这”使得协方差在尺度各异的不同环境之间变得不一致”,也”更难融合来自不同模态或传感器的多个约束”。同时,关键点选择仍然偏好纹理丰富的边缘和角点,而这恰恰是学习到的匹配和深度由于插值和边缘模糊性而最不准确的地方——D3VO表明这类特征的表现甚至可能比随机选择更差。MAC-VO用一个统一的、具有度量意义的学习不确定性模型取代了这两者。
方法与架构
具有不确定性意识的匹配网络。 一个共享FlowFormer骨干网络联合估计深度、光流,以及帧间的不确定性。一个协方差解码器附加在循环光流解码器上,在对数空间中预测迭代更新(加性更新,保证方差为正,梯度稳定)。监督信号是对更新迭代的负对数似然损失:
其中为真实光流,为指数衰减权重(衰减比0.8)。仅在TartanAir上训练;在其他所有数据集上进行零样本评估。
基于不确定性的关键点选择。 三个堆叠的滤波器:非最小值抑制(空间分布)、几何滤波器(图像边界、无效深度),以及一个不确定性滤波器,用于剔除深度或光流不确定性超过帧内中位数1.5倍的像素——这隐式地去除了运动车辆、遮挡、反射和无纹理区域。
具有度量意义的3D协方差。 2D不确定性通过针孔模型传播为每个关键点的完整3D协方差。对角项(针对;对称,):
由于三个坐标共享同一个深度,该模型保留了非对角项,例如以及——一个各向异性、具有相关性的度量单位协方差,不同于DROID-SLAM的与尺度无关的对角协方差。深度不确定性还会针对场景几何进行额外修正:在匹配点周围32像素的图像块内,,即由基于构建的2D高斯核加权的方差——因此靠近深度不连续处的匹配会继承较大的深度不确定性。
位姿图优化。 相机位姿由TartanVO的运动估计初始化,并通过匹配3D关键点的两帧配准来优化,配准过程由传播的协方差加权:
在PyPose中使用Levenberg-Marquardt求解。值得注意的是,这里没有多帧光束法平差或回环检测——精度完全来自经过标定的加权方式。
实验结果
所有数据集使用相同的配置和权重;评估采用逐帧相对误差(米/帧)和(度/帧)。
- EuRoC:平均与DROID-SLAM(一个完整的SLAM系统)相当,而比所有基线方法都好约10%。
- TartanAir v2(包含室内外过渡和低光照的新Hard分割):比DROID-SLAM低61.9%;在类月面H00序列上,低82.4%,且在所有基线方法中最优。ORB-SLAM3和MASt3R-SLAM在每个Hard序列上都跟踪失败。
- KITTI:比其他VO方法低53.3%,排名仅次于ORB-SLAM3(一个带回环检测的完整SLAM系统);由于缺乏多帧优化,表现较差。
- 消融实验(TartanAir v2 Hard,/):完整模型 .0141/.1429,仅对角协方差 .0461/.3023,与尺度无关协方差 .0204/.2321,单位协方差 .0679/.3776——度量尺度和非对角项都很重要。
- 成本:4.20 GB GPU显存(比DROID-SLAM少6.7倍);原始模式2.15 fps,快速模式(bf16,4次更新迭代)10.5 fps,在3090 Ti上达到完整精度的约70%。
对SLAM的意义
MAC-VO代表了基于学习的里程计的成熟:不仅仅预测位姿或光流,还预测这些预测有多大误差,并以经典估计理论能够消化的形式(度量的、相关的协方差)表达。经过标定的不确定性正是将学习到的前端与滤波器、因子图和多传感器系统融合所需要的——这也是作者所提出的下一步方向——而这个不确定性图同时也可以作为下游决策的可靠性信号。
相关条目
- DPVO
- TartanVO
- DROID-SLAM
- D3VO
- FlowFormer — 匹配骨干网络
- Consistency