MAC-VO

Qiu 2024 · 论文

一句话总结 — 一种基于学习的双目视觉里程计,预测具有度量意义的匹配协方差,并将其同时用于选择关键点和在位姿优化中加权残差。

问题

基于学习的VO模型在可靠性方面表现不佳:以无监督方式学习到的置信权重(DROID-SLAM、DPVO)是与尺度无关的——它们只在匹配之间进行相对排序,却不能反映以米为单位的真实3D估计误差,这”使得协方差在尺度各异的不同环境之间变得不一致”,也”更难融合来自不同模态或传感器的多个约束”。同时,关键点选择仍然偏好纹理丰富的边缘和角点,而这恰恰是学习到的匹配和深度由于插值和边缘模糊性而最不准确的地方——D3VO表明这类特征的表现甚至可能比随机选择更差。MAC-VO用一个统一的、具有度量意义的学习不确定性模型取代了这两者。

方法与架构

具有不确定性意识的匹配网络。 一个共享FlowFormer骨干网络联合估计深度、光流f^R2\hat{f} \in \mathbb{R}^2,以及帧间的不确定性Σ^f=diag(σu2,σv2)\hat{\Sigma}_f = \mathrm{diag}(\sigma_u^2, \sigma_v^2)。一个协方差解码器附加在循环光流解码器上,在对数空间中预测迭代更新logΔσ\log \Delta\sigma(加性更新,保证方差为正,梯度稳定)。监督信号是对更新迭代的负对数似然损失:

Lcov=iNαi((yf^i)Σ^f1(yf^i)+log(detΣ^f))L_{cov} = \sum_i^N \alpha_i \left( (y - \hat{f}_i)^\top \hat{\Sigma}_f^{-1} (y - \hat{f}_i) + \log(\det \hat{\Sigma}_f) \right)

其中yy为真实光流,αi\alpha_i为指数衰减权重(衰减比0.8)。仅在TartanAir上训练;在其他所有数据集上进行零样本评估。

基于不确定性的关键点选择。 三个堆叠的滤波器:非最小值抑制(空间分布)、几何滤波器(图像边界、无效深度),以及一个不确定性滤波器,用于剔除深度或光流不确定性超过帧内中位数1.5倍的像素——这隐式地去除了运动车辆、遮挡、反射和无纹理区域。

具有度量意义的3D协方差。 2D不确定性通过针孔模型传播为每个关键点的完整3D协方差。对角项(针对xxyy对称,σz2=σd2\sigma_z^2 = \sigma_d^2):

σx2=(σu2σd2+σu2d2+(ucx)2σd2)/fx2\sigma_{x}^2 = \left( \sigma_u^2 \sigma_d^2 + \sigma_u^2 d^2 + (u - c_x)^2 \sigma_d^2 \right) / \mathrm{f}_x^2

由于三个坐标共享同一个深度dd,该模型保留了非对角项,例如σxz=σd2(ucx)/fx\sigma_{xz} = \sigma_d^2 (u - c_x)/\mathrm{f}_x以及σxy=σd2(ucx)(vcy)/(fxfy)\sigma_{xy} = \sigma_d^2 (u - c_x)(v - c_y)/(\mathrm{f}_x \mathrm{f}_y)——一个各向异性、具有相关性的度量单位协方差,不同于DROID-SLAM的与尺度无关的对角协方差。深度不确定性还会针对场景几何进行额外修正:在匹配点周围32像素的图像块内,σd2=jφj(djμD)2\sigma_d^2 = \sum_j \varphi_j (d_j - \mu_D)^2,即由基于(σu2,σv2)(\sigma_u^2, \sigma_v^2)构建的2D高斯核φ\varphi加权的方差——因此靠近深度不连续处的匹配会继承较大的深度不确定性。

位姿图优化。 相机位姿TtSE(3)T_t \in SE(3)由TartanVO的运动估计初始化,并通过匹配3D关键点的两帧配准来优化,配准过程由传播的协方差加权:

T=arg minTtipi,t1Ttcpi,tΣi2,Σi=Σi,t1p+RtcΣi,tpRtT^{\star} = \operatorname*{arg\,min}_{T_t} \sum_i \left\lVert \mathbf{p}_{i,t-1} - T_t\, {}^c\mathbf{p}_{i,t} \right\rVert^2_{\Sigma_i}, \qquad \Sigma_i = \Sigma^p_{i,t-1} + R_t\, {}^c\Sigma^p_{i,t}\, R_t^\top

在PyPose中使用Levenberg-Marquardt求解。值得注意的是,这里没有多帧光束法平差或回环检测——精度完全来自经过标定的加权方式。

实验结果

所有数据集使用相同的配置和权重;评估采用逐帧相对误差trelt_{rel}(米/帧)和rrelr_{rel}(度/帧)。

对SLAM的意义

MAC-VO代表了基于学习的里程计的成熟:不仅仅预测位姿或光流,还预测这些预测有多大误差,并以经典估计理论能够消化的形式(度量的、相关的协方差)表达。经过标定的不确定性正是将学习到的前端与滤波器、因子图和多传感器系统融合所需要的——这也是作者所提出的下一步方向——而这个不确定性图同时也可以作为下游决策的可靠性信号。

相关条目