DVO
Kerl 2013 · 项目主页
一句话总结 —— 一种直接(无特征)RGB-D里程计方法,在稳健的t分布误差模型下联合最小化所有像素上的光度残差和深度残差,并通过基于熵的关键帧选择和位姿图回环检测扩展为DVO-SLAM。
问题
基于特征的RGB-D里程计将图像简化为稀疏关键点,丢弃了大部分图像信息,这在纹理稀少的室内场景中会陷入困境。直接方法可以利用每一个像素,但稠密残差会被外点污染——遮挡、反射、动态物体、传感器噪声——作者发现高斯噪声假设与真实残差直方图的拟合效果很差,使得外点会使估计产生偏差。逐帧对齐本身也天生会累积漂移。当时缺失的是一个用于稳健稠密RGB-D对齐的、有原则的概率化表述,再加上一种轻量级的方式来选择关键帧并验证回环检测,从而能优化掉漂移。
方法与架构
“DVO”由两篇论文组成:ICRA 2013的稳健里程计论文(光度项、t分布、运动先验)和IROS 2013的稠密视觉SLAM论文(增加深度项、关键帧、回环检测、g2o位姿图)。
- 变形(Warping):一个带深度Z1(x)的像素x通过逆投影π−1被重建,经刚体运动T=exp(ξ^)(旋量ξ∈R6)变换,再重投影:x′=τ(x,T)=π(Tπ−1(x,Z1(x)))。
- 光度+深度残差:每个像素贡献一个堆叠残差r=(rI,rZ)⊤,其中
rI=I2(τ(x,T))−I1(x),rZ=Z2(τ(x,T))−[Tπ−1(x,Z1(x))]Z,
其中[⋅]Z表示Z分量;深度误差等价于带投影查找的点到平面ICP。与早期工作用手动调节的权重线性组合两个误差不同,这里将它们联合建模。
- 概率化稳健估计:MAP估计ξ∗=argmaxξp(ξ∣r),其中双变量残差服从t分布pt(0,Σ,ν)——一个具有覆盖外点的重尾特性的无穷高斯混合分布。这引出了迭代重加权最小二乘:
ξ∗=argξmini∑nwiri⊤Σ−1ri,wi=ν+ri⊤Σ−1riν+1,
自由度取ν=5,尺度矩阵Σ在每次迭代中通过期望最大化重新估计——无需手动调节稳健核阈值。高斯-牛顿正规方程∑iwiJi⊤Σ−1JiΔξ=−∑iwiJi⊤Σ−1ri(2×6雅可比矩阵Ji)在图像金字塔上以粗到细的方式求解。可以加入匀速运动先验,将更新式变为(J⊤WJ+Σ−1)Δξ=−J⊤Wr(0)+Σ−1(ξt−1−ξt(k))。
- 基于熵的关键帧和回环检测(DVO-SLAM):近似Hessian矩阵A给出位姿协方差Σξ=A−1,其熵为H(ξ)∝ln∣Σξ∣。各帧与当前关键帧匹配,直到熵比
α=H(ξk:k+1)H(ξk:k+j)
低于阈值,此时插入一个新的关键帧。回环检测候选通过在每个关键帧周围的球形区域内进行度量最近邻搜索来发现,先在粗分辨率下测试,再用相同的熵比测试进行验证;经验证的约束进入关键帧位姿图,用g2o优化,并在结束时对所有关键帧重新搜索一次。
实验结果
在TUM RGB-D基准上(ICRA论文,漂移以平移RPE的RMSE衡量):在fr1/desk上,t分布加权将漂移降低至0.0458 m/s,而未加权为0.0551;在四个”desk”序列上取平均,t分布+时间先验达到0.0428 m/s——相对参考方法(0.2425 m/s)提升了82.35%——在fr3的”sitting”动态物体序列上则为0.0316 m/s。运行速度在单个CPU核心上达到实时(30 Hz),加权变体每帧约50毫秒。对于完整的DVO-SLAM(IROS论文,freiburg1数据集):仅关键帧跟踪就能平均降低16%的漂移,位姿图优化再降低20%;绝对轨迹误差从0.19米(逐帧)降至0.07米。系统间比较(ATE RMSE平均值):DVO-SLAM达到0.034米,而RGB-D SLAM为0.054米、MRSMap为0.043米、KinFu为0.297米,例如fr1/desk为0.021米,fr1/xyz为0.011米。逐关键帧跟踪耗时约32毫秒(Intel i7-2600);平均地图更新耗时135毫秒。
对SLAM的意义
DVO确立了直接RGB-D里程计作为基于特征方法的一个可靠替代方案,它也依然是学习直接对齐机制——变形、堆叠残差、稳健权重、粗到细的IRLS——的最清晰论文,是理解更复杂稠密系统的先修课。其t分布加权和基于熵的关键帧/回环检测标准成为标准要素;现代SLAM中的直接法半边(LSD-SLAM、DSO,以及神经SLAM内部的稠密跟踪器)都可以看作这一主题的变体。
相关条目