Multi-Sensor Fusion SLAM Survey

Zhu 2024 · 论文

一句话总结 — 一篇关于融合相机、激光雷达和 IMU 的 SLAM 系统的综述,将过去十年的多传感器融合文献组织为四大传感器组合类别,每一类再按耦合深度和估计器类型细分。

问题

没有任何单一传感器能满足稳健、长期定位的要求:在隧道、洞穴和城市峡谷中,GNSS 不可用或不准确;低成本 IMU 会因噪声和偏置污染测量而产生漂移;单目相机存在尺度漂移问题,且对光照变化和纹理缺失敏感;激光雷达在无结构环境(长走廊、空旷场地)和退化几何结构中会失效。多传感器融合用互补的感知手段补偿这些不足——但到 2022 年,相关文献已在视觉-惯性、激光-惯性和激光-视觉三条主线上爆炸式增长,而覆盖相机+激光雷达+IMU完整图景的综述却寥寥无几。本文提供了这样一份简明而完整的地图。

方法与架构

该综述首先向读者介绍两种主流的状态估计器构成方式

minX {rp(X)2+kIrI(k,X)PkI2+kArA(k,X)PkA2}\min_{X}\ \left\{ \left\| r_p(X) \right\|^2 + \sum_{k \in I} \left\| r_I(k, X) \right\|_{P_k^I}^2 + \sum_{k \in A} \left\| r_A(k, X) \right\|_{P_k^A}^2 \right\}

其中 rIr_I 是 IMU 残差(通过预积分得到的相对运动约束,避免每次迭代都重新传播),rAr_A 是视觉或激光雷达的几何残差,PP 是它们的协方差,rpr_p 是来自边缘化的先验——它在不明显损失信息的前提下限制了计算量。

随后综述回顾了四大融合类别,每类都给出代表性系统(其表 1):

最后综述总结了尚待解决的挑战:传感器间标定(基于标记方法对比互信息法和在线标定法)、高效数据关联、可靠的初始化(SfM 对齐法对比闭式解法),以及动态环境——并提出了未来方向:通用的平台无关融合框架、深度学习辅助模块,以及分布式协作多机器人融合。

实验结果

作为一篇综述,本文没有新的实验;其贡献在于分类体系和系统性对比。其表 1 沿四个维度对约 20 个 SOTA 系统(2013—2022 年)进行分类——融合类型、耦合方式(松/紧)、回环检测机制、传感器类型(单目相机、机械式对比固态激光雷达、RGB-D),以及融合策略(MSCKF、EKF/迭代 ESKF、滑动窗口、因子图、位姿图、BA)。文中反复出现的、从文献中总结出的实证结论是:松耦合方法在简单性、可扩展性和计算成本上占优;紧耦合方法在精度和稳健性上占优。发表于《清华大学学报(Tsinghua Science and Technology)》29(2):415–429(2024 年),开放获取;各系统的详细讨论请参见原文。

对SLAM的意义

在读完本级别中的各篇独立论文之后,这样一篇综述正是你用来梳理归纳的工具:它将每个系统归入一个共同的分类体系,总结了各种权衡(精度与算力、稳健性与复杂度),并追溯了系统间的谱系(LOAM 到 LIO-SAM 再到 LVI-SAM;FAST-LIO2 到 FAST-LIVO/R3LIVE)。在为新平台选择融合架构时,它也是一条实用的捷径——文中列出的设计维度(传感器组合、耦合深度、滤波器还是平滑器)正是你必须做出的决策,其挑战清单(标定、初始化、动态性)则是部署时的检查表。

相关条目