LiDAR-Visual-Inertial (LVI)

LiDAR-Visual-Inertial(LVI)融合将三种传感器——LiDAR点云、相机图像和IMU测量——组合进单一的状态估计器中。其动机在于互补性:每种模态都能覆盖其他模态的失效模式。

传感器优势典型失效模式
LiDAR直接提供度量深度、探测距离远、不受光照影响雨/雾/雪(光束散射)、几何退化场景(长走廊、开阔场地)
相机稠密纹理、成本低廉、为场景识别提供丰富外观信息黑暗、过曝、无纹理墙面、尺度歧义(单目)
IMU高频运动预测、重力方向、无处不能工作若无外部修正,几秒内即漂移;偏置须被估计

每种传感器的贡献

IMU扮演的角色与其在VIO中的角色相同:它在外部感知测量之间以高频率传播状态,对LiDAR扫描进行去畸变处理(旋转扫描中的每个点都是在略有不同的位姿下采集的),并在相机或LiDAR短暂中断时起到桥接作用。LiDAR锚定地图的度量尺度与几何结构;相机则增加了纹理、在LiDAR退化几何中提供额外约束,以及基于外观的回环检测。

无论采用何种架构,估计器都要在一个共享状态 X\mathbf{X}(位姿、速度、IMU偏置)上求解一个联合问题。在优化视角下,这表示为

X=argminX  rIMUΣI2+rvisualΣV2+rLiDARΣL2+rloopΣlp2,\mathbf{X}^* = \arg\min_{\mathbf{X}} \; \sum \|\mathbf{r}^{\text{IMU}}\|^2_{\Sigma_I} + \sum \|\mathbf{r}^{\text{visual}}\|^2_{\Sigma_V} + \sum \|\mathbf{r}^{\text{LiDAR}}\|^2_{\Sigma_L} + \sum \|\mathbf{r}^{\text{loop}}\|^2_{\Sigma_{lp}},

其中LiDAR残差通常是点到平面距离,视觉残差可以是重投影误差(基于特征)或光度误差(直接法)。滤波器视角则将上式的求和替换为对误差状态的迭代卡尔曼更新。

两大主流设计流派

由于几乎每一篇LVI论文都是这个设计空间中的一个点,下面这张设计空间的示意图会很有用:

维度选项
耦合方式紧耦合(原始残差共享一个估计器) 对比 松耦合(事后融合位姿)
估计器滤波器(ESIKF/iEKF) 对比 平滑器(因子图、滑动窗口)
视觉前端基于特征(角点+描述子) 对比 直接法(光度)
地图各模态独立地图 对比 单一共享地图

鲁棒性契约

一个设计良好的LVI系统在任何环境下,其表现都应该至少不逊于其最强的单模态子系统:在黑暗的隧道中,它应退化为LiDAR-惯性里程计;在几何退化的走廊中,它应退化为视觉-惯性里程计;而在良性条件下,联合估计应比任何单一模态都更准确。这一契约并非自动成立——它需要显式的退化检测与回退机制(参见退化处理一节),否则一个失效的传感器会把融合估计一起拖垮。

常见陷阱

对SLAM的意义

三重融合是目前鲁棒的室外及大规模SLAM的最佳实践——自动驾驶、无人机巡检和手持扫描系统几乎都是LVI(通常还加上GNSS)。理解LVI设计空间(紧耦合与松耦合、滤波器与因子图、特征法与直接法)能让你读懂几乎所有现代融合论文,因为它们都是这个空间中的一个点。

相关条目