Tightly-coupled LiDAR-camera

当点云配准残差和视觉残差在单一状态上被联合优化于同一个代价函数中(或在同一次滤波器更新中)时,LiDAR-camera SLAM系统就是紧耦合的。如果每种模态各自运行自己的里程计,只在之后融合各自得到的位姿估计——例如在位姿图或简单滤波器中——那就是松耦合的。

联合问题

在紧耦合的优化后端中,状态 X\mathbf{X}(位姿、速度、IMU偏置,有时还包括地图点)通过最小化多种异质项之和来求解:

X=argminX  rIMUΣI2+rvisualΣV2+rLiDARΣL2+rloopΣlp2\mathbf{X}^* = \arg\min_{\mathbf{X}} \; \sum \|\mathbf{r}^{\text{IMU}}\|^2_{\Sigma_I} + \sum \|\mathbf{r}^{\text{visual}}\|^2_{\Sigma_V} + \sum \|\mathbf{r}^{\text{LiDAR}}\|^2_{\Sigma_L} + \sum \|\mathbf{r}^{\text{loop}}\|^2_{\Sigma_{lp}}

其中LiDAR残差通常是点到面或点到线的距离,视觉残差是重投影误差或光度误差。LVI-SAM在GTSAM上用因子图实现了这一点。基于滤波器的等价方案则把相同的残差放入迭代卡尔曼更新:FAST-LIVO把两种模态的雅可比矩阵堆叠成 H=[HLiDAR;HVisual]\mathbf{H} = [\mathbf{H}^{\text{LiDAR}}; \mathbf{H}^{\text{Visual}}] 进行一次更新,而FAST-LIVO2在一次迭代内顺序应用它们——先LiDAR,再在中间状态上处理视觉——以应对LiDAR扫描和图像在维度上的巨大差异。

相比之下,松耦合设计会独立运行LiDAR里程计和视觉里程计,只融合它们各自输出的6-DoF位姿。而这种压缩恰恰是紧耦合所要避免的。

紧耦合与松耦合一览

紧耦合松耦合
融合的对象原始残差(点、像素)6-DoF位姿估计(+协方差)
信息保留完整——保留了与偏置的交叉相关性有损——每种模态都被预先边缘化
跨模态互助通过共享状态自动实现只能通过人工设计的接口实现
对标定误差的敏感度高——误差进入每一个残差较低——由各子系统各自吸收
故障隔离默认较差——异常值会污染联合状态较好——出问题的里程计可以被忽略
实现难度

为什么要承受额外的复杂度?

常见陷阱

对SLAM的意义

紧耦合与松耦合的区分,在VIO中已经很常见,是LiDAR-相机融合中最重要的架构分歧点:它在很大程度上决定了系统的精度上限和失效行为。每一个主流的LVI系统(LVI-SAM、R3LIVE、FAST-LIVO2)都把紧耦合作为自己的头条特性来宣传,而阅读它们的代价函数是理解每个系统究竟融合了什么的最快方法。

相关条目