直接LiDAR-相机对齐
**直接(Direct)**方法在不先提取稀疏特征的情况下,将传感器数据与地图对齐。应用到LiDAR-相机融合中,这意味着在同一张地图上同时发生两件事:
- 直接LiDAR配准:原始扫描点直接以点到平面(或点到隐式表面)残差与地图配准——不像LOAM那样需要提取边缘/平面特征。FAST-LIO2表明这种方式既更快又更准确,并且能自动适应任意扫描模式(机械旋转式或固态LiDAR)。
- 直接视觉对齐:不再检测和匹配角点(ORB、FAST),而是通过最小化当前图像与地图中存储外观之间的光度误差来估计相机位姿。
核心残差
在FAST-LIVO中,每个LiDAR地图点 都携带一个来自其首次被观测时的小图像块 ;新帧通过最小化以下目标来对齐
其在图像块邻域 (例如两侧各几个像素)上求和。由于LiDAR为这些锚点提供了精确的三维位置,视觉模块因此白得了一大批定位良好的地标——无需三角化,无深度歧义。R3LIVE以其最精简的形式使用了同样的原理:地图点存储颜色 ,VIO通过最小化 来对齐帧,然后再精细化地图的纹理。
如何进入估计器
将这些残差送入紧耦合滤波器的方式有两种模式:
- 堆叠更新(FAST-LIVO):将LiDAR点到平面雅可比矩阵与视觉光度雅可比矩阵拼接起来,,并在一次迭代卡尔曼更新中一并应用。
- 顺序更新(FAST-LIVO2):在同一次ESIKF迭代内,先应用LiDAR更新,再在中间状态上运行视觉更新——,然后 ——这样就规避了数千个LiDAR残差与图像测量之间的维度不匹配问题。
要让对齐保持可靠,还需要在外观方面做一些”内务处理”:随着新视角的到来更新参考图像块(FAST-LIVO2动态执行此操作;R3LIVE则随时间融合颜色),剔除位于深度边缘上或在当前视角中被遮挡的不稳定点(FAST-LIVO的异常值剔除机制),以及利用LiDAR平面先验来约束图像块对齐本身(FAST-LIVO2)。
为什么选择直接法?
其吸引力主要体现在三个方面。首先是延迟:跳过特征提取和描述子匹配,省去了每帧相当大的计算开销。其次是在低纹理场景中的鲁棒性:光度对齐可以利用角点检测器一无所获的微弱梯度。第三是架构简洁性:一张共享地图(ikd-Tree或体素地图)可同时服务于两种模态,而不需要维护必须彼此保持一致的独立视觉地图和LiDAR地图。
常见陷阱
- 收敛域很小。 光度误差高度非凸;对齐只能在真实位姿附近成功。直接法LVI系统之所以能行得通,是因为IMU传播和LiDAR配准为视觉模块提供了极好的初始猜测——去掉这个先验,该方法就会失效。
- 亮度恒常假设是个谎言。 自动曝光、渐晕以及相机的非线性响应,会使同一表面在不同帧之间呈现不同的亮度。这正是FAST-LIVO2在线估计曝光时间、以及R3LIVE++校准响应函数和渐晕以重建辐射度而非原始RGB的原因。
- 边缘和遮挡点。 锚定在深度不连续处的图像块混合了前景和背景的外观;这类点必须被过滤掉,否则会系统性地使对齐产生偏差。
- 陈旧的外观。 很久以前在不同光照条件下捕获的图像块会逐渐污染残差,除非参考图像块得到刷新——但刷新过于积极又会让漂移渗入地图的外观中。
对SLAM的意义
直接LiDAR-相机对齐是目前最强的开源LVI里程计系统(FAST-LIVO、FAST-LIVO2)以及RGB建图的R3LIVE系列背后的设计思路。它代表了直接视觉里程计传统(DTAM、LSD-SLAM、DSO)在LiDAR时代的延续:一旦深度不再是瓶颈——因为LiDAR已经测量出深度——光度对齐就成为了一种极其廉价而有效的方式,可以为状态估计器增添视觉信息。