OKVIS2-X

Boche & Leutenegger 2025 · 论文

一句话总结 — OKVIS2-X将OKVIS2扩展为一个统一的多传感器SLAM系统,融合视觉、惯性、测量或学习得到的深度、LiDAR和GNSS测量,同时构建与估计器紧耦合的稠密体素占据子地图(submap)——可扩展到9公里长的序列并实时运行。

问题

大多数最先进的VI-SLAM系统只能构建稀疏的地标地图,缺乏下游任务所需的几何细节(例如路径规划需要明确的自由空间表示,而点云和网格都无法表达这一点),并且每个系统通常都是围绕一套固定的传感器组合构建的。一个搭载相机、IMU、深度/LiDAR以及GNSS接收器的机器人,传统上需要将独立的VIO、LiDAR惯性以及建图系统栈拼接在一起。OKVIS2-X试图一次性满足所有需求:最高的精度和鲁棒性、稠密且全局一致的体素占据地图、大规模运行能力,以及实时性能——全部整合在一个单一的、可配置的因子图框架中。

方法与架构

OKVIS2-X保留了OKVIS2的前端(BRISK关键点、DBoW2场景识别、可选的Fast-SCNN天空分割)、实时估计器和异步全图回环优化,并新增了三个模块:一个深度网络(Depth Network)、一个多传感器处理器(Multi-Sensor Processor)(GNSS残差、LiDAR运动去畸变、帧到地图因子),以及一个子地图接口(Submapping Interface)。所有内容都被组合进一个统一的目标函数:

c(x)=12i,k,jρc(eri,j,kTWreri,j,k)+12keskTWskesk+12r,cepr,cTWpr,cepr,c+12ρt(em2)+12jGegjTWgjegj,c(\mathbf{x}) = \frac{1}{2}\sum_{i,k,j} \rho_{\mathrm{c}}\left({\mathbf{e}_{\mathrm{r}}^{i,j,k}}^T \mathbf{W}_{\mathrm{r}} \mathbf{e}_{\mathrm{r}}^{i,j,k}\right) + \frac{1}{2}\sum_{k} {\mathbf{e}_{\mathrm{s}}^{k}}^T \mathbf{W}_{\mathrm{s}}^{k} \mathbf{e}_{\mathrm{s}}^{k} + \frac{1}{2}\sum_{r,c} {\mathbf{e}_{\mathrm{p}}^{r,c}}^T \mathbf{W}_{\mathrm{p}}^{r,c} \mathbf{e}_{\mathrm{p}}^{r,c} + \frac{1}{2}\sum \rho_{\mathrm{t}}\left(e_{\mathrm{m}}^2\right) + \frac{1}{2}\sum_{j\in\mathcal{G}} {\mathbf{e}_{\mathrm{g}}^{j}}^T \mathbf{W}_{\mathrm{g}}^{j} \mathbf{e}_{\mathrm{g}}^{j},

即重投影因子、预积分IMU因子、由边缘化推导出的位姿图因子、地图对齐因子(帧到地图以及地图到地图)以及GNSS因子,并配以Cauchy核(ρc\rho_{\mathrm{c}})和Tukey核(ρt\rho_{\mathrm{t}})作为鲁棒化处理。

实验结果

对SLAM的意义

OKVIS2-X代表了当前开源多传感器SLAM的前沿:由OKVIS/OKVIS2开创的滑动窗口+位姿图架构,能够干净地从一对相机-IMU推广到一整套传感器组合,稠密占据建图也从被动的附带产物升级为一种能够改善轨迹的一级因子。对实践者而言,它是一个单一的、可配置的系统(vi / vid / vil / vig / vidg / vilg),覆盖了此前需要拼接独立的VIO、LiDAR惯性以及建图系统栈才能满足的使用场景——而且它的地图明确表达了自由空间,可直接用于安全导航。

相关条目