OpenGS-SLAM
Yang 2025 · 论文
一句话总结 — 基于3D高斯的开放集稠密语义RGB-D SLAM:每个高斯携带的不是特征嵌入向量而是单一的显式标签,通过高斯投票splatting(Gaussian Voting Splatting)和基于置信度的多视角标签共识,将带噪声的2D基础模型分割结果转化为一致的、物体级的3D地图。
问题
以往的语义SLAM系统”普遍受限于预训练分类器所覆盖的有限类别以及隐式语义表示,这妨碍了它们在开放集场景下的表现,并限制了物体级的3D场景理解”。基于特征嵌入的3DGS方法(SemGauss-SLAM、NEDS-SLAM)在每个高斯上存储一个N通道的嵌入向量,因此无法直接读出单个高斯的标签——这就阻碍了物体级交互——而且渲染/存储开销会大幅膨胀。要实现显式标签,存在三个障碍:(1) 标签不可微,因此无法直接搭载在标准3DGS光栅化器上;(2) SAM一类的分割器在不同视角间不一致(同一物体被赋予不同标签,或被拆分成多个部分);(3) 弱约束的高斯会变得过大,并抹糊分割边界。
方法与架构
构建于GS-ICP SLAM之上(跟踪由G-ICP完成);输入为RGB-D视频流,且没有预定义的语义类别:
- 集成式语义信息生成器:RAM为图像标注开放集类别,这些类别再提示YOLO-World生成带检测得分的语义框;SAM(或MobileSAMv2)生成带置信度但标签ID随机的标签图。掩码和框通过IoU(> 0.5)匹配,构成一个输入标签-类别表 ;一个全局表 在SLAM运行过程中从空集动态增长。
- 语义高斯表示:每个高斯持有中心 、协方差 、不透明度 、颜色 ,以及一个一维、不可微的GS标签 ——取代了N通道的特征嵌入。
- 高斯投票splatting:高斯通过 投影到图像上,并按由前到后的顺序做alpha合成得到颜色和深度,。对于标签,每个参与合成的高斯用其混合权重投票:
该像素取累积权重 最高的标签 。每个像素前 个贡献者记录在 中,因此当某像素的标签从 翻转为 时,可以找到相应负责的高斯并对其显式重新打标签——实现快速的标签渲染与场景更新,且无需梯度。
- 基于置信度的2D标签共识:输入标签 与当前地图渲染出的标签 进行匹配,共分四种情形——完全匹配(采用地图标签,保留最大置信度)、部分匹配(各部分通过面积加权置信度 投票;置信度更高的一方获胜)、整体匹配(对称情形),或新标签(阈值 )。另有两项改进:输入置信度更新对部分可见物体的标签降低权重(依据该物体可见高斯与总高斯的比例);部分标签衰减每当某个标签被识别为”部分”时,就将其置信度减去 ,从而使SAM长期存在的过度分割问题在反复观测中逐渐得到修复。
- 分割计数器剪枝:对于完全匹配的标签对,两个掩码对称差集中(“counter Gaussians”)尺度超过阈值 (Replica为0.10,TUM为0.25)的高斯会被剪除,从而为物体轮廓处新的、更贴合的高斯腾出空间。
实验结果
- 闭集语义分割(Replica,以真实语义先验作为输入):在全部8个场景上均取得最佳mIoU,例如R0为93.24 / Of4为93.77,相较SGS-SLAM的92.95(R0)和SNI-SLAM的88.42。
- 零样本开放集新视角分割(Replica平均):Ours(SAM1.0)的mIoU为61.91 / Acc为73.11,速度达165.47 FPS,可学习参数量为301.71 MB,相较GS-Grouping的59.15 / 69.94(16.14 FPS,717.12 MB)和Feature 3DGS的48.89 / 57.51(11.03 FPS,894.91 MB)——论文声称语义渲染速度提升约10倍、存储量降低约2倍。
- 跟踪/建图(Replica平均):ATE为0.16 cm——相对其他稠密语义SLAM方法最高提升51%(SemGauss-SLAM为0.33,SGS-SLAM为0.41)——同时在表中PSNR最佳,为39.49,LPIPS为0.034。在TUM上:平均ATE为2.15 cm(fr1-desk为2.40,fr2-xyz为1.57,fr3-office为2.48),优于SplaTAM(3.25)和GICP-SLAM(2.28)。
- 消融实验(Replica,SAM1.0基线为63.17 mIoU / 74.51 Acc):去掉部分标签衰减损失5.96 mIoU / 10.2 Acc;去掉输入置信度更新损失3.39 / 5.4;去掉计数器剪枝损失0.26 / 1.49(它主要起到锐化边界的作用——论文将跟踪性能的提升归功于此,因为更干净的轮廓改善了G-ICP对齐效果)。
- 论文声明的局限:不适用于动态场景。
对SLAM的意义
OpenGS-SLAM处于基于3DGS的稠密SLAM与由2D基础模型驱动的开放词汇建图的交汇点上。其离散标签投票方案表明,物体级、开放集的场景理解并不需要将沉重的语言特征嵌入到每一个地图基元中——这正是ConceptFusion/LERF一类地图的主要成本问题——而显式的逐高斯标签恰好是交互任务(移除、移动、选择物体)所需要的。它还表明语义信息的整理反过来可以帮助几何:剪除错误标注、过大的高斯可切实改善G-ICP跟踪效果。