OpenGS-SLAM

Yang 2025 · 论文

一句话总结 — 基于3D高斯的开放集稠密语义RGB-D SLAM:每个高斯携带的不是特征嵌入向量而是单一的显式标签,通过高斯投票splatting(Gaussian Voting Splatting)和基于置信度的多视角标签共识,将带噪声的2D基础模型分割结果转化为一致的、物体级的3D地图。

问题

以往的语义SLAM系统”普遍受限于预训练分类器所覆盖的有限类别以及隐式语义表示,这妨碍了它们在开放集场景下的表现,并限制了物体级的3D场景理解”。基于特征嵌入的3DGS方法(SemGauss-SLAM、NEDS-SLAM)在每个高斯上存储一个N通道的嵌入向量,因此无法直接读出单个高斯的标签——这就阻碍了物体级交互——而且渲染/存储开销会大幅膨胀。要实现显式标签,存在三个障碍:(1) 标签不可微,因此无法直接搭载在标准3DGS光栅化器上;(2) SAM一类的分割器在不同视角间不一致(同一物体被赋予不同标签,或被拆分成多个部分);(3) 弱约束的高斯会变得过大,并抹糊分割边界。

方法与架构

构建于GS-ICP SLAM之上(跟踪由G-ICP完成);输入为RGB-D视频流,且没有预定义的语义类别:

wji=αik=1i1(1αk),Wj=giGpjwjiw_j^i=\alpha_i\prod_{k=1}^{i-1}(1-\alpha_k), \qquad W_j=\sum_{g_i\in G_p^j} w_j^i

该像素取累积权重 WjW_j最高的标签 j\ell_j。每个像素前 K=50K=50个贡献者记录在 GtopKG_{topK}中,因此当某像素的标签从 s\ell_s翻转为 t\ell_t时,可以找到相应负责的高斯并对其显式重新打标签——实现快速的标签渲染场景更新,且无需梯度。

实验结果

对SLAM的意义

OpenGS-SLAM处于基于3DGS的稠密SLAM与由2D基础模型驱动的开放词汇建图的交汇点上。其离散标签投票方案表明,物体级、开放集的场景理解并不需要将沉重的语言特征嵌入到每一个地图基元中——这正是ConceptFusion/LERF一类地图的主要成本问题——而显式的逐高斯标签恰好是交互任务(移除、移动、选择物体)所需要的。它还表明语义信息的整理反过来可以帮助几何:剪除错误标注、过大的高斯可切实改善G-ICP跟踪效果。

相关条目