ActiveSplat

Li 2025 · 论文

一句话总结 ——一个自主主动建图系统(RA-L 2025),将稠密的3D高斯溅射(Gaussian Splatting)地图与工作空间的稀疏Voronoi图抽象耦合在一起,使机器人自己决定去哪里、看哪里,以最大化重建的完整性和保真度。

问题

基于渲染的重建(NeRF、3DGS)是场景特定且依赖数据的,因此”对噪声和伪影高度敏感,这些噪声和伪影往往由于视角覆盖不足而产生”——质量完全受制于采集轨迹。主动建图颠覆了这个问题:一个移动智能体边重建边评估即时地图质量,并规划路径以覆盖整个环境。这需要一种既支持快速逼真渲染(用于视角质量评估),又支持在工作空间上进行高效、安全规划的表示——单纯的稠密高斯地图无法提供这一点,而体积神经场(ANM-S)的收敛速度又太慢。

方法与架构

一个基于带位姿RGB-D输入的感知-动作循环,包含三个都复用同一个溅射(splatting)操作的模块:

C^k=i=1nkcifi(uk)j=1i1(1fj(uk)),O^k=i=1nkfi(uk)j=1i1(1fj(uk))\hat{C}_k=\sum_{i=1}^{n_k}\mathbf{c}_i f_i(\mathbf{u}_k)\prod_{j=1}^{i-1}(1-f_j(\mathbf{u}_k)), \qquad \hat{O}_k=\sum_{i=1}^{n_k}f_i(\mathbf{u}_k)\prod_{j=1}^{i-1}(1-f_j(\mathbf{u}_k))

优化遵循SplaTAM的损失函数,L=wcLpho+wdLgeoL=w_c L_{pho}+w_d L_{geo},其中 Lpho=λ1CkC^k+λ2(1SSIM(Ck,C^k))L_{pho}=\lambda_1|C_k-\hat{C}_k|+\lambda_2(1-\mathrm{SSIM}(C_k,\hat{C}_k))Lgeo=DkD^kL_{geo}=|D_k-\hat{D}_k|λ1=0.8,λ2=0.2,wc=0.5,wd=1.0\lambda_1{=}0.8, \lambda_2{=}0.2, w_c{=}0.5, w_d{=}1.0)。当累积不透明度低于 τo1=0.98\tau_{o1}=0.98 或深度偏差超过 ϵMDE\epsilon_{\mathrm{MDE}}(中位深度误差的50倍)时,生成新的高斯。

Si=woso(i)+wcsc(i)+wusu(i)+whsh(i)S_i = w_o\, s_o(i) + w_c\, s_c(i) + w_u\, s_u(i) + w_h\, s_h(i)

其中 wo=20w_o{=}20wc=wu=wh=10w_c{=}w_u{=}w_h{=}10so,scs_o,s_c 分别是2D不可见面积和3D凸包占比,su,shs_u,s_h 是未访问/在视野内的布尔标志。Dijkstra算法规划到所选节点的最短路径。

实验结果

在Habitat仿真器上使用Gibson和Matterport3D数据集(13个单层场景;小场景1000步,中等场景2000步),RTX 3090,结果为5次试验的平均值:

对SLAM的意义

大多数3DGS-SLAM工作(SplaTAM、MonoGS、Photo-SLAM)把相机轨迹视为给定的,而ActiveSplat则闭合了建图与行动之间的环路。其核心洞见在于架构层面:同一个溅射操作同时服务于地图更新、视角评分和工作空间提取,而拓扑图则保持规划的稀疏与安全——这种分工使在线主动重建变得可行。它代表了从被动SLAM向具身、探索驱动的重建转变的趋势,适用于检测、数字孪生和仿真数据采集等场景。

相关条目