Online 3DGS Modeling

Lee 2025 · 论文

一句话总结 — 一种在线单目3DGS建图方法,将DROID-SLAM + 多视图立体(MVS)前端与高斯后端相结合,并加入了不确定性驱动的非关键帧新视角选择机制,使模型恰好在能修复其不完整区域的额外帧上进行训练。

问题

基于稠密SLAM构建的在线3DGS流水线”仅依赖关键帧,而关键帧不足以覆盖整个场景,导致重建不完整”。关键帧的选取依据是对平均光流设阈值——这是一个跟踪层面的准则——因此那些只被短暂观测到、或仅从非关键帧视角观测到的区域重建不足。然而在线预算又不允许对每一帧都进行训练。在预算固定的情况下,哪些额外帧值得训练?第二个问题是:许多系统使用稀疏或单图预测的深度,这类深度存在尺度歧义,且在室外场景中会失效。

方法与架构

基于MVS-GS框架构建,前端和后端独立并行运行:

c^(p)=iNciαij=1i1(1αj),αi=oigi(x)\hat{c}(p)=\sum_{i\in N} c_i\,\alpha_i \prod_{j=1}^{i-1}(1-\alpha_j), \qquad \alpha_i = o_i\, g_i(x)

深度 D^(p)\hat{D}(p)以同样方式渲染,使用每个高斯的深度 ziz_i

Un,i=α1λn,i+α2An,i,α1=0.7, α2=0.3U_{n,i}=\alpha_1 \lambda_{n,i}+\alpha_2 A_{n,i}, \qquad \alpha_1=0.7,\ \alpha_2=0.3

非关键帧 InI_n的信息增益是对可见高斯的不确定性求和,并以深度平方的倒数加权:Un=iUn,i/zn,i2U_n=\sum_i U_{n,i}/z_{n,i}^{2}。候选帧(最近30个关键帧跨度内的非关键帧,加上20个延续保留的高增益帧)按 UnU_n排序,非极大值抑制去除近似重复的视角,得分最高的top-k帧与最近30个关键帧一起构成训练集。与FisherRF或GS-Planner不同,这一方法不需要昂贵的渲染图像比较。

实验结果

所有实验均在RTX 4090上进行(Replica上平均约9.18 FPS,显存占用约17.2 GiB):

对SLAM的意义

这是首个在基于3DGS的SLAM框架中引入非关键帧选择的工作:即便面对被动的相机视频流,它也将重建完整性视为一个主动选择问题,把下一最佳视角(next-best-view)思想引入到在线建图中。它同时也印证了这样一个观点:多视图立体深度(而非单目深度预测)才是使基于渲染的SLAM在室外场景中存活下来的关键——而室外场景正是仅依赖关键帧的流水线退化最严重的场合。

相关条目