VGGT-SLAM

Maggio 2025 · 论文

一句话总结 —— 使用 VGGT 作为前端的稠密单目 RGB SLAM,通过在 SL(4) 流形上优化的因子图,增量式地对齐前馈式子地图重建结果——因为无标定的子地图之间可能相差一个完整的 15 自由度投影变换,而不仅仅是一个相似变换。

问题

VGGT 通过一次前向推理重建一批帧,但 GPU 内存将单次推理限制在 RTX 4090(24 GB)上大约 60 帧,因此长视频必须被拆分为多个子地图,再对齐成一张地图。相关工作使用相似变换(旋转+平移+尺度)来对齐子地图,但 VGGT-SLAM 指出这对无标定相机来说是不够的:根据投影重建定理,在对相机运动、场景结构或内参不做任何假设的情况下,场景只能在真实几何的一个 15 自由度投影变换的意义下被恢复。因此,7 自由度的 Sim(3) 对齐并不总能使两个子地图一致——尤其是当帧间视差较小、VGGT 学习到的度量先验变得不可靠时,子地图之间会残留剪切、拉伸和透视畸变。

方法与架构

实验结果

在 7-Scenes 和 TUM RGB-D 上进行评估(通过 evo 计算 ATE RMSE),在 RTX 4090 上对 5 次运行取平均;参数为 wloop=1w_{\text{loop}}=1τdisparity=25\tau_{\text{disparity}}=25 像素、τconf=25%\tau_{\text{conf}}=25\%、300 次 RANSAC 迭代。

对SLAM的意义

VGGT-SLAM 是第一个将多视角前馈式基础模型包裹进完整 SLAM 循环——子地图、回环闭合,以及对此类模型所遗留的重建歧义的原理性处理——的系统。它的核心观察——无标定的前馈式子地图必须在 SL(4) 而不是 Sim(3) 上对齐——对于任何在学习型几何之上构建 SLAM 的人来说都具有重要的概念意义,其 SL(4) 因子图求解器也已被合并进 GTSAM。它处于从 DROID-SLAM 和 MASt3R-SLAM 通往日益学习化的 SLAM 技术栈的直接谱系之中。

相关条目