VGGT-SLAM 2.0

Maggio 2026 · 论文

一句话总结 —— VGGT-SLAM 的后续版本:一个关键帧级别的因子图,消除了 15 自由度漂移和平面退化问题,提供了从 VGGT 注意力层中免训练读出的回环闭合验证,并能在 Jetson Thor 上实时运行。

问题

VGGT-SLAM 通过在 SL(4) 上优化 15 自由度单应矩阵解决了无标定子地图对齐问题,但该方案自身也带来了代价:高维对齐会在两次回环闭合之间引入快速漂移,可能严重扭曲场景;而在平面场景中(相机面对墙壁或地面)求解完整单应矩阵是退化的,会导致发散。其因子图也只估计每个子地图的单应矩阵,因此来自 VGGT 的关键帧级旋转/平移误差处理并不理想,而用于回环检测的图像检索则完全信任外部网络(SALAD),没有任何验证机制。VGGT-SLAM 2.0 重新设计了后端以消除这些失效模式,同时依然尊重 VGGT 在未知内参下固有的重建歧义——并让整个系统能够在机器人上在线运行。

方法与架构

实验结果

所有实验中保持不变的参数(最小视差 50 像素,置信度阈值 25%,SALAD 0.95,αmatch\alpha_{match} 0.85)。

对SLAM的意义

第一波基础模型 SLAM 系统(MASt3R-SLAM、VGGT-SLAM)证明了这一概念的可行性,但只能离线运行或运行速度低于传感器帧率。VGGT-SLAM 2.0 弥合了剩下的差距——能够在嵌入式机器人硬件上在线运行的稠密前馈重建——而这才是机器人和增强现实的实际需求。其对注意力层的分析也是一个值得关注的模式:从一个冻结的基础模型中提取回环闭合验证、且无需任何训练,这暗示了这些模型本身已经蕴含了多少潜在的 SLAM 机制。由于没有任何训练环节,更快或更好的 VGGT 变体可以直接替换进来。

相关条目