VGGT
Wang (Meta) 2025 · 论文
一句话总结 —— 一个单一的前馈式 Transformer,能够在不到一秒的时间内,从一到数百个视角直接推断相机参数、深度图、稠密点图和三维点轨迹——CVPR 2025 最佳论文,也是用单一网络取代几何流水线的一个范例。
问题
三维视觉模型通常被限定于并专门用于单一任务:一个网络负责深度,另一个负责位姿,再一个负责点跟踪——而完整的多视角重建则需要多阶段流水线,并将视觉几何优化(光束法平差、三角化、DUSt3R 风格的全局对齐)作为后处理步骤。VGGT 提出的问题是:能否用一个网络直接从任意数量的视角推断出场景的所有关键三维属性,并做到足够快、足够准确,从而使优化阶段变为可选。
方法与架构
一个函数,四种输出:给定场景的 幅图像,该 Transformer 为每帧预测
其中 打包了旋转四元数、平移和视场角; 是深度图; 是点图,(与 DUSt3R 一样)在第一个相机的坐标系中表示; 是供跟踪模块 使用的稠密特征。
- 交替注意力骨干网络:图像先用 DINOv2 分块为令牌,再由约 12 亿参数的标准自注意力层处理—— 对逐帧自注意力(每幅图像内部的令牌)与全局自注意力(所有帧之间的令牌)交替进行。没有交叉注意力层,且三维归纳偏置极少;多视角几何是学习得到的,而不是内置的。
- 令牌与预测头:每帧获得一个相机令牌和四个寄存器令牌;第一帧的令牌是独立的可学习参数,这正是网络得知哪个相机定义世界坐标系的方式(因此 ,)。相机参数由输出的相机令牌经过四个自注意力层加一个线性层预测得到;稠密输出来自一个 DPT 头,后接 3×3 卷积,同时还输出偶然性不确定性图 。
- 跟踪头:一个 CoTracker2 风格的模块将查询点的特征与其他所有帧的特征图 相关联,从而输出针对任意(无序)图像集合的对应关系 ; 和 联合训练。
- 多任务损失:
其中相机的 Huber 损失为 ,稠密项的不确定性加权损失形式为 (点图同理)。
- 过完备预测:相机、深度和点图之间是相互关联的(点图 = 深度 + 相机),然而在训练时对所有量都进行预测,可以切实提升每一项的表现;在推理时,组合深度头和相机头的输出比专用点图头得到的三维点更准确。
- 训练:在 64 张 A100 上历时九天,共 16 万次 AdamW 迭代,每批 2–24 帧,分辨率最高 518 像素,使用 17 个数据集(Co3Dv2、BlendMVS、DL3DV、MegaDepth、Kubric、WildRGB、ScanNet、HyperSim、Mapillary、Habitat、Replica 等)——其规模和多样性与 MASt3R 的训练数据组合相当。
实验结果
- 相机位姿(10 个随机帧,AUC@30):在纯前馈模式下,CO3Dv2 为 88.2,RealEstate10K(训练中未见过)为 85.3,耗时约 0.2 秒——相比 MASt3R 的 81.8 / 76.4(约 9 秒)、VGGSfM v2 的 83.4 / 78.9(约 10 秒),以及同期快速模型 Fast3R 的 82.5 / 72.7 和 CUT3R 的 82.8 / 75.3。将 VGGT 的预测结果作为初始化输入光束法平差,将该数值提升到 91.8 / 93.5,耗时约 1.8 秒(不需要三角化/迭代精修)。
- 多视角深度(DTU,未知相机):整体 Chamfer 距离为 0.382,相比 DUSt3R 的 1.741——接近使用真值相机参数的 GeoMVSNet(0.295)。
- 点图(ETH3D):整体为 0.677(深度+相机组合),相比 DUSt3R 的 1.005 以及采用全局对齐的 MASt3R 的 0.826——同时运行时间仅为 0.2 秒,而非 7–9 秒。
- 双视图匹配(ScanNet-1500):AUC@5 为 33.9,相比 RoMa 的 31.8——尽管其跟踪头并未针对双视图匹配进行专门优化。
- 预训练的 VGGT 特征显著增强了下游任务的表现,包括动态点跟踪(微调后的 CoTracker)和前馈式新视角合成。荣获 CVPR 2025 最佳论文奖;代码和模型均已公开。
对SLAM的意义
VGGT 验证了三维视觉的前馈式基础模型范式:一个训练良好的 Transformer 可以取代整套 SfM/SLAM 前端(检测、匹配、位姿估计、三角化、稠密深度)。它将 DUSt3R/MASt3R 的点图谱系从图像对扩展到任意数量的视角,并立即催生了围绕它构建的 SLAM 系统——VGGT-SLAM、VGGT-Geo 等——其中网络提供即时几何信息,而轻量级后端提供一致性保证。如果你正在探索手工设计几何之后 SLAM 的发展方向,这正是值得一读的论文。