VGGT

Wang (Meta) 2025 · 论文

一句话总结 —— 一个单一的前馈式 Transformer,能够在不到一秒的时间内,从一到数百个视角直接推断相机参数、深度图、稠密点图和三维点轨迹——CVPR 2025 最佳论文,也是用单一网络取代几何流水线的一个范例。

问题

三维视觉模型通常被限定于并专门用于单一任务:一个网络负责深度,另一个负责位姿,再一个负责点跟踪——而完整的多视角重建则需要多阶段流水线,并将视觉几何优化(光束法平差、三角化、DUSt3R 风格的全局对齐)作为后处理步骤。VGGT 提出的问题是:能否用一个网络直接从任意数量的视角推断出场景的所有关键三维属性,并做到足够快、足够准确,从而使优化阶段变为可选。

方法与架构

一个函数,四种输出:给定场景的 NN 幅图像,该 Transformer ff 为每帧预测

f((Ii)i=1N)=(gi,Di,Pi,Ti)i=1N,f\big((I_i)_{i=1}^N\big) = \big(\mathbf{g}_i, D_i, P_i, T_i\big)_{i=1}^N,

其中 gi=[q,t,f]R9\mathbf{g}_i = [\mathbf{q}, \mathbf{t}, \mathbf{f}] \in \mathbb{R}^9 打包了旋转四元数、平移和视场角;DiRH×WD_i \in \mathbb{R}^{H \times W} 是深度图;PiR3×H×WP_i \in \mathbb{R}^{3 \times H \times W} 是点图,(与 DUSt3R 一样)在第一个相机的坐标系中表示;TiRC×H×WT_i \in \mathbb{R}^{C \times H \times W} 是供跟踪模块 T\mathcal{T} 使用的稠密特征。

L=Lcamera+Ldepth+Lpmap+λLtrack,λ=0.05,\mathcal{L} = \mathcal{L}_{\text{camera}} + \mathcal{L}_{\text{depth}} + \mathcal{L}_{\text{pmap}} + \lambda \mathcal{L}_{\text{track}}, \qquad \lambda = 0.05,

其中相机的 Huber 损失为 Lcamera=ig^igiϵ\mathcal{L}_{\text{camera}} = \sum_i \|\hat{\mathbf{g}}_i - \mathbf{g}_i\|_\epsilon,稠密项的不确定性加权损失形式为 iΣiD(D^iDi)+ΣiD(D^iDi)αlogΣiD\sum_i \|\Sigma_i^D \odot (\hat{D}_i - D_i)\| + \|\Sigma_i^D \odot (\nabla \hat{D}_i - \nabla D_i)\| - \alpha \log \Sigma_i^D(点图同理)。

实验结果

对SLAM的意义

VGGT 验证了三维视觉的前馈式基础模型范式:一个训练良好的 Transformer 可以取代整套 SfM/SLAM 前端(检测、匹配、位姿估计、三角化、稠密深度)。它将 DUSt3R/MASt3R 的点图谱系从图像对扩展到任意数量的视角,并立即催生了围绕它构建的 SLAM 系统——VGGT-SLAM、VGGT-Geo 等——其中网络提供即时几何信息,而轻量级后端提供一致性保证。如果你正在探索手工设计几何之后 SLAM 的发展方向,这正是值得一读的论文。

相关条目