AMB3R

Wang 2025 · 论文

一句话总结 ——一个属于DUSt3R/VGGT谱系的前馈式3D重建模型,它在冻结的VGGT基础上增加了一个度量尺度头和一个稀疏体积后端,使单个网络同时服务于多视图重建、无标定视觉里程计和大规模SfM——无需微调或测试时优化。

问题

点图(Pointmap)模型(DUSt3R、MASt3R、VGGT)逐像素回归3D几何,但网络是在2D网格上运作的:没有任何机制强制空间紧凑性——这一性质(TSDF、特征网格、坐标网络所共有)指的是一个3D位置只对应一个值,正是这一性质将同一点的多次观测融合成一致的几何。重叠像素的点图预测之间只是隐式地被鼓励保持一致。还有两个差距使这些模型与可部署的SfM/SLAM引擎有距离:预测是归一化尺度而非度量尺度的,并且此前的系统需要基于优化的后端(例如VGGT-SLAM的SL(4)因子图)或任务特定的调优才能作为VO/SfM运行。AMB3R(“Accurate feed-forward Metric-scale 3D reconstruction with Backend”,精确的前馈度量尺度3D重建及后端)在一个模型内同时解决这三个问题。

方法与架构

实验结果

在13个数据集上评测7项任务(所有距离单位为cm;ATE RMSE通过evo计算):

对SLAM的意义

点图这条技术路线正在逐步吞噬经典的SfM/SLAM技术栈,而AMB3R标志着一个门槛:一个无标定的前馈式系统,在TUM上超越了带标定的基于优化的SLAM。它的两个思想都各自具有独立的意义——从冻结特征中恢复度量尺度,在不依赖IMU或双目的情况下解决了单目尺度歧义问题;而紧凑的3D后端则以学术级的训练成本,恢复了点图回归所丢失的空间紧凑性先验。它剩余的局限性(没有显式的回环检测或重定位、注意力计算量随视角数量呈平方增长、依赖参考帧先验)恰恰勾勒出了基于优化的后端仍然有其价值的地方。

相关条目