ACE
Brachmann 2023 · 论文
一句话总结 — Accelerated Coordinate Encoding(加速坐标编码)将场景坐标回归的训练时间从数小时缩短到每个场景约5分钟,其做法是将网络拆分为一个场景无关的预训练编码器和一个极小的场景专属MLP头。
问题
基于学习的视觉重定位方法具有领先的位姿精度,但需要数小时甚至数天的训练——而且由于每个新场景都必须重新训练,漫长的训练时间使得基于学习的重定位方法在多数应用中不切实际,尽管它承诺了高精度。制图(mapping)阶段而非查询阶段才是部署的瓶颈:DSAC*是当前最先进的SCR(场景坐标回归)流水线,在一块高端GPU上映射一个场景需要15小时。
方法与架构
设定。 与DSAC系列一样,位姿来自 ,其中 是一个PnP + RANSAC求解器(64个假设,10像素内点阈值,LM优化),而 是由场景坐标回归器 在图像patch 上预测得到的2D-3D对应关系。ACE完整保留了这一切——它的贡献在于让 的训练速度提升两个数量级。
骨干网络/头部拆分。 回归器被分解为
其中 是一个场景无关的卷积骨干网络(采用DSAC*设计的前10层,512维特征,在100个ScanNet场景上用100个并行头预训练一周——11 MB,部署时冻结), 是一个场景专属的、由1x1卷积组成的512宽MLP头——这个4 MB的头本身就是地图。
梯度去相关——核心思想。 标准SCR训练每次迭代只输入一张图像,因此所有patch的梯度高度相关。由于MLP头不需要空间上下文,ACE转而在第一分钟内预先计算出一个包含800万个骨干特征的训练缓冲区(带有像素位置、内参和真值位姿),然后每个epoch打乱一次,并从数千个不同的制图视角中构建5120个特征组成的批次。因此每次参数更新都是在整个场景范围内同时优化——去相关的梯度能够容忍非常高的学习率(AdamW,one-cycle调度,在 到 之间),并在16个epoch/4分钟内收敛。
用课程学习取代端到端训练。 通过可微位姿求解器反向传播的高昂代价(占DSAC*训练时间的一半,却只贡献10%的更新量)被替换为基于逐像素重投影损失的课程学习:有效预测优化一个经 截断的重投影误差
阈值随训练进度 从 像素收缩到 像素——网络先在可靠结构上”预热”,然后放弃那些RANSAC本来就会剔除的预测。无效预测则回归到深度为10米处的一个虚拟坐标。训练以fp16进行;该头预测齐次坐标 ,并用softplus对w进行截断,这在困难场景上持续有帮助。不需要深度,不需要3D模型——只需要带位姿的RGB图像。
实验结果
- 总体成绩:每场景训练不到5分钟即可达到与更慢的SCR前身相同的精度——比最先进的SCR制图速度快达300倍,地图仅4 MB(DSAC*:15小时,28 MB;hLoc在7Scenes每个场景约存储3.3 GB,在Cambridge约800 MB)。
- 7Scenes / 12Scenes(5厘米/5°阈值,SLAM和SfM真值均测试):ACE是唯一一种同时兼具顶级精度、10分钟以内制图时间、以及每场景不到10 MB存储的方法——与DSAC*相当(表1)。仅一个epoch(75秒)后精度已达到约80%;2.5 MB的头在7Scenes上仍能超过95%。
- Cambridge Landmarks:ACE在4 MB下表现尚可;由四个ACE头组成的”Poker”集成在平均中位误差上超越DSAC*,同时制图时间和存储都远为精简。
- Wayspots(一个来自手机扫描的新10场景户外基准,采用类似Map-free的SfM真值,10厘米/5°):ACE平均表现优于DSAC*,同时制图速度快两个数量级。
- 硬件:在入门级T4 GPU上,ACE只减慢约10%,而DSAC*的制图时间翻倍到约30小时——制图成本和能耗降低两个数量级。
对SLAM的意义
ACE将场景坐标回归从一项研究奇技淫巧变成了一个可部署的重定位工具:一种紧凑、隐式、隐私友好的场景表示(不存储图像或点云),可以在现场仅凭带位姿的RGB图像在数分钟内完成训练——这恰恰是手机级视觉里程计所能提供的。它是一系列活跃研究的基础——ACE Zero消除了对已知位姿的需求,ACE-G致力于无需逐场景微调即可泛化,ACE-SLAM则将这种表示推进到实时SLAM循环中,让网络权重本身就是地图。