ACE-G

Bruns 2025 · 论文

一句话总结 — 将场景坐标回归拆分为一个与场景无关的交叉注意力回归器和一个场景特定的”地图编码(map code)“,在数万个场景上以显式的建图-到-查询目标进行预训练,使重定位能够泛化到建图阶段未见过的查询条件(ICCV 2025)。

问题

经过数分钟的场景特定训练后,SCR模型能够高精度地估计查询图像的相机位姿——但在泛化能力上仍不及经典的基于特征匹配的方法。当查询图像的成像条件(光照、视角)与训练视角差异过大时,SCR模型就会失效。这是以往SCR框架固有的局限:它们的训练目标是将训练视角编码进坐标回归器本身的权重中,因此该回归器天生就会对训练视角过拟合。

方法与架构

ACE由一个与场景无关的卷积图像编码器加上一个场景特定的MLP头组成。ACE-G用一个以场景特定的地图编码 C={ciRDmap}\mathcal{C} = \{\mathbf{c}_i \in \mathbb{R}^{D_\text{map}}\}为条件的与场景无关的坐标回归器fθf_\theta取代了该MLP:

fθ:RDfeat×P(RDmap)R3,(e,C)y,f_\theta : \mathbb{R}^{D_\text{feat}} \times \mathcal{P}\big(\mathbb{R}^{D_\text{map}}\big) \to \mathbb{R}^3, \qquad (\mathbf{e}, \mathcal{C}) \mapsto \mathbf{y},

其中e\mathbf{e}是来自DINOv2图像编码器的图像块嵌入,y\mathbf{y}是预测出的场景坐标。该回归器由NN个仅含交叉注意力的Transformer块堆叠而成——图像块嵌入充当查询token,地图嵌入充当键/值(不使用位置编码,因此地图编码具有置换不变性)——随后接一个两层MLP,输出y\mathbf{y}以及一个Laplace不确定度σy\sigma_y

建图/查询预训练。 训练集由一组建图缓冲区Mi\mathcal{M}_i与不相交的查询缓冲区Qi\mathcal{Q}_i(不同的视角、光照、物体摆放)的元组构成,并带有真实坐标标签。训练交替进行两类迭代:

θ,G=argminθ,G  EM[logσ~y+2y~yσ~y]\theta^\ast, \mathcal{G}^\ast = \arg\min_{\theta, \mathcal{G}} \; \mathbb{E}_{\mathcal{M}}\left[ \log\tilde{\sigma}_{y} + \sqrt{2}\,\frac{\lVert \tilde{\mathbf{y}} - \mathbf{y} \rVert}{\tilde{\sigma}_{y}} \right]

网络每10次迭代才更新一次(其余9次更新地图编码),并且场景会不断从一个活跃池中重新从零开始建图,以避免对特定地图编码过拟合。预训练使用了数万次扫描数据:ScanNet(1201)、ScanNet++(199)、ARKitScenes(4520)、MapFree(2×400)、BlendedMVS(462)以及WildRGBD(22359)。

新场景建图。 只优化一个随机初始化的地图编码,最小化二维重投影误差的不确定度加权NLL,即logσ~x+2x~x/σ~x\log\tilde{\sigma}_{x} + \sqrt{2}\,\lVert \tilde{\mathbf{x}} - \mathbf{x} \rVert / \tilde{\sigma}_{x}——因此建图阶段无需任何真实三维标签,且建图耗时仍与ACE一样只需数分钟。

重定位。 一次前向传播即可得到带不确定度的2D-3D对应关系;这些对应关系先用自适应阈值σthresh=fQp(Σ)\sigma_\text{thresh} = f \cdot Q_p(\Sigma)(不确定度的最低pp分位数,p=0.1p{=}0.1,f=2.0f{=}2.0)进行预筛选,再送入PnP + RANSAC——与经典SCR相同的输出接口。

实验结果

对SLAM的意义

SCR这一脉络一直在持续降低部署成本:DSAC使SCR可端到端训练,ACE将单场景训练时间缩短到数分钟,ACE Zero去除了对已知位姿的需求,而ACE-G则针对剩下的弱点发力——场景特定回归器天生的过拟合问题。可泛化的重定位对于消费级AR以及机器人集群规模的应用意义重大,因为逐场景优化在这些场景下的运维成本很高。它也呼应了Level 5更广泛的趋势:用来自大型预训练模型的前馈推理取代逐场景优化。

相关条目