Align3R

Lu 2025 · 论文

一句话总结 — Align3R通过将单目深度信息注入一个经过微调的DUSt3R,再由其成对3D点图对所有帧进行对齐,把闪烁不稳的逐帧单目深度预测转变为时间一致的视频深度外加相机位姿(CVPR 2025 Highlight)。

问题

现代单目深度估计器(Depth Pro、Depth Anything V2)能够产生高质量的单图深度,但无法在动态视频的各帧之间保持一致的尺度因子,因此估计出的深度序列会闪烁。早期的解决方法是在推理时用光流或匹配约束进行优化,这在大运动下会失效,且耗时数小时;近期的视频扩散方法(DepthCrafter、ChronoDepth)训练代价高昂,只能处理固定长度的片段,且只输出尺度不变的深度而没有相机位姿——这对4D重建或跟踪来说是不够的。Align3R探讨的问题是:如何在不付出扩散模型高昂代价的前提下,为动态单目视频获得一致的视频深度和位姿。

方法与架构

给定 NNIk\mathbf{I}_k,单目估计器首先预测逐帧深度 D^k\hat{\mathbf{D}}_k;随后一个改进版的DUSt3R基于这些深度预测成对点图;最后全局对齐求解深度 Dk\mathbf{D}_k 和位姿 πkSE(3)\pi_k\in\mathbb{SE}(3)

argminD,π,σeEveCveDvσePe(πv,Xve)22\arg\min_{\mathbf{D},\pi,\sigma}\sum_{e\in\mathcal{E}}\sum_{v\in e}\mathbf{C}^{e}_{v}\left\|\mathbf{D}_{v}-\sigma_{e}P_{e}(\pi_{v},\mathbf{X}^{e}_{v})\right\|_{2}^{2}

其中 σe\sigma_e 是每条边的尺度因子,PeP_e 将点图投影到视角 vv 下形成深度图。

实验结果

在6个数据集上评估,每个序列使用单一的尺度/偏移(比逐帧对齐更严格),Abs Rel \downarrow / δ<1.25\delta<1.25 \uparrow:

对SLAM的意义

跨帧一致的深度恰恰是稠密视觉里程计和建图所需要的:一个在各帧之间自我矛盾的单目深度网络会毒害位姿估计和地图融合。Align3R展示了一套实用的方案——用基础模型深度提供细节,用DUSt3R风格的成对点图作为几何粘合剂,再用DUSt3R自身的全局对齐作为后端——使单图深度模型可以作为视频/SLAM的前端使用,而其在动态序列上的位姿精度可与DROID-SLAM等专用系统相媲美。它属于快速发展的DUSt3R家族(MonST3R、MASt3R-SLAM),该家族正被逐步适配到序列化和动态数据中。

相关条目