VoT

Yugay 2025 · 论文

一句话总结 — Visual Odometry with Transformers(后改名为FVO,“Fast Visual Odometry with Transformers”):将单目VO表述为直接的相对位姿回归问题,使用高容量的时间-空间Transformer结合基于置信度的加权聚合,完全取代了”网络+光束法平差”的混合流程。

问题

将深度网络与经典优化相结合的混合流程主导着视觉里程计领域:神经网络预测加光束法平差可以得到高精度的轨迹。但这些混合方法在速度和能力上不如纯端到端方法——它们依赖庞大、冻结的、预训练的3D骨干网络,而这些骨干网络是在尺度模糊的情况下训练的,因此该流程”本质上继承了这一局限性,并且从设计上就无法估计绝对尺度”;而且其缓慢的优化和后处理步骤成为推理速度的瓶颈。基于光束法平差的方法通常还假定相机标定已知。FVO提出的问题是:如果完全去掉后处理步骤会怎样?

方法与架构

流程:重叠的帧窗口 → 冻结的编码器 → 时间-空间Transformer解码器 → 逐对相对位姿+置信度 → 基于置信度的轨迹融合。没有光束法平差,没有相机内参,没有测试时优化。

Procrustes(FR)=argminR^SO(3)R^FRF2\text{Procrustes}(\mathbf{F}_R) = \arg\min_{\hat{\mathbf{R}} \in \mathbb{SO}(3)} \|\hat{\mathbf{R}} - \mathbf{F}_R\|_F^2

L=Lrotexp(cR)+cR+Ltransexp(ct)+ct,\mathcal{L} = \mathcal{L}_{\text{rot}} \exp(-\mathbf{c}_R) + \mathbf{c}_R + \mathcal{L}_{\text{trans}} \exp(-\mathbf{c}_t) + \mathbf{c}_t,

因此置信度是仅从位姿标签中自监督学习得到的——不需要深度或对应关系的监督。平移量使用训练集统计量进行反归一化,从而得到度量尺度的轨迹。

实验结果

使用未对齐和对齐后的ATE(RMSE,单位米)进行评估——未对齐的指标很重要,因为真实部署场景中没有真值可供对齐:

对SLAM的意义

VoT/FVO是几何估计向Transformer架构迁移这一更广泛趋势的一部分——同样的趋势也催生了用于匹配的LoFTR和用于完整多视图几何的VGGT。对于一个SLAM学习者而言,它的价值在于成为设计空间中端到端极端方案的一个清晰案例研究:删除优化器所获得的收益(速度、度量尺度、无需标定)以及所付出的代价(可解释的几何骨架、动态场景中的鲁棒性)。请注意命名的变化:这项arXiv工作最初以”VoT”之名发表,后来改名为FVO。

相关条目