MASt3R-SLAM

Murai 2024 · 论文

一句话总结 — 首个自底向上、基于双视图3D重建先验(MASt3R)设计的实时稠密SLAM系统,能够以15 FPS从未标定的单目视频中生成全局一致的位姿和稠密地图。

问题

经典的稠密单目SLAM需要经过标定的相机,其几何信息要么来自深度传感器,要么来自脆弱的多视图立体匹配;在真实世界的视频上它会严重退化。MASt3R提供了截然相反的权衡:一个强大的、鲁棒且无需标定的双视图重建与匹配先验,但没有关键帧、全局一致性或实时运行的概念——其稠密匹配单独一对就需要约2秒。MASt3R-SLAM在这个先验之上自底向上构建了一个完整的SLAM系统,在保留其通用性的同时补上了SLAM所需的一切。

方法与架构

流程:每一帧都与当前关键帧配对,输入MASt3R,FM(If,Ik)\mathcal{F}_M(\mathcal{I}^f, \mathcal{I}^k),输出点图X\mathbf{X}、置信度C\mathbf{C}、匹配特征D\mathbf{D}以及特征置信度Q\mathbf{Q}。跟踪模块估计相对位姿并将几何信息融合进关键帧;后端通过检索添加回环边并运行二阶全局优化。

Er=m,nmf,kψ(X~k,nk)ψ(TkfXf,mf)w(qm,n,σr2)ρ,E_r = \sum_{m,n \in \mathbf{m}_{f,k}} \left\| \frac{\psi\big(\tilde{\mathbf{X}}^k_{k,n}\big) - \psi\big(\mathbf{T}_{kf} \mathbf{X}^f_{f,m}\big)}{w(\mathbf{q}_{m,n}, \sigma_r^2)} \right\|_\rho ,

通过高斯-牛顿IRLS求解,(JWJ)τ=JWr(\mathbf{J}^\top \mathbf{W} \mathbf{J}) \boldsymbol{\tau} = -\mathbf{J}^\top \mathbf{W} \mathbf{r},并加入一个小的距离项以避免纯旋转退化。

实验结果

在i9-12900K + RTX 4090上以约15 FPS运行(帧率降采样2倍以模拟实时);采用带尺度对齐的轨迹计算ATE RMSE(单位为米):

对SLAM的意义

MASt3R-SLAM是即插即用的:将其对准来自任意相机——甚至变焦或畸变会变化的相机——拍摄的视频,就能获得无需深度传感器、无需标定流程、无需逐场景训练的稠密全局一致几何。这重新定义了单目稠密SLAM应达到的基准,其架构(学习到的双视图先验+经典的Sim(3)图优化)已成为大多数基础模型SLAM系统目前遵循的模板。

动手实践

相关条目