Foundation models
*基础模型(foundation model)*是指在海量、多样化的数据上一次性预训练出的大型网络,之后可复用于许多下游任务——无论是作为冻结的特征提取器、轻量微调,还是通过提示(prompt)调用。这一术语进入SLAM词汇表,是因为一批这样的模型被证明可以直接用作感知骨干网络:CLIP(图文嵌入)、SAM(可提示分割)、DINOv2(自监督视觉特征)、Depth Anything(单目深度)以及DUSt3R系列(从原始图像对进行双视图3D重建)。
发生了什么变化
要理解这为何重要,最好与此前的常规做法做对比。经典的学习模块(SuperPoint、MonoDepth)是针对单一任务、在中等规模数据集上训练的,因而继承了这些数据集的偏差;将它们部署到新领域往往意味着要重新训练。基础模型改变了这一经济学规律:
- 零样本鲁棒性:在互联网规模数据上预训练的特征,能够抵御那些会破坏手工设计特征和小规模学习特征的外观变化(光照、季节、风格)。例如RoMa正是为了这种鲁棒性,才在冻结的DINOv2特征上构建稠密匹配。
- 可复用骨干网络:单一冻结编码器可以同时服务于场景识别、匹配、分割和深度估计等头部——当机器人的计算资源需要在多个任务间共享时,这一点很有吸引力。
- 开放词汇语义:CLIP风格的嵌入让地图能够回答语言查询(“找到灭火器”),而不需要固定的标签集——这正是ConceptFusion、ConceptGraphs以及语言驱动场景图的基础。
- 大规模几何先验:DUSt3R和MASt3R表明,即便是3D重建本身——传统上属于多视图几何的领域——也可以被吸收进一个预训练模型中,直接从图像对输出点图(pointmap),并以此为基础构建SLAM系统(MASt3R-SLAM)。
各家族及其提供的能力
| 家族 | 训练方式/数据 | SLAM从中获得什么 |
|---|---|---|
| CLIP / SigLIP | 图文对,对比学习 | 用于地图和场景描述的开放词汇语义 |
| SAM / SAM 2 | 大规模可提示分割 | 用于物体级和动态SLAM的类别无关实例掩码 |
| DINOv2 | 自监督ViT | 用于匹配、场景识别(VPR)和对应关系的鲁棒稠密特征 |
| Depth Anything(V1/V2)、Metric3D | 大规模深度(自)监督 | 在无深度传感器场景下的稠密单目深度先验 |
| DUSt3R / MASt3R / VGGT | 有位姿的图像对/图像集合 | 前馈式的点图、匹配关系和位姿——几何作为推理 |
了解这份”菜单”能告诉你,在设计系统时现在可以”免费”获得什么——以及每个模型可以替代哪些经典的第3/4层级模块。
SLAM系统实际如何使用它们
- 冻结特征+经典估计:提取基础模型特征,然后在其上运行经典的匹配/RANSAC/BA(RoMa基于DINOv2;开放词汇地图在每个surfel或高斯上融合CLIP特征)。几何部分保持精确;感知部分则变得鲁棒。
- 前馈几何+轻量SLAM层:DUSt3R系列模型直接输出点图;像MASt3R-SLAM这样的系统在网络周围加入关键帧管理、滤波和全局优化——该模型同时充当前端和大部分中端。
- 关键帧速率调度与蒸馏:由于在嵌入式硬件上每帧运行一次ViT-L是负担不起的,系统通常只在关键帧上运行基础模型,将其输出缓存到地图中,或将其蒸馏为用于逐帧路径的小型学生网络。
需要注意的权衡
- 计算开销:在嵌入式硬件上进行实时SLAM,可能无法承受每帧一次大型ViT推理;需从设计之初就规划关键帧速率使用或蒸馏方案。
- 粗粒度输出:特征通常以patch分辨率给出(例如图像的1/14),深度预测往往是相对/仿射的而非度量尺度的——在进行几何优化之前,通常需要一个以精度为导向的细化或尺度对齐阶段。
- 统计性失败模式:基础模型可能以某种自信但错误的方式给出结果,而这种错误本可以被重投影误差检查发现——例如反射表面上的幻觉深度,或语义上合理但几何上不一致的匹配。这是一个强有力的论据,说明应在流程中保留经典的几何验证,而不是盲目信任网络输出。
- 许可与可复现性:模型权重、训练数据和使用条款各不相同;基于冻结第三方骨干网络构建的系统会继承其更新节奏和偏差。
实践方案
在第5层级及以后逐渐浮现的模式是:将基础模型特征用于流程中对鲁棒性要求高、语义性强,或病态(ill-posed)的部分(场景识别、宽基线匹配、单目深度、开放词汇标签),而将经典估计保留给对精度要求高的部分(位姿优化、建图一致性)。最新的系统——MASt3R-SLAM、ConceptGraphs风格的语义建图——正是如此:在大型预训练模型之上叠加轻量的几何层。
对SLAM的意义
基础模型正在重塑SLAM前端的定义:现代系统越来越倾向于组合冻结的预训练骨干网络,而不是训练特定任务的网络——最新的SLAM系统(MASt3R-SLAM、ConceptGraphs风格的语义建图)正是在这类模型之上叠加轻量几何层。了解每个家族提供的能力(CLIP:语义,SAM:掩码,DINOv2:鲁棒特征,Depth Anything:深度,DUSt3R:几何),能告诉你在设计系统时现在可以”免费”获得什么。