Foundation models

*基础模型(foundation model)*是指在海量、多样化的数据上一次性预训练出的大型网络,之后可复用于许多下游任务——无论是作为冻结的特征提取器、轻量微调,还是通过提示(prompt)调用。这一术语进入SLAM词汇表,是因为一批这样的模型被证明可以直接用作感知骨干网络:CLIP(图文嵌入)、SAM(可提示分割)、DINOv2(自监督视觉特征)、Depth Anything(单目深度)以及DUSt3R系列(从原始图像对进行双视图3D重建)。

发生了什么变化

要理解这为何重要,最好与此前的常规做法做对比。经典的学习模块(SuperPoint、MonoDepth)是针对单一任务、在中等规模数据集上训练的,因而继承了这些数据集的偏差;将它们部署到新领域往往意味着要重新训练。基础模型改变了这一经济学规律:

各家族及其提供的能力

家族训练方式/数据SLAM从中获得什么
CLIP / SigLIP图文对,对比学习用于地图和场景描述的开放词汇语义
SAM / SAM 2大规模可提示分割用于物体级和动态SLAM的类别无关实例掩码
DINOv2自监督ViT用于匹配、场景识别(VPR)和对应关系的鲁棒稠密特征
Depth Anything(V1/V2)、Metric3D大规模深度(自)监督在无深度传感器场景下的稠密单目深度先验
DUSt3R / MASt3R / VGGT有位姿的图像对/图像集合前馈式的点图、匹配关系和位姿——几何作为推理

了解这份”菜单”能告诉你,在设计系统时现在可以”免费”获得什么——以及每个模型可以替代哪些经典的第3/4层级模块。

SLAM系统实际如何使用它们

需要注意的权衡

实践方案

在第5层级及以后逐渐浮现的模式是:将基础模型特征用于流程中对鲁棒性要求高、语义性强,或病态(ill-posed)的部分(场景识别、宽基线匹配、单目深度、开放词汇标签),而将经典估计保留给对精度要求高的部分(位姿优化、建图一致性)。最新的系统——MASt3R-SLAM、ConceptGraphs风格的语义建图——正是如此:在大型预训练模型之上叠加轻量的几何层。

对SLAM的意义

基础模型正在重塑SLAM前端的定义:现代系统越来越倾向于组合冻结的预训练骨干网络,而不是训练特定任务的网络——最新的SLAM系统(MASt3R-SLAM、ConceptGraphs风格的语义建图)正是在这类模型之上叠加轻量几何层。了解每个家族提供的能力(CLIP:语义,SAM:掩码,DINOv2:鲁棒特征,Depth Anything:深度,DUSt3R:几何),能告诉你在设计系统时现在可以”免费”获得什么。

相关条目