Spatial AI
Spatial AI(空间智能) 是由 Andrew Davison 的 FutureMapping 系列论文推广开的一个术语,指的是 SLAM 式的几何理解与语义场景理解、学习式世界表示三者的融合。其愿景是:机器人或设备不应仅仅估计一条轨迹和一个点云,而应维护一个持久的、通用的空间表示——几何、物体、语义与动态信息融为一体——供任何下游任务(导航、操作、AR、人机交互)查询。
重新界定 SLAM 的目标
经典 SLAM 回答的问题是”我在哪里,表面在哪里?“而 Spatial AI 提出的是随之而来的下一批问题:
- 地图中的东西是什么(物体、房间、可操作性/affordance),而不仅仅是表面点的位置?
- 表示形式应如何存储,才能在数小时甚至数天内保持有用——紧凑、可更新,并能在不同任务间共享?
- 实时空间感知需要什么样的计算与硬件(Davison 的 FutureMapping 2 探讨了图处理器和非冯诺依曼硬件在这方面的应用)?
- 应该学到什么程度? 学习式组件(深度先验、语义特征、生成模型)正越来越多地替代或增强手工构建的几何。
从三个方向汇聚
可以看到该领域正从几个方向朝这一愿景汇聚,其中每一个方向都对应本路线图的一部分:
- 语义与物体级 SLAM(SemanticFusion、Kimera 与三维动态场景图、Hydra)用标签、物体和层次化结构(房间、场所、智能体)丰富地图——把一个表面模型变成一个可查询的场景模型。
- 开放词汇感知使地图变得可用语言查询:LERF 将 CLIP 特征嵌入辐射场,使任意文本查询都能检索出一个三维相关性地图;ConceptFusion 和 OpenFusion 在线维护稠密的 CLIP 特征地图(可以视为 LERF 在 SLAM 中的对应物);OpenMask3D 一类方法将开放词汇特征附加到三维分割块上。这里的模式是一致的——SLAM 提供三维几何;VLM 提供语义;两者结合,产生开放词汇的三维场景理解。
- 世界模型与 VLM/VLA 从学习的角度逼近同一个目标:在互联网规模上获取的隐式空间知识,几乎没有或完全没有显式几何——而在 VLA 的情形下,还直接把感知与动作耦合了起来。
汇聚的技术栈
一种便于整体把握的方式是把它看作一个技术栈:
Spatial AI 的主张是:这些层应该围绕一个共享的空间表示被协同设计,而不是被简单拼接在一起。目前存在两种相互竞争的设计模式:
- 模块化:每一层保留自己的专长——SLAM 提供具有度量精度和回环可纠正性的几何骨架;VLM 负责解释;VLA(或经典规划器)在此基础上执行动作。
- 端到端:单一学习系统(WorldVLA 式,以及某些 RT-2 配置)完全跳过显式几何。
哪种答案更优,很可能取决于任务:已知空间中的精密操作和长时程导航偏向显式 SLAM;开放世界的指令跟随则可能更偏向端到端方法。目前大多数 VLA 完全没有度量记忆——而这恰恰正是 SLAM 仍然大有用处的地方。
SLAM 与基础模型交界处的开放问题
以下问题目前构成了该领域研究前沿的主要内容:
- 语言查询式 SLAM 地图 —— 将 CLIP/SigLIP 特征融入实时 SLAM(ConceptFusion、OpenFusion、LERF),以实现语义场景查询。
- 以 SLAM 为基础的 VLA —— 利用 SLAM 维护的度量地图作为 VLA 的结构化记忆,实现具有度量精度的长时程导航。
- 生成式地图补全 —— 利用生成先验,在未观测的地图区域中”幻想”出合理的几何结构。
- 世界模型式回环检测 —— 利用学习式视频预测来检测预测场景与观测场景何时出现分歧,作为几何回环检测的一种学习式替代方案。
- 基础模型地图先验 —— 利用三维世界生成模型为新环境提供 SLAM 初始化。
对SLAM的意义
Spatial AI 是现代路线图背后的”为什么”:它解释了这一领域为何从稀疏点地图转向稠密、语义化、层次化以及学习式表示。对于任何计划在 SLAM 领域从事研究或工程工作的人来说,这正是把本路线图中的几何层级与基础模型层级连接起来的框架——SLAM 与更广泛 AI 之间的边界正在消融,而最具价值的从业者将同时精通几何基础和学习式表示。