Spatial AI

Spatial AI(空间智能) 是由 Andrew Davison 的 FutureMapping 系列论文推广开的一个术语,指的是 SLAM 式的几何理解与语义场景理解、学习式世界表示三者的融合。其愿景是:机器人或设备不应仅仅估计一条轨迹和一个点云,而应维护一个持久的、通用的空间表示——几何、物体、语义与动态信息融为一体——供任何下游任务(导航、操作、AR、人机交互)查询。

重新界定 SLAM 的目标

经典 SLAM 回答的问题是”我在哪里,表面在哪里?“而 Spatial AI 提出的是随之而来的下一批问题:

从三个方向汇聚

可以看到该领域正从几个方向朝这一愿景汇聚,其中每一个方向都对应本路线图的一部分:

汇聚的技术栈

一种便于整体把握的方式是把它看作一个技术栈:

感知SLAM地图 + 位姿VLM / 场景图场景理解VLA / 规划动作\text{感知} \xrightarrow{\text{SLAM}} \text{地图 + 位姿} \xrightarrow{\text{VLM / 场景图}} \text{场景理解} \xrightarrow{\text{VLA / 规划}} \text{动作}

Spatial AI 的主张是:这些层应该围绕一个共享的空间表示被协同设计,而不是被简单拼接在一起。目前存在两种相互竞争的设计模式:

哪种答案更优,很可能取决于任务:已知空间中的精密操作和长时程导航偏向显式 SLAM;开放世界的指令跟随则可能更偏向端到端方法。目前大多数 VLA 完全没有度量记忆——而这恰恰正是 SLAM 仍然大有用处的地方。

SLAM 与基础模型交界处的开放问题

以下问题目前构成了该领域研究前沿的主要内容:

  1. 语言查询式 SLAM 地图 —— 将 CLIP/SigLIP 特征融入实时 SLAM(ConceptFusion、OpenFusion、LERF),以实现语义场景查询。
  2. 以 SLAM 为基础的 VLA —— 利用 SLAM 维护的度量地图作为 VLA 的结构化记忆,实现具有度量精度的长时程导航。
  3. 生成式地图补全 —— 利用生成先验,在未观测的地图区域中”幻想”出合理的几何结构。
  4. 世界模型式回环检测 —— 利用学习式视频预测来检测预测场景与观测场景何时出现分歧,作为几何回环检测的一种学习式替代方案。
  5. 基础模型地图先验 —— 利用三维世界生成模型为新环境提供 SLAM 初始化。

对SLAM的意义

Spatial AI 是现代路线图背后的”为什么”:它解释了这一领域为何从稀疏点地图转向稠密、语义化、层次化以及学习式表示。对于任何计划在 SLAM 领域从事研究或工程工作的人来说,这正是把本路线图中的几何层级与基础模型层级连接起来的框架——SLAM 与更广泛 AI 之间的边界正在消融,而最具价值的从业者将同时精通几何基础和学习式表示。

相关条目