SpatialLM

Mao 2025 · 论文

一句话总结 — 对一个现成的大语言模型进行微调,使其能够接收 3D 点云并输出结构化的室内模型——墙体、门、窗以及带方向的物体框——形式为 Python 数据类脚本,从而将大语言模型的推理能力锚定在 3D 空间结构上。

问题

结构化室内建模——从原始 RGBD 扫描中恢复建筑布局(墙体、门、窗)以及 3D 物体边界框——一直是任务专用网络(RoomFormer 的多边形查询、V-DETR 的检测头)或带有领域专用词元的定制自回归解码器(SceneScript)的领地。与此同时,大语言模型擅长推理和代码生成,却完全没有对 3D 空间的建模能力。此前阻碍直接对大语言模型进行微调来完成该任务的有两个障碍:没有大规模、高质量的将点云与结构化 3D 标注配对的数据集,也没有关于如何将点云输入与大语言模型对齐的实证经验。SpatialLM(技术报告:arXiv 2506.07491,NeurIPS 2025)同时解决了这两个问题。

方法与架构

F=E(P),PRN×6,  FRK×D,  KN,\mathbf{F} = \mathcal{E}(\mathbf{P}), \qquad \mathbf{P} \in \mathbb{R}^{N \times 6},\; \mathbf{F} \in \mathbb{R}^{K \times D},\; K \ll N,

其中每个点携带 XYZ + RGB。所选用的编码器是 Sonata(一种仅编码、自监督的 Point Transformer V3 变体),配合两层 MLP 投影器,基座大语言模型为 Qwen2.5-0.5B(总计 6.035 亿参数;发布的模型权重也包含一个 Llama-1B 变体)。

实验结果

对SLAM的意义

SpatialLM 展示了语义建图正在走向何处:从带标签标注的点云(OpenScene、ConceptFusion)和场景图(ConceptGraphs),走向大语言模型可以直接解析和操纵的表示形式。SLAM 系统提供点云——论文自身的演示流水线就是在单目视频上运行 MASt3R-SLAM——而 SpatialLM 将其转化为一个紧凑、可编辑、机器可读的空间描述,可用于场景编辑、增强现实、机器人导航、数字孪生以及具身智能。

相关条目