SpatialLM
Mao 2025 · 论文
一句话总结 — 对一个现成的大语言模型进行微调,使其能够接收 3D 点云并输出结构化的室内模型——墙体、门、窗以及带方向的物体框——形式为 Python 数据类脚本,从而将大语言模型的推理能力锚定在 3D 空间结构上。
问题
结构化室内建模——从原始 RGBD 扫描中恢复建筑布局(墙体、门、窗)以及 3D 物体边界框——一直是任务专用网络(RoomFormer 的多边形查询、V-DETR 的检测头)或带有领域专用词元的定制自回归解码器(SceneScript)的领地。与此同时,大语言模型擅长推理和代码生成,却完全没有对 3D 空间的建模能力。此前阻碍直接对大语言模型进行微调来完成该任务的有两个障碍:没有大规模、高质量的将点云与结构化 3D 标注配对的数据集,也没有关于如何将点云输入与大语言模型对齐的实证经验。SpatialLM(技术报告:arXiv 2506.07491,NeurIPS 2025)同时解决了这两个问题。
方法与架构
- 标准的”编码器–MLP–大语言模型”流水线——没有专门的解码器。一个点云编码器将场景压缩为一段简短的视觉词元序列供大语言模型使用:
其中每个点携带 XYZ + RGB。所选用的编码器是 Sonata(一种仅编码、自监督的 Point Transformer V3 变体),配合两层 MLP 投影器,基座大语言模型为 Qwen2.5-0.5B(总计 6.035 亿参数;发布的模型权重也包含一个 Llama-1B 变体)。
- 以 Python 代码形式描述场景。 输出是纯文本:针对墙体/门/窗的数据类风格脚本(例如
class Wall: a_x, a_y, a_z, b_x, b_y, b_z, height),以及覆盖 59 个物体类别的带方向边界框。代码是人类可编辑的,可扩展到新的类别,并利用了大语言模型自带的编程能力;与 SceneScript 的领域专用词元不同,这里不需要任何自定义词表。 - SpatialLM 数据集。 12,328 个合成场景(54,778 个房间),从专业设计的室内方案中解析而来,沿模拟相机轨迹逐帧(每 0.5 米一帧)以照片级真实感渲染;划分为 11,328/500/500 的训练/验证/测试集。这一规模远超真实标注数据集(SceneCAD:仅 1,151 个带布局标签的房间)。
- 实证对齐研究。 对逐点 DINOv2 特征做朴素的词元压缩(体素化或最远点采样)会导致物体 F1 崩溃到接近零——丢失了太多空间信息;而学习式编码器(稀疏 3DCNN、Sonata)则可行,其中 Sonata 表现最好(在 [email protected] 下布局 F1 为 84.6,而 3DCNN 为 79.4)。将编码器的空间分辨率翻倍( 词元)有帮助(在 [email protected] 下物体 F1 从 49.4 提升到 61.1);翻四倍则反而有害。将编码器、MLP 和大语言模型全部设为可训练的单阶段训练,胜过所有两阶段和三阶段的冻结方案。
- 评估指标:在 IoU 阈值 0.25/0.5 下的匈牙利匹配 F1——布局用投影平面片段的 2D IoU,物体框用 3D IoU(采用 F1 而非 mAP,因为自回归模型不会输出置信度分数)。
实验结果
- 布局估计(Structured3D):SpatialLM 先在自建数据集上预训练,再在 Structured3D 上微调,达到 F1 94.3 / 93.5([email protected]/0.5),超过专用模型 RoomFormer(83.4/81.4)和 SceneScript(90.4/89.2)。仅在 Structured3D 上训练只能得到 32.6/18.1——正是大规模预训练数据集使得大语言模型微调可行。
- 3D 物体检测(ScanNet,18 个类别,F1):预训练加 ScanNet 微调得分为 65.6 / 52.6,对比 SceneScript 的 49.1/36.8 和专用模型 V-DETR 的 65.1/56.8——在 [email protected] 时领先,在 0.5 时落后,大部分漏检发生在最小的物体上(图片、水槽)。仅用 ScanNet 训练则完全崩溃(2.9/0.7)。
- 在视频重建上的零样本表现:在用 MASt3R-SLAM 重建的 107 段室内导览视频上——这些点云带有噪声、遮挡和大量伪影——SpatialLM 在无需微调的情况下生成了一致的布局和完整的物体框,并能基于上下文补全未观测区域(床铺延伸到地面,合理的阳台/餐厅布局)。
对SLAM的意义
SpatialLM 展示了语义建图正在走向何处:从带标签标注的点云(OpenScene、ConceptFusion)和场景图(ConceptGraphs),走向大语言模型可以直接解析和操纵的表示形式。SLAM 系统提供点云——论文自身的演示流水线就是在单目视频上运行 MASt3R-SLAM——而 SpatialLM 将其转化为一个紧凑、可编辑、机器可读的空间描述,可用于场景编辑、增强现实、机器人导航、数字孪生以及具身智能。