ConceptGraphs

Gu 2023 · 论文

一句话总结 — ConceptGraphs通过将2D基础模型的输出(SAM分割结果、CLIP嵌入)融合为3D物体节点,构建开放词汇的3D场景图,并利用LLM推断物体间的关系,从而生成可用自然语言查询、供规划使用的地图。

问题

机器人需要一种既语义丰富又紧凑高效的3D世界表示,以支持面向任务的感知与规划。近期将视觉-语言特征注入3D地图的尝试都是逐点生成特征向量,这种做法”在更大环境中扩展性不佳,也不包含实体间的语义空间关系”——而传统的封闭集场景图又被限定在预定义的标签集合内。ConceptGraphs的目标是一种开放词汇的表示方式,它以物体为中心、具有图结构,且不需要采集3D训练数据或微调任何模型即可构建。

方法与架构

给定带位姿的RGB-D帧 It=Itrgb,Itdepth,θtI_t = \langle I_t^{\text{rgb}}, I_t^{\text{depth}}, \theta_t \rangle,ConceptGraphs逐步构建一个场景图 Mt=Ot,Et\mathcal{M}_t = \langle \mathbf{O}_t, \mathbf{E}_t \rangle,其中每个节点 oj\mathbf{o}_j 都携带一个3D点云 poj\mathbf{p}_{o_j} 和一个融合后的语义特征 foj\mathbf{f}_{o_j}:

实验结果

对SLAM的意义

ConceptGraphs表明,2D基础模型可以通过普通的多视角关联被提升到3D——无需任何新的3D网络——将SLAM系统带位姿的RGB-D流转变为可用语言查询的物体地图。它确立了如今标准的SAM + CLIP + LLM配方,用于开放词汇的机器人地图构建,并与逐点方法(ConceptFusion、LERF、OpenScene)一起,划定了开放词汇3D地图的设计空间:稠密特征与以物体为中心的图之争。随着SLAM的输出越来越多地供语言驱动的规划器使用,像这样以图结构表示的开放集地图,定义了现代空间AI中”语义地图”的含义。

相关条目