OpenScene

Peng (ETH) 2023 · 论文

一句话总结 — 通过将2D视觉-语言特征反投影并蒸馏到一个3D网络中,为3D点云预测稠密的逐点CLIP空间特征,从而实现零样本、任务无关的开放词汇3D场景理解,且完全不需要任何有标注的3D数据。

问题

传统的3D场景理解依赖有标注的3D数据集,为每个任务训练一个带监督的模型:每个任务都需要昂贵的3D标注,且每个模型都被限定在一个预先定义的类别列表上。与此同时,基于互联网规模数据训练的2D视觉-语言模型已经将图像和文本嵌入到同一个共享空间中。OpenScene提出的问题是:能否将3D点也嵌入到同一个CLIP特征空间中,使一个单一的无监督表示能够在查询时服务于任意查询——物体、材质、可供性(affordance)、活动、房间类型?

方法与架构

给定一个点云 PRM×3\mathbf{P} \in \mathbb{R}^{M \times 3}以及带位姿的RGB图像,通过三个阶段产生逐点CLIP空间特征:

  1. 图像特征融合(2D → 3D)。 一个冻结的2D视觉-语言分割模型 E2D\mathcal{E}^{\text{2D}}(OpenSeg或LSeg)给出逐像素嵌入 IiRH×W×C\mathbf{I}_i \in \mathbb{R}^{H \times W \times C}。每个表面点 p\mathbf{p}通过针孔模型 u~=IiEip~\tilde{\mathbf{u}} = I_i \cdot E_i \cdot \tilde{\mathbf{p}}投影到第 ii帧(并进行基于深度的遮挡检验),其 KK个可见视角的特征被平均池化为一个融合特征 f2D=ϕ(f1,,fK)\mathbf{f}^{\text{2D}} = \phi(\mathbf{f}_1, \cdots, \mathbf{f}_K),得到特征云 F2DRM×C\mathbf{F}^{\text{2D}} \in \mathbb{R}^{M \times C}
  2. 3D蒸馏。 一个稀疏卷积网络MinkowskiNet18A E3D\mathcal{E}^{\text{3D}}学习仅从几何结构预测这些特征:

F3D=E3D(P),E3D:RM×3RM×C,\mathbf{F}^{\text{3D}} = \mathcal{E}^{\text{3D}}(\mathbf{P}), \qquad \mathcal{E}^{\text{3D}} : \mathbb{R}^{M \times 3} \mapsto \mathbb{R}^{M \times C},

使用余弦蒸馏损失训练:

L=1cos(F2D,F3D),\mathcal{L} = 1 - \cos\big(\mathbf{F}^{\text{2D}}, \mathbf{F}^{\text{3D}}\big),

因此新的点云可以完全不借助任何图像就被嵌入。 3. 2D-3D集成。 融合的2D特征在小型或几何上有歧义的物体(一个杯子、一幅画)上表现出色;蒸馏出的3D特征则在形状鲜明的结构(墙壁、地板)上取胜。对每个点,两者都会与查询集的CLIP文本嵌入 tn\mathbf{t}_n进行打分,sn2D=cos(f2D,tn)\mathbf{s}^{\text{2D}}_n = \cos(\mathbf{f}^{\text{2D}}, \mathbf{t}_n)sn3D=cos(f3D,tn)\mathbf{s}^{\text{3D}}_n = \cos(\mathbf{f}^{\text{3D}}, \mathbf{t}_n),其中 maxn\max_n得分更高的一方特征成为 f2D3D\mathbf{f}^{\text{2D3D}}

推理纯粹依赖余弦相似度:零样本分割通过 argmaxncos(f2D3D,tn)\arg\max_n \cos(\mathbf{f}^{\text{2D3D}}, \mathbf{t}_n)为每个点打标签;任意开放词汇文本以同样方式产生相关性热力图。训练过程中不使用任何2D或3D真实标签。

实验结果

对SLAM的意义

OpenScene证明了互联网规模的2D视觉-语言知识可以迁移到3D地图上——这是语言驱动的空间智能的一个核心构建模块。对SLAM而言,这意味着地图可以用自由形式的语言查询,而不必局限于固定的标签集:先融合再蒸馏的思路(先将像素特征投影到几何上,再训练一个3D网络来预测它们)被ConceptFusion、ConceptGraphs和LERF所采纳,并且越来越成为机器人建图系统的一项预期能力。

相关条目