ConceptFusion

Jatavallabhula (MIT) 2023 · 论文

一句话总结 — 将像素对齐的基础模型特征(CLIP、AudioCLIP)以深度和颜色所用的相同加权平均方式融合进稠密SLAM点云地图,无需任何训练或微调即可实现对3D地图的零样本开放词汇及多模态(文本/图像/点击/音频)查询。

问题

大多数为3D地图附加语义信息的方法都是闭集的:它们只能在训练时固定的有限标签集合上进行推理,地图查询最多也只能用类别标签或文本。基础模型能够跨模态理解开放集概念,但它们消费的是整张图像,只输出单一图像级向量——没有像素级对齐;而为像素对齐微调过的模型(LSeg、OpenSeg)在微调过程中会遗忘长尾概念:其骨干CLIP本来认识”diet coke(无糖可乐)“和”lysol(消毒剂品牌)“,但微调后的版本却无法再检索到它们。ConceptFusion探讨的是如何以零样本的方式,将像素对齐、且不遗忘的开放集特征放入3D地图中。

方法与架构

wi=exp((ϕi+φˉi)/τ)i=1Rexp((ϕi+φˉi)/τ),fiP=wifG+(1wi)fiLw_i=\frac{\exp\big((\phi_i+\bar{\varphi}_i)/\tau\big)}{\sum_{i=1}^{R}\exp\big((\phi_i+\bar{\varphi}_i)/\tau\big)}, \qquad f^{P}_i = w_i f^{G} + (1-w_i) f^{L}_i

其中 τ=1\tau=1fiPf^{P}_i 被归一化并赋给区域 rir_i 的所有像素。不做微调意味着不会遗忘——未经修改的CLIP特征空间被完整保留。

fk,tPcˉkfk,t1P+αfu,v,tPcˉk+α,cˉkcˉk+αf^{P}_{k,t} \leftarrow \frac{\bar{c}_k f^{P}_{k,t-1} + \alpha f^{P}_{u,v,t}}{\bar{c}_k + \alpha}, \qquad \bar{c}_k \leftarrow \bar{c}_k + \alpha

其中 α=eγ2/2σ2\alpha=e^{-\gamma^{2}/2\sigma^{2}} 根据相机中心的归一化径向距离 γ\gamma 加权(σ=0.6\sigma=0.6)。

实验结果

对SLAM的意义

ConceptFusion开创了开放集多模态3D建图,建立了如今已成为标准的范式:2D基础模型特征+经典多视角融合,完全无需3D训练。它是经典SLAM与空间人工智能(Spatial AI)之间的关键桥梁——用来对机器人进行定位的地图,同样能够回答”哪里有能用来打开这个瓶子的东西?“这样的问题。它的内存开销(每个点存一个完整嵌入)恰恰是后续系统所要解决的问题:LERF/LEGS采用隐式特征场,OpenGS-SLAM采用离散标签,ConceptGraphs采用物体级节点。

动手实践

相关条目