LERF

Kerr 2023 · 论文

一句话总结 —— 语言嵌入辐射场(Language Embedded Radiance Fields)通过体渲染将CLIP特征嵌入NeRF内部,从而支持从开放式自然语言提示出发进行像素对齐、零样本的3D查询。

问题

人类通过语言指代3D位置,涉及”极其广泛的属性范围:视觉外观、语义、抽象关联或可操作的功能属性(affordance)“——例如”黄色的马克杯”、“用来写字的东西”。CLIP可以针对图像为这类提示打分,但它”本质上是一种全局图像嵌入,不利于像素级对齐的特征提取”:每个裁剪图只有一个嵌入向量,没有3D结构。此前的开放词汇3D工作依赖区域提议、掩码或经过微调的检测器(LSeg、OWL-ViT),这将查询限制在这些检测器训练所覆盖的类别内。LERF探索的问题是:如何将原始的CLIP嵌入以体渲染的方式嵌入NeRF,从而使任意语言都能解析为3D位置。

方法与架构

ϕ^lang=tw(t)Flang(r(t),s(t))dt,ϕlang=ϕ^lang/ϕ^lang.\hat{\phi}_{\mathrm{lang}} = \int_t w(t)\, F_{\mathrm{lang}}\big(r(t), s(t)\big)\, dt, \qquad \phi_{\mathrm{lang}} = \hat{\phi}_{\mathrm{lang}} \big/ \lVert \hat{\phi}_{\mathrm{lang}} \rVert .

Llang=λlangϕlangϕlanggt,λlang=0.01.L_{\mathrm{lang}} = -\lambda_{\mathrm{lang}}\, \phi_{\mathrm{lang}} \cdot \phi_{\mathrm{lang}}^{\mathrm{gt}}, \qquad \lambda_{\mathrm{lang}} = 0.01 .

mini  exp(ϕlangϕquer)exp(ϕlangϕcanoni)+exp(ϕlangϕquer),\min_i \; \frac{\exp(\phi_{\mathrm{lang}} \cdot \phi_{\mathrm{quer}})}{\exp(\phi_{\mathrm{lang}} \cdot \phi_{\mathrm{canon}}^{i}) + \exp(\phi_{\mathrm{lang}} \cdot \phi_{\mathrm{quer}})},

尺度 ss 通过在0-2米范围内以30个增量扫描并保留得分最高者来自动选择。被少于5个训练视角看到的样本会被丢弃。

实验结果

对SLAM的意义

LERF确立了将视觉-语言特征直接嵌入3D场景表示的范式——这是Spatial AI的语义层:一种可以”对话”的地图。它直接启发了语言嵌入的高斯散射(LEGS、LangSplat),并与ConceptFusion这类融合式方法互为补充;其多尺度CLIP+DINO的方案已成为将2D视觉-语言特征蒸馏进3D场的默认做法。对机器人而言,能将”找一个可以写字的东西”解析为一个3D位置,正是让SLAM地图变为可操作世界模型的关键。

相关条目