LERF

Kerr 2023 · 論文

一行要約 — Language Embedded Radiance Fieldsは、ボリュームレンダリングを通じてCLIP特徴をNeRF内部に根ざし、自由形式の自然言語プロンプトからピクセル整合されたゼロショット3Dクエリを可能にする。

問題

人間は「視覚的な見え方、意味、抽象的な連想、実行可能な操作可能性という広範な性質」を包含する言語を通じて3D位置を指す — 「黄色いマグカップ」「書くための何か」のように。CLIPはそうしたプロンプトを画像に対して採点できるが、それは「本質的にグローバルな画像埋め込みであり、ピクセル整合された特徴抽出には向いていない」: クロップごとに1つの埋め込みしかなく、3D構造がない。従来のオープン語彙3D研究は領域提案、マスク、あるいはファインチューニングされた検出器(LSeg、OWL-ViT)に依存しており、クエリはそれらの検出器が学習されたカテゴリに限定されていた。LERFは、任意の言語が3D位置へと解決されるように、生のCLIP埋め込みをNeRF内でボリューム的に根ざす方法を問う。

手法とアーキテクチャ

ϕ^lang=tw(t)Flang(r(t),s(t))dt,ϕlang=ϕ^lang/ϕ^lang.\hat{\phi}_{\mathrm{lang}} = \int_t w(t)\, F_{\mathrm{lang}}\big(r(t), s(t)\big)\, dt, \qquad \phi_{\mathrm{lang}} = \hat{\phi}_{\mathrm{lang}} \big/ \lVert \hat{\phi}_{\mathrm{lang}} \rVert .

Llang=λlangϕlangϕlanggt,λlang=0.01.L_{\mathrm{lang}} = -\lambda_{\mathrm{lang}}\, \phi_{\mathrm{lang}} \cdot \phi_{\mathrm{lang}}^{\mathrm{gt}}, \qquad \lambda_{\mathrm{lang}} = 0.01 .

mini  exp(ϕlangϕquer)exp(ϕlangϕcanoni)+exp(ϕlangϕquer),\min_i \; \frac{\exp(\phi_{\mathrm{lang}} \cdot \phi_{\mathrm{quer}})}{\exp(\phi_{\mathrm{lang}} \cdot \phi_{\mathrm{canon}}^{i}) + \exp(\phi_{\mathrm{lang}} \cdot \phi_{\mathrm{quer}})},

スケール ss は0~2 mを30段階で走査し、最も高いスコアのものを選ぶことで自動選択される。学習視点5個未満しか見ていないサンプルは棄却される。

実験結果

SLAMにおける意義

LERFは、視覚言語特徴を3Dシーン表現に直接埋め込むというパラダイム — Spatial AIの意味層、つまり話しかけられるマップ — を確立した。これは言語埋め込みガウシアンスプラッティング(LEGS、LangSplat)を直接的に触発し、ConceptFusionのような融合型アプローチを補完する。そのマルチスケールCLIP+DINOのレシピは、2Dの視覚言語特徴を3Dフィールドに蒸留するためのデフォルトの手法となった。ロボティクスにとって、「書くための何か」が3D位置へと解決されることは、SLAMマップを実行可能な世界モデルへと変えるものそのものである。

関連ノート