LERF

Kerr 2023 · 논문

한 줄 요약 — Language Embedded Radiance Fields는 볼륨 렌더링을 통해 CLIP 특징을 NeRF 안에 그라운딩하여, 개방형 자연어 프롬프트로부터 픽셀 정렬된 제로샷 3D 질의를 가능하게 합니다.

문제

인간은 “시각적 외관, 의미론, 추상적 연관, 또는 실행 가능한 어포던스 등 광범위한 속성”을 포괄하는 언어로 3D 위치를 지칭합니다 — “그 노란 머그컵”, “글씨를 쓸 무언가”. CLIP은 그런 프롬프트를 이미지에 대해 점수화할 수 있지만, CLIP은 “본질적으로 전역 이미지 임베딩이며 픽셀 정렬 특징 추출에 적합하지 않습니다”: 크롭당 하나의 임베딩, 3D 구조는 없습니다. 이전의 개방형 어휘 3D 연구는 영역 제안, 마스크, 또는 미세 조정된 검출기(LSeg, OWL-ViT)에 의존하여, 질의를 그 검출기들이 학습된 카테고리로 제한했습니다. LERF는 가공하지 않은(raw) CLIP 임베딩을 NeRF 안에서 체적적으로 그라운딩하여 임의의 언어가 3D 위치로 귀결되도록 하는 방법을 묻습니다.

방법 및 아키텍처

ϕ^lang=tw(t)Flang(r(t),s(t))dt,ϕlang=ϕ^lang/ϕ^lang.\hat{\phi}_{\mathrm{lang}} = \int_t w(t)\, F_{\mathrm{lang}}\big(r(t), s(t)\big)\, dt, \qquad \phi_{\mathrm{lang}} = \hat{\phi}_{\mathrm{lang}} \big/ \lVert \hat{\phi}_{\mathrm{lang}} \rVert .

Llang=λlangϕlangϕlanggt,λlang=0.01.L_{\mathrm{lang}} = -\lambda_{\mathrm{lang}}\, \phi_{\mathrm{lang}} \cdot \phi_{\mathrm{lang}}^{\mathrm{gt}}, \qquad \lambda_{\mathrm{lang}} = 0.01 .

mini  exp(ϕlangϕquer)exp(ϕlangϕcanoni)+exp(ϕlangϕquer),\min_i \; \frac{\exp(\phi_{\mathrm{lang}} \cdot \phi_{\mathrm{quer}})}{\exp(\phi_{\mathrm{lang}} \cdot \phi_{\mathrm{canon}}^{i}) + \exp(\phi_{\mathrm{lang}} \cdot \phi_{\mathrm{quer}})},

스케일 ss는 0~2 m를 30단계로 스윕하여 가장 높은 점수를 낸 값으로 자동 선택됩니다. 5개 미만의 학습 뷰에서 관측된 샘플은 버려집니다.

실험 결과

SLAM에서의 의미

LERF는 비전-언어 특징을 3D 장면 표현 안에 직접 임베딩하는 패러다임을 확립했습니다 — Spatial AI의 의미론적 층: 말을 걸 수 있는 지도입니다. 이는 언어 임베딩 가우시안 스플래팅(LEGS, LangSplat)에 직접 영향을 미쳤고 ConceptFusion 같은 융합 방식 접근법을 보완합니다; 다중 스케일 CLIP + DINO 방식은 2D 비전-언어 특징을 3D 필드로 증류하는 기본값이 되었습니다. 로보틱스에서 “글씨를 쓸 무언가를 찾아라”가 3D 위치로 귀결되는 것은 SLAM 지도를 실행 가능한 세계 모델로 바꾸는 바로 그것입니다.

관련 문서