ConceptFusion

Jatavallabhula (MIT) 2023 · 논문

한 줄 요약 — 파운데이션 모델(CLIP, AudioCLIP)의 픽셀 정렬(pixel-aligned) 특징을, 깊이와 색상에 사용되는 것과 동일한 가중 평균 방식으로 밀집 SLAM 포인트 지도에 융합하여, 어떤 학습이나 미세 조정도 없이 3D 지도에 대한 제로샷 오픈 어휘 및 다중 모달(텍스트/이미지/클릭/오디오) 쿼리를 가능하게 한다.

문제

3D 지도에 의미론을 부여하는 대부분의 접근법은 닫힌 집합(closed-set) 방식이다: 학습 시점에 고정된 유한한 레이블 집합에 대해서만 추론하며, 지도는 클래스 레이블 또는 최선의 경우 텍스트로만 쿼리할 수 있다. 파운데이션 모델은 여러 모달리티에 걸쳐 오픈셋 개념을 이해하지만, 이미지 전체를 입력받아 픽셀 정렬 없이 단일 이미지 수준 벡터를 출력한다 — 반면 픽셀 정렬을 위해 미세 조정된 모델(LSeg, OpenSeg)은 미세 조정 과정에서 롱테일 개념을 잊어버린다: 백본 CLIP은 “다이어트 콜라”와 “라이솔”을 알지만, 미세 조정된 버전은 더 이상 이를 검색해내지 못한다. ConceptFusion은 픽셀 정렬되면서도 잊어버리지 않는 오픈셋 특징을 3D 지도에, 제로샷으로 어떻게 넣을 것인가를 묻는다.

방법 및 아키텍처

wi=exp((ϕi+φˉi)/τ)i=1Rexp((ϕi+φˉi)/τ),fiP=wifG+(1wi)fiLw_i=\frac{\exp\big((\phi_i+\bar{\varphi}_i)/\tau\big)}{\sum_{i=1}^{R}\exp\big((\phi_i+\bar{\varphi}_i)/\tau\big)}, \qquad f^{P}_i = w_i f^{G} + (1-w_i) f^{L}_i

여기서 τ=1\tau=1이다; fiPf^{P}_i는 정규화되어 rir_i의 픽셀들에 할당된다. 미세 조정이 없으므로 잊어버림도 없다 — 수정되지 않은 CLIP 특징 공간이 보존된다.

fk,tPcˉkfk,t1P+αfu,v,tPcˉk+α,cˉkcˉk+αf^{P}_{k,t} \leftarrow \frac{\bar{c}_k f^{P}_{k,t-1} + \alpha f^{P}_{u,v,t}}{\bar{c}_k + \alpha}, \qquad \bar{c}_k \leftarrow \bar{c}_k + \alpha

여기서 α=eγ2/2σ2\alpha=e^{-\gamma^{2}/2\sigma^{2}}는 카메라 중심으로부터의 정규화된 반경 거리 γ\gamma로 가중한다(σ=0.6\sigma=0.6).

실험 결과

SLAM에서의 의미

ConceptFusion은 오픈셋 다중 모달 3D 매핑을 개척했으며, 이제는 표준이 된 패러다임을 확립했다: 2D 파운데이션 모델 특징 + 고전적 다중 뷰 융합, 3D 학습은 전혀 없음. 이는 고전적 SLAM과 Spatial AI 사이의 핵심 다리이다 — 로봇을 위치 추정하는 지도가 그대로 “이 병을 열 때 쓸 수 있는 물건이 어디 있지?”에 답한다. 점당 전체 임베딩이라는 메모리 비용은 이후 시스템들이 정확히 공략하는 문제다: 암시적 특징 필드를 쓰는 LERF/LEGS, 이산 레이블을 쓰는 OpenGS-SLAM, 객체 수준 노드를 쓰는 ConceptGraphs.

실습

관련 문서