ConceptGraphs

Gu 2023 · 논문

한 줄 요약 — ConceptGraphs는 2D 파운데이션 모델의 출력(SAM 세그먼트, CLIP 임베딩)을 3D 객체 노드로 융합하고 LLM을 이용해 객체 간 관계를 추론함으로써 개방형 어휘 3D scene graph를 구축하며, 계획 수립에 활용 가능한 언어 질의형 맵을 만들어낸다.

문제

로봇에게는 시맨틱하게 풍부하면서도 태스크 중심 인지와 계획에 적합할 만큼 컴팩트하고 효율적인 3D 세계 표현이 필요하다. 비전-언어 특징을 3D 맵에 주입하려는 최근 시도들은 점 단위 특징 벡터를 만들어내는데, 이는 “더 큰 환경으로는 잘 확장되지 않으며, 개체 간의 시맨틱한 공간적 관계도 포함하지 않는다” — 반면 전통적인 닫힌 집합(closed-set) scene graph는 미리 정의된 라벨 집합에 고정되어 있다. ConceptGraphs는 3D 학습 데이터를 수집하거나 어떤 모델도 미세 조정하지 않고 구축 가능하며, 객체 중심적이고 그래프로 구조화된 개방형 어휘 표현을 목표로 한다.

방법 및 아키텍처

포즈가 주어진 RGB-D 프레임 It=Itrgb,Itdepth,θtI_t = \langle I_t^{\text{rgb}}, I_t^{\text{depth}}, \theta_t \rangle이 주어지면, ConceptGraphs는 각 노드 oj\mathbf{o}_j가 3D 포인트 클라우드 poj\mathbf{p}_{o_j}와 융합된 시맨틱 특징 foj\mathbf{f}_{o_j}를 갖는 scene graph Mt=Ot,Et\mathcal{M}_t = \langle \mathbf{O}_t, \mathbf{E}_t \rangle를 증분적으로 구축한다:

실험 결과

SLAM에서의 의미

ConceptGraphs는 2D 파운데이션 모델이 새로운 3D 네트워크 없이도 일반적인 다중 뷰 연관을 통해 3D로 끌어올려질 수 있음을 보여주었다 — SLAM 시스템의 포즈가 주어진 RGB-D 스트림을 언어 질의형 객체 맵으로 전환한 것이다. 이는 개방형 어휘 로봇 매핑을 위한 이제는 표준이 된 SAM + CLIP + LLM 방식을 확립했으며, 점 단위 접근법들(ConceptFusion, LERF, OpenScene)과 함께 개방형 어휘 3D 맵의 설계 공간 — 밀집 특징 대 객체 중심 그래프 — 을 규정했다. SLAM의 출력이 점점 더 언어 기반 플래너로 흘러들어가는 상황에서, 이와 같은 그래프 구조의 개방형 집합 맵은 현대 Spatial AI에서 “시맨틱 맵”이 의미하는 바를 정의한다.

관련 문서