Spatial AI
**공간 AI(Spatial AI)**는 Andrew Davison의 FutureMapping 논문들이 대중화한 용어로, SLAM 스타일의 기하학적 이해와 의미론적 장면 이해, 학습된 월드 표현의 수렴을 가리킵니다. 그 비전은 다음과 같습니다: 로봇이나 디바이스는 단지 궤적과 포인트 클라우드를 추정하는 것에 머물지 않고, 자신을 둘러싼 공간에 대한 지속적이고 범용적인 표현 — 기하, 객체, 의미, 동역학을 함께 담은 — 을 유지해야 하며, 이는 어떤 하위 작업(내비게이션, 조작, AR, 인간 상호작용)에서도 쿼리할 수 있어야 합니다.
SLAM의 목표를 다시 규정하기
고전적 SLAM은 “나는 어디에 있고, 표면은 어디에 있는가?”에 답합니다. 공간 AI는 그다음에 오는 질문들을 던집니다:
- 표면 점이 어디에 있는가만이 아니라, 맵 안의 사물들이 무엇인가(객체, 방, 어포던스)?
- 표현을 어떻게 저장해야 시간과 날이 지나도 유용성이 유지되는가 — 압축적이고, 업데이트 가능하며, 여러 작업 간에 공유 가능한가?
- 실시간 공간 인식에는 어떤 계산과 하드웨어가 필요한가(Davison의 FutureMapping 2는 이를 위해 그래프 프로세서와 폰 노이만이 아닌 하드웨어를 검토합니다)?
- 얼마나 많은 부분을 학습해야 하는가? 학습된 구성 요소(깊이 사전, 의미론적 특징, 생성 모델)가 손수 만든 기하학을 점점 대체하거나 보강하고 있습니다.
세 방향에서의 수렴
이 분야가 이 비전을 향해 수렴하고 있는 모습은 여러 방향에서 확인할 수 있으며, 각 방향은 이 로드맵의 일부를 차지합니다:
- 의미론적 및 객체 수준 SLAM(SemanticFusion, Kimera와 3D 동적 장면 그래프, Hydra)은 맵을 레이블, 객체, 계층적 구조 — 방, 장소, 에이전트 — 로 풍부하게 만들어, 표면 모델을 쿼리 가능한 장면 모델로 바꿉니다.
- 오픈 어휘 인식은 맵을 언어로 쿼리 가능하게 만듭니다: LERF는 CLIP 특징을 radiance field에 임베딩하여 임의의 텍스트 쿼리가 3D 관련성 맵을 검색할 수 있게 하고; ConceptFusion과 OpenFusion은 밀집 CLIP 특징 맵을 온라인으로 유지합니다(LERF의 SLAM 대응물); OpenMask3D류의 방법들은 오픈 어휘 특징을 3D 세그먼트에 부착합니다. 패턴은 일관됩니다 — SLAM이 3D 기하를 제공하고, VLM이 의미를 제공하며, 함께 오픈 어휘 3D 장면 이해를 만들어낸다.
- 월드 모델과 VLM/VLA는 학습 측면에서 동일한 목표에 접근합니다: 인터넷 규모로 획득한 암묵적 공간 지식이며, 명시적 기하가 거의 또는 전혀 없고, VLA의 경우 인식을 행동에 직접 결합합니다.
수렴 스택
이를 하나로 묶어 보는 유용한 방법은 스택으로 보는 것입니다:
공간 AI는 이 계층들이 그저 이어 붙여지는 것이 아니라 공유된 공간 표현을 중심으로 공동 설계되어야 한다는 주장입니다. 두 가지 설계 패턴이 경쟁합니다:
- 모듈형: 각 계층이 자신의 전문성을 유지합니다 — SLAM이 미터법적 정밀도와 루프 클로저로 수정 가능한 기하학적 백본을 제공하고; VLM이 해석하며; VLA(또는 고전적 플래너)가 그 위에서 행동합니다.
- 종단 간: 단일 학습 시스템(WorldVLA 스타일, 일부 RT-2 구성)이 명시적 기하를 완전히 건너뜁니다.
정답은 아마도 작업에 따라 달라질 것입니다: 알려진 공간에서의 정밀한 조작과 장기 내비게이션은 명시적 SLAM에 유리하고; 오픈 월드 명령 따르기는 종단 간 접근법에 유리할 수 있습니다. 현재 대부분의 VLA는 미터법적 메모리를 전혀 갖고 있지 않습니다 — 바로 여기가 SLAM이 여전히 제 몫을 하는 지점입니다.
SLAM–기반 모델 인터페이스의 미해결 문제
이는 현재 연구 프론티어의 상당 부분을 정의합니다:
- 언어로 쿼리되는 SLAM 맵 — 의미론적 장면 쿼리를 위해 CLIP/SigLIP 특징을 실시간 SLAM에 통합(ConceptFusion, OpenFusion, LERF).
- SLAM에 근거한 VLA — SLAM이 유지하는 미터법 맵을 VLA를 위한 구조화된 메모리로 사용하여 미터법적 정밀도를 가진 장기 내비게이션을 가능하게 함.
- 생성적 맵 완성 — 관찰되지 않은 맵 영역에서 타당한 기하를 환각하기 위해 생성적 사전을 사용.
- 월드 모델 루프 클로저 — 예측된 장면과 관찰된 장면이 언제 갈라지는지 감지하기 위해 학습된 비디오 예측을 사용하는, 기하학적 루프 클로저의 학습된 대안.
- 기반 모델 맵 사전 — 새로운 환경에 대한 SLAM 초기화로 3D 월드 생성 모델을 사용.
SLAM에서의 의미
공간 AI는 현대 로드맵 대부분의 배후에 있는 “왜”입니다: 이는 이 분야가 희소한 점 맵에서 밀집하고, 의미론적이고, 계층적이며, 학습된 표현으로 이동해 온 흐름을 설명합니다. SLAM 분야에서 연구 또는 엔지니어링 경력을 계획하는 누구에게든, 이는 이 로드맵의 기하학 레벨들을 기반 모델 레벨과 연결하는 틀입니다 — SLAM과 더 넓은 AI 사이의 경계는 흐려지고 있으며, 가장 가치 있는 실무자는 기하학적 기초와 학습된 표현 모두에 능통할 것입니다.