SpatialLM

Mao 2025 · 논문

한 줄 요약 — 기성 LLM을 파인튜닝하여 3D 포인트 클라우드를 입력받고 벽, 문, 창문, 방향을 가진 물체 박스와 같은 구조화된 실내 모델을 Python 데이터클래스 스크립트로 출력하도록 하여, LLM의 추론을 3D 공간 구조에 근거하게 만든다.

문제

구조화된 실내 모델링 — 원시 RGBD 스캔으로부터 건축적 레이아웃(벽, 문, 창문)과 3D 물체 바운딩 박스를 함께 복원하는 것 — 은 그동안 태스크 전용 네트워크(RoomFormer의 폴리곤 쿼리, V-DETR의 검출 헤드)나 도메인 전용 토큰을 사용하는 맞춤형 오토리그레시브 디코더(SceneScript)의 영역이었다. 한편 LLM은 추론과 코드 생성에 뛰어나지만 3D 공간에 대한 근거가 전혀 없다. 단순히 LLM을 이 작업에 파인튜닝하는 것을 막았던 두 가지 요인이 있다: 포인트 클라우드와 구조화된 3D 주석을 짝지은 대규모의 고품질 데이터셋이 없었고, 포인트 클라우드 입력을 LLM과 정렬시키는 방법에 대한 실증적 이해가 없었다. SpatialLM(기술 보고서: arXiv 2506.07491, NeurIPS 2025)은 이 두 가지 모두를 다룬다.

방법 및 아키텍처

F=E(P),PRN×6,  FRK×D,  KN,\mathbf{F} = \mathcal{E}(\mathbf{P}), \qquad \mathbf{P} \in \mathbb{R}^{N \times 6},\; \mathbf{F} \in \mathbb{R}^{K \times D},\; K \ll N,

여기서 각 점은 XYZ + RGB를 갖는다. 선택된 인코더는 Sonata(인코더 전용, 자기지도 방식의 Point Transformer V3 변형)이고, 두 계층의 MLP 프로젝터, 그리고 기반 LLM으로 Qwen2.5-0.5B를 사용한다(총 6억 350만 파라미터; 공개된 체크포인트에는 Llama-1B 변형도 포함된다).

실험 결과

SLAM에서의 의미

SpatialLM은 시맨틱 매핑이 나아가는 방향을 보여준다: 레이블이 주석된 포인트 클라우드(OpenScene, ConceptFusion)와 장면 그래프(ConceptGraphs)에서, LLM이 직접 파싱하고 조작할 수 있는 표현으로의 이동이다. SLAM 시스템이 포인트 클라우드를 제공하고(논문의 자체 데모 파이프라인은 단안 비디오에서 MASt3R-SLAM을 실행한다) SpatialLM은 이를 컴팩트하고 편집 가능하며 기계가 읽을 수 있는 공간 서술로 바꾸어, 장면 편집, AR, 로봇 내비게이션, 디지털 트윈, 임바디드 AI에 유용하게 만든다.

관련 문서