SpatialLM
Mao 2025 · 논문
한 줄 요약 — 기성 LLM을 파인튜닝하여 3D 포인트 클라우드를 입력받고 벽, 문, 창문, 방향을 가진 물체 박스와 같은 구조화된 실내 모델을 Python 데이터클래스 스크립트로 출력하도록 하여, LLM의 추론을 3D 공간 구조에 근거하게 만든다.
문제
구조화된 실내 모델링 — 원시 RGBD 스캔으로부터 건축적 레이아웃(벽, 문, 창문)과 3D 물체 바운딩 박스를 함께 복원하는 것 — 은 그동안 태스크 전용 네트워크(RoomFormer의 폴리곤 쿼리, V-DETR의 검출 헤드)나 도메인 전용 토큰을 사용하는 맞춤형 오토리그레시브 디코더(SceneScript)의 영역이었다. 한편 LLM은 추론과 코드 생성에 뛰어나지만 3D 공간에 대한 근거가 전혀 없다. 단순히 LLM을 이 작업에 파인튜닝하는 것을 막았던 두 가지 요인이 있다: 포인트 클라우드와 구조화된 3D 주석을 짝지은 대규모의 고품질 데이터셋이 없었고, 포인트 클라우드 입력을 LLM과 정렬시키는 방법에 대한 실증적 이해가 없었다. SpatialLM(기술 보고서: arXiv 2506.07491, NeurIPS 2025)은 이 두 가지 모두를 다룬다.
방법 및 아키텍처
- 표준 “인코더–MLP–LLM” 파이프라인 — 전용 디코더가 없다. 포인트 클라우드 인코더가 장면을 LLM을 위한 짧은 시각 토큰 시퀀스로 압축한다:
여기서 각 점은 XYZ + RGB를 갖는다. 선택된 인코더는 Sonata(인코더 전용, 자기지도 방식의 Point Transformer V3 변형)이고, 두 계층의 MLP 프로젝터, 그리고 기반 LLM으로 Qwen2.5-0.5B를 사용한다(총 6억 350만 파라미터; 공개된 체크포인트에는 Llama-1B 변형도 포함된다).
- Python 코드로서의 장면 서술. 출력은 순수 텍스트이다: 벽/문/창문에 대한 데이터클래스 스타일 스크립트(예:
class Wall: a_x, a_y, a_z, b_x, b_y, b_z, height)와 59개 물체 범주에 대한 방향을 가진 바운딩 박스이다. 코드는 사람이 편집할 수 있고, 새로운 클래스로 확장 가능하며, LLM에 내재된 코딩 능력을 활용한다; SceneScript의 도메인 전용 토큰과 달리 커스텀 어휘가 필요 없다. - SpatialLM 데이터셋. 전문적으로 제작된 인테리어 디자인에서 파싱한 12,328개의 합성 장면(54,778개의 방)을, 시뮬레이션된 카메라 궤적을 따라(0.5 m마다 이미지) 사진처럼 렌더링했다; 학습/검증/테스트를 11,328/500/500으로 분할했다. 이는 실제 주석 데이터셋(레이아웃 레이블이 있는 방 1,151개의 SceneCAD)을 압도하는 규모이다.
- 실증적 정렬 연구. 포인트별 DINOv2 특징을 단순히 토큰 축소(복셀화 또는 최원점 샘플링)하면 물체 F1이 거의 0으로 붕괴한다 — 너무 많은 공간 정보가 손실된다; 학습된 인코더(희소 3DCNN, Sonata)는 잘 동작하며 Sonata가 최고이다([email protected]에서 레이아웃 F1 84.6 대 3DCNN의 79.4). 인코더의 공간 해상도를 두 배로 늘리면(K ≈ 510 토큰) 도움이 되지만([email protected]에서 물체 F1 49.4 → 61.1), 4배로 늘리면 성능이 저하된다. 인코더, MLP, LLM을 모두 학습 가능하게 둔 단일 단계 학습이 모든 2단계 및 3단계 동결 스케줄을 능가한다.
- 평가 지표: IoU 임계값 0.25/0.5에서의 헝가리안 매칭 F1 — 레이아웃에 대해서는 투영된 평면 세그먼트의 2D IoU, 물체 박스에 대해서는 3D IoU(오토리그레시브 모델이 신뢰도 점수를 내지 않으므로 mAP 대신 F1을 사용).
실험 결과
- 레이아웃 추정(Structured3D): 자체 데이터셋으로 사전 학습한 뒤 Structured3D로 파인튜닝한 SpatialLM은 F1 94.3 / 93.5([email protected]/0.5)에 도달하여 전문 모델 RoomFormer(83.4/81.4)와 SceneScript(90.4/89.2)를 앞선다. Structured3D만으로 학습하면 32.6/18.1에 그친다 — 대규모 사전 학습 데이터셋이 LLM 파인튜닝을 실현 가능하게 만드는 핵심이다.
- 3D 물체 검출(ScanNet, 18개 클래스, F1): 사전 학습 + ScanNet 파인튜닝은 65.6 / 52.6을 기록하여 SceneScript의 49.1/36.8을 앞서고, 전문 모델 V-DETR의 65.1/56.8과 비교해 [email protected]에서는 앞서지만 0.5에서는 뒤진다. 놓치는 대부분은 가장 작은 물체(그림, 세면대)이다. ScanNet만으로 학습하면 붕괴한다(2.9/0.7).
- 비디오 재구성에 대한 제로샷: MASt3R-SLAM으로 재구성한 107개의 실내 투어 비디오 — 노이즈가 많고, 가려짐이 있고, 아티팩트로 가득한 포인트 클라우드 — 에서 SpatialLM은 파인튜닝 없이도 일관된 레이아웃과 완전한 물체 박스를 만들어내며, 문맥으로부터 보이지 않는 영역을 완성한다(바닥까지 이어진 침대, 그럴듯한 발코니/다이닝 레이아웃).
SLAM에서의 의미
SpatialLM은 시맨틱 매핑이 나아가는 방향을 보여준다: 레이블이 주석된 포인트 클라우드(OpenScene, ConceptFusion)와 장면 그래프(ConceptGraphs)에서, LLM이 직접 파싱하고 조작할 수 있는 표현으로의 이동이다. SLAM 시스템이 포인트 클라우드를 제공하고(논문의 자체 데모 파이프라인은 단안 비디오에서 MASt3R-SLAM을 실행한다) SpatialLM은 이를 컴팩트하고 편집 가능하며 기계가 읽을 수 있는 공간 서술로 바꾸어, 장면 편집, AR, 로봇 내비게이션, 디지털 트윈, 임바디드 AI에 유용하게 만든다.