파운데이션 모델

*파운데이션 모델(foundation model)*이란 대규모의 다양한 데이터에서 한 번 사전학습된 후, 고정된 특징 추출기로 그대로 쓰이거나 경미하게 미세조정되거나 프롬프팅되어 여러 다운스트림 작업에 재사용되는 대형 네트워크를 말한다. 이 용어가 SLAM 어휘에 들어온 것은, 이러한 모델들의 물결이 인식 백본으로 곧바로 유용하다는 것이 드러났기 때문이다: CLIP(이미지-텍스트 임베딩), SAM(프롬프트 가능한 세그멘테이션), DINOv2(자기지도 시각 특징), Depth Anything(단안 깊이), 그리고 DUSt3R 계열(원시 이미지 쌍으로부터의 양안 3D 재구성).

무엇이 바뀌었나

이것이 왜 중요한지는 이전의 표준과 대비할 때 가장 잘 드러난다. 고전적인 학습 모듈(SuperPoint, MonoDepth)은 적당한 규모의 데이터셋에서 태스크별로 학습되어 그 편향을 그대로 물려받았고, 새로운 도메인에 배치하려면 흔히 재학습이 필요했다. 파운데이션 모델은 이 경제성을 바꾼다.

각 계열이 제공하는 것

계열학습 데이터 / 방식SLAM이 얻는 것
CLIP / SigLIP이미지-텍스트 쌍, 대조 학습지도와 장소 설명을 위한 개방형 어휘 의미론
SAM / SAM 2대규모 프롬프트 가능 세그멘테이션객체 수준 및 동적 SLAM을 위한 클래스 무관 인스턴스 마스크
DINOv2자기지도 ViT매칭, VPR, 대응점 탐색을 위한 강건한 조밀 특징
Depth Anything (V1/V2), Metric3D대규모 (자기)지도 깊이 학습깊이 센서가 없는 곳을 위한 조밀 단안 깊이 사전 정보
DUSt3R / MASt3R / VGGT포즈가 있는 이미지 쌍/집합피드포워드 포인트맵, 매칭, 포즈 — 추론으로서의 기하학

이 목록을 알고 있으면 시스템을 설계할 때 무엇을 “공짜로” 얻을 수 있는지, 그리고 그것이 고전적인 레벨 3/4 모듈 중 어느 것을 대체할 수 있는지 알 수 있다.

SLAM 시스템은 실제로 이를 어떻게 소비하는가

감안해야 할 트레이드오프

실용적인 레시피

레벨 5 이후에 걸쳐 나타나는 패턴은 이렇다: 파이프라인에서 강건성이 중요하거나, 의미론적이거나, 조건이 나쁜 부분(장소 인식, 넓은 베이스라인 매칭, 단안 깊이, 개방형 어휘 레이블)에는 파운데이션 모델 특징을 사용하고, 정밀도가 중요한 부분(포즈 최적화, 매핑 일관성)에는 고전적 추정을 유지하는 것이다. 가장 최신 시스템들 — MASt3R-SLAM, ConceptGraphs 스타일 의미론적 매핑 — 은 정확히 이런 형태다: 대형 사전학습 모델 위에 얹힌 얇은 기하학 레이어.

SLAM에서의 의미

파운데이션 모델은 SLAM 프론트엔드의 정의를 다시 쓰고 있다: 태스크별 네트워크를 학습하는 대신, 현대 시스템은 점점 고정된 사전학습 백본을 조합한다 — 그리고 가장 최신의 SLAM 시스템(MASt3R-SLAM, ConceptGraphs 스타일 의미론적 매핑)은 바로 이러한 모델 위에 얹힌 얇은 기하학 레이어다. 각 계열이 무엇을 제공하는지(CLIP: 의미론, SAM: 마스크, DINOv2: 강건한 특징, Depth Anything: 깊이, DUSt3R: 기하학) 아는 것은 시스템을 설계할 때 무엇을 “공짜로” 얻을 수 있는지를 알려준다.

관련 문서