SAM 3

Carion 2025 · 논문

한 줄 요약 — 짧은 명사구, 이미지 exemplar, 또는 둘 다로 프롬프트되는 시각적 개념의 모든 인스턴스에 대한 검출, 세그먼테이션, 추적을 이미지와 비디오에서 통합하며, 새로운 프롬프트 가능한 개념 세그먼테이션(PCS) 태스크에서 기존 시스템의 정확도를 거의 두 배로 높이는 동시에 SAM 2의 시각적 프롬프트 세그먼테이션 성능도 개선합니다.

문제

SAM과 SAM 2는 점/박스/마스크로부터 프롬프트당 하나의 객체만 세그먼테이션합니다 — “이 비디오에서 모든 고양이를 세그먼테이션하라”에는 답할 수 없습니다. SAM 3는 **프롬프트 가능한 개념 세그먼테이션(Promptable Concept Segmentation, PCS)**을 공식화합니다: 이미지나 짧은 비디오(30초 이하)와 개념 프롬프트 — 간단한 명사구(“노란 스쿨버스”), 양성/음성 exemplar 박스, 또는 둘 다 — 가 주어지면, 지속적인 정체성을 가진 채로 일치하는 모든 인스턴스를 검출, 세그먼테이션, 추적하며, 대화식으로 정제할 수 있습니다. 텍스트는 의도적으로 원자적인 명사구로 제한됩니다(긴 지시 표현은 MLLM 래퍼에 위임됩니다), 그러나 개방형 어휘는 본질적으로 모호하므로(다의성, 주관적 수식어, 경계 모호성) 평가는 구절당 세 명의 전문가 어노테이션을 사용하고 여러 개의 타당한 해석을 인정합니다. 필요한 수준의 개념 다양성을 갖춘 데이터셋이 존재하지 않았으므로 — 모델과 데이터 엔진을 다시 한번 함께 구축해야 했습니다.

방법 및 아키텍처

DETR 기반 검출기와 SAM 2 스타일 트래커는 정렬된 단일 Perception Encoder(PE) 비전-언어 백본을 공유합니다; 검출기는 정체성에 무관해야 하는 반면 트래커의 임무는 정체성을 구분하는 것이므로, 이 분리는 태스크 간 충돌을 피합니다:

M^t=propagate(Mt1),Ot=detect(It,P),Mt=match_and_update(M^t,Ot)\hat{\mathcal{M}}_t = \mathrm{propagate}(\mathcal{M}_{t-1}), \quad \mathcal{O}_t = \mathrm{detect}(I_t, P), \quad \mathcal{M}_t = \mathrm{match\_and\_update}(\hat{\mathcal{M}}_t, \mathcal{O}_t)

데이터 엔진(4단계, 인간 + AI 협업): AI 어노테이터가 2240만 노드 규모의 Wikidata 기반 온톨로지로부터 명사구와 적대적 hard negative를 제안합니다; SAM 3가 후보 마스크를 제안합니다; 미세조정된 Llama 3.2 **AI 검증자(verifier)**가 사람 수준에 근접한 정확도로 마스크 품질과 완전성(exhaustivity) 검증을 수행하여, 어노테이션 처리량을 거의 두 배로 늘리고 사람을 가장 어려운 실패 사례로 유도합니다. 결과물: SA-Co/HQ — 이미지 520만 장, 고유 명사구 400만 개, 마스크 5200만 개; 구절 3800만 개와 마스크 14억 개로 이루어진 합성 세트; SA-Co/VIDEO — 비디오 52.5K개, masklet 467K개; 그리고 SA-Co 벤치마크 — hard negative를 포함한 이미지와 비디오 121K개에 걸친 고유 구절 207K개로, 기존 벤치마크보다 개념 수가 50배 이상 많습니다. 주요 지표는 보정(calibration)을 강제합니다(0.5 신뢰도 이상의 예측만 집계됨): cgF1=100pmF1IL_MCC\mathrm{cgF_1} = 100 \cdot \mathrm{pmF_1} \cdot \mathrm{IL\_MCC}.

실험 결과

SLAM에서의 의미

ConceptGraphs와 같은 개방형 어휘 매핑 파이프라인은 현재 grounding 검출기, 클래스에 무관한 SAM 마스크, 프레임별 CLIP 특징을 이어붙인 뒤 프레임 간 객체 연관은 스스로 해결합니다. SAM 3는 이 검출-세그먼테이션-추적 루프를 하나의 보정된 모델로 압축합니다: 텍스트로 프롬프트 가능하고 지속적인 정체성을 가진 완전한(exhaustive) 인스턴스 마스크는 객체 수준 매핑에 단기 데이터 연관을 공짜로 제공하며; 존재 점수는 맵 삽입 여부를 결정하기 위한 즉석의 존재 신뢰도이고; exemplar 프롬프트는 운영자가 재학습 없이 온라인으로 드물고 도메인 특화된 객체를 매퍼에게 가르칠 수 있게 해줍니다. 정직한 유의점: SAM 3는 기하나 포즈가 아니라 개념을 알 뿐입니다 — 위치추정기(localizer)가 아니라 매핑 백엔드에 입력을 제공하는 인식 모듈입니다; PCS는 짧은(30초 이하) 클립에 대해 정의되므로, 장기적인 맵 수준의 재연관은 여전히 SLAM 쪽의 몫으로 남습니다; 그리고 준실시간은 동시 추적 객체 약 5개 안팎에서만 유지되며, 도메인 밖의 어휘는 명시된 한계입니다.

관련 문서