SAM 3
Carion 2025 · 논문
한 줄 요약 — 짧은 명사구, 이미지 exemplar, 또는 둘 다로 프롬프트되는 시각적 개념의 모든 인스턴스에 대한 검출, 세그먼테이션, 추적을 이미지와 비디오에서 통합하며, 새로운 프롬프트 가능한 개념 세그먼테이션(PCS) 태스크에서 기존 시스템의 정확도를 거의 두 배로 높이는 동시에 SAM 2의 시각적 프롬프트 세그먼테이션 성능도 개선합니다.
문제
SAM과 SAM 2는 점/박스/마스크로부터 프롬프트당 하나의 객체만 세그먼테이션합니다 — “이 비디오에서 모든 고양이를 세그먼테이션하라”에는 답할 수 없습니다. SAM 3는 **프롬프트 가능한 개념 세그먼테이션(Promptable Concept Segmentation, PCS)**을 공식화합니다: 이미지나 짧은 비디오(30초 이하)와 개념 프롬프트 — 간단한 명사구(“노란 스쿨버스”), 양성/음성 exemplar 박스, 또는 둘 다 — 가 주어지면, 지속적인 정체성을 가진 채로 일치하는 모든 인스턴스를 검출, 세그먼테이션, 추적하며, 대화식으로 정제할 수 있습니다. 텍스트는 의도적으로 원자적인 명사구로 제한됩니다(긴 지시 표현은 MLLM 래퍼에 위임됩니다), 그러나 개방형 어휘는 본질적으로 모호하므로(다의성, 주관적 수식어, 경계 모호성) 평가는 구절당 세 명의 전문가 어노테이션을 사용하고 여러 개의 타당한 해석을 인정합니다. 필요한 수준의 개념 다양성을 갖춘 데이터셋이 존재하지 않았으므로 — 모델과 데이터 엔진을 다시 한번 함께 구축해야 했습니다.
방법 및 아키텍처
DETR 기반 검출기와 SAM 2 스타일 트래커는 정렬된 단일 Perception Encoder(PE) 비전-언어 백본을 공유합니다; 검출기는 정체성에 무관해야 하는 반면 트래커의 임무는 정체성을 구분하는 것이므로, 이 분리는 태스크 간 충돌을 피합니다:
- 검출기(DETR 패러다임): PE가 이미지와 텍스트를 인코딩합니다; 각 exemplar 박스는 (위치 + 레이블 임베딩 + ROI-pooled 특징을 작은 transformer로 융합하여) 인코딩되고 텍스트 토큰과 연결되어 “prompt token”이 됩니다. Fusion 인코더는 prompt token에 대한 cross-attention을 통해 이미지 임베딩을 조건화합니다; 이어서 DETR 스타일 디코더의 object query가 query별 매치 로짓과 박스 델타를 예측합니다(box-region-positional bias를 갖는 vanilla attention; DAC-DETR의 이중 감독과 Align 손실), 여기에 MaskFormer 계열의 마스크 헤드와 픽셀별 시맨틱 세그먼테이션 헤드가 함께합니다.
- 존재 토큰(presence token): 인식(무엇인가, 전역 맥락)과 위치 추정(어디인가, 지역적 증거)은 하나의 query 안에서 충돌하므로, 학습된 전역 토큰 하나가 을 예측하고 각 query 는 만을 풉니다; 최종 점수는 이 둘의 곱입니다. Ablation 결과: +1.5 cgF1이며, hard-negative 구절로 학습하면 이미지 수준 IL_MCC가 0.44에서 0.68로 상승합니다.
- 트래커: SAM 2의 프롬프트 인코더, 마스크 디코더, 메모리 인코더, 메모리 뱅크를 물려받습니다(모호성을 다루기 위해 프레임당 객체당 세 개의 후보 마스크; 확신 있게 존재하는 프레임만 메모리에 유지됩니다). 각 프레임은 다음을 수행합니다
- IoU 기반 매칭, 매칭되지 않은 검출에 대해 새로운 masklet을 생성하는 것, 더 이상 검출과 매칭되지 않는 트랙을 억제하는 시간적 masklet 검출 점수, 그리고 메모리 뱅크가 신뢰할 수 있는 참조를 유지하도록 높은 신뢰도의 검출 마스크로 트래커를 주기적으로 재프롬프트하는 것과 함께 이루어집니다. 개별 마스크/masklet은 SAM 스타일의 양성/음성 클릭으로 계속 정제할 수 있습니다.
- 학습 단계: PE 사전학습 → 검출기 사전학습 → 검출기 미세조정 → 고정된 백본 위에서의 트래커 학습.
데이터 엔진(4단계, 인간 + AI 협업): AI 어노테이터가 2240만 노드 규모의 Wikidata 기반 온톨로지로부터 명사구와 적대적 hard negative를 제안합니다; SAM 3가 후보 마스크를 제안합니다; 미세조정된 Llama 3.2 **AI 검증자(verifier)**가 사람 수준에 근접한 정확도로 마스크 품질과 완전성(exhaustivity) 검증을 수행하여, 어노테이션 처리량을 거의 두 배로 늘리고 사람을 가장 어려운 실패 사례로 유도합니다. 결과물: SA-Co/HQ — 이미지 520만 장, 고유 명사구 400만 개, 마스크 5200만 개; 구절 3800만 개와 마스크 14억 개로 이루어진 합성 세트; SA-Co/VIDEO — 비디오 52.5K개, masklet 467K개; 그리고 SA-Co 벤치마크 — hard negative를 포함한 이미지와 비디오 121K개에 걸친 고유 구절 207K개로, 기존 벤치마크보다 개념 수가 50배 이상 많습니다. 주요 지표는 보정(calibration)을 강제합니다(0.5 신뢰도 이상의 예측만 집계됨): .
실험 결과
- 텍스트 기반 이미지 PCS: zero-shot 48.8 LVIS mask AP로 이전 최고 기록 38.5와 대비됩니다; SA-Co/Gold에서 54.1 cgF1 — 가장 강력한 기준선 OWLv2(24.6)의 두 배 이상이며 추정 인간 성능(72.8)의 74%입니다; COCO와 COCO-O 박스에서 새로운 zero-shot state of the art를 기록합니다.
- Exemplar 프롬프트: exemplar 박스 하나만으로 T-Rex2를 COCO에서 +18.3 AP+, LVIS에서 +10.3, ODinW에서 +20.5만큼 앞섭니다; 대화식으로는, exemplar 프롬프트 3개가 텍스트 전용 대비 +21.6 cgF1, 이상적인 PVS 스타일 인스턴스별 보정 기준선 대비 +2.0을 얻습니다.
- 텍스트 기반 비디오 PCS: SA-Co/VEval SA-V/YT-Temporal-1B/SmartGlasses에서 30.3/50.8/36.4 cgF1 — 인간 pHOTA의 80% 이상 — 이며, 여기에 LVVIS에서 36.3 test mAP, OVIS에서 60.5 val mAP를 더해, GLEE 및 자체의 tracking-by-detection 변형을 크게 상회합니다.
- PVS도 여전히 개선됩니다: SA-V val/test에서 VOS 83.5/84.4(SAM 2.1 L: 77.9/78.4), DAVIS17에서 92.2, 어려운 MOSEv2에서 60.3(이전 연구 대비 +6.5); SA-37에서의 대화형 이미지 세그먼테이션은 클릭 3/5회에서 81.3/85.1 mIoU에 도달하여 SAM 2.1의 80.3/84.3과 대비됩니다.
- 개수 세기(Counting): CountBench에서 0.12 MAE / 93.8% 정확도로 Gemini 2.5 Pro와 Molmo-72B를 앞서며 — 동시에 마스크도 반환합니다.
- SAM 3 Agent: MLLM이 명사구 질의를 제안하는 방식으로, zero-shot ReasonSeg val gIoU가 77.0(Gemini 2.5 Pro)에 도달하여 이전의 미세조정된 연구를 능가합니다.
- 속도: H200에서 100개 이상의 객체를 검출할 때 이미지당 30ms; 비디오 지연시간은 객체 수에 따라 증가하며, 동시 객체 약 5개까지는 거의 실시간입니다.
SLAM에서의 의미
ConceptGraphs와 같은 개방형 어휘 매핑 파이프라인은 현재 grounding 검출기, 클래스에 무관한 SAM 마스크, 프레임별 CLIP 특징을 이어붙인 뒤 프레임 간 객체 연관은 스스로 해결합니다. SAM 3는 이 검출-세그먼테이션-추적 루프를 하나의 보정된 모델로 압축합니다: 텍스트로 프롬프트 가능하고 지속적인 정체성을 가진 완전한(exhaustive) 인스턴스 마스크는 객체 수준 매핑에 단기 데이터 연관을 공짜로 제공하며; 존재 점수는 맵 삽입 여부를 결정하기 위한 즉석의 존재 신뢰도이고; exemplar 프롬프트는 운영자가 재학습 없이 온라인으로 드물고 도메인 특화된 객체를 매퍼에게 가르칠 수 있게 해줍니다. 정직한 유의점: SAM 3는 기하나 포즈가 아니라 개념을 알 뿐입니다 — 위치추정기(localizer)가 아니라 매핑 백엔드에 입력을 제공하는 인식 모듈입니다; PCS는 짧은(30초 이하) 클립에 대해 정의되므로, 장기적인 맵 수준의 재연관은 여전히 SLAM 쪽의 몫으로 남습니다; 그리고 준실시간은 동시 추적 객체 약 5개 안팎에서만 유지되며, 도메인 밖의 어휘는 명시된 한계입니다.
관련 문서
- SAM — 원조 프롬프트 가능한 단일 객체 이미지 세그먼터
- SAM 2 — SAM 3가 물려받은 스트리밍 메모리 기반 비디오 트래커
- Grounding DINO — 이전의 open-set 텍스트 프롬프트 검출로, 여기서의 기준선
- DETR — SAM 3 검출기 이면의 query 기반 검출 패러다임
- ConceptGraphs — 이 계열의 모델이 입력을 제공하는 개방형 어휘 객체 수준 매핑