SAM 3
Carion 2025 · 論文
一行要約 — 短い名詞句、画像エグザンプラ、あるいはその両方でプロンプトされた、ある視覚的概念のすべてのインスタンスの検出・セグメンテーション・追跡を統一する。新設のPromptable Concept Segmentationタスクにおいて既存システムの精度をおよそ2倍にしつつ、SAM 2の視覚プロンプトセグメンテーションもさらに改善する。
問題
SAMおよびSAM 2は点/ボックス/マスクのプロンプトからプロンプトあたり1つのオブジェクトをセグメント化するものであり——「このビデオ内のすべての猫をセグメント化する」ことには答えられない。SAM 3は**Promptable Concept Segmentation(PCS)**を定式化する:画像または短いビデオ(30秒以下)と概念プロンプト——簡潔な名詞句(「黄色いスクールバス」)、正例/負例のエグザンプラボックス、あるいはその両方——が与えられたとき、一致するすべてのインスタンスを永続的な同一性とともに検出・セグメンテーション・追跡し、対話的に精緻化可能とする。テキストは意図的に原子的な名詞句に制限されており(長い指示表現はMLLMラッパーに委ねられる)、それでもオープン語彙は本質的に曖昧である(多義性、主観的な修飾語、境界の曖昧さ)ため、評価では句ごとに3件の専門家アノテーションを用い、複数の妥当な解釈を許容する。必要とされる概念多様性を持つデータセットは存在しなかった——モデルとデータエンジンは、またしても一緒に構築する必要があった。
手法とアーキテクチャ
DETRベースの検出器とSAM 2式のトラッカーが、単一の整合した**Perception Encoder(PE)**視覚言語バックボーンを共有する;この分離は、検出器が同一性に依存しないものである必要がある一方でトラッカーの仕事は同一性を分離することにあるため、タスクの衝突を回避する。
- 検出器(DETRパラダイム): PEが画像とテキストを符号化する;各エグザンプラボックスは(位置+ラベル埋め込み+ROIプールされた特徴を小さなTransformerで融合して)符号化され、テキストトークンと連結されて「プロンプトトークン」となる。融合エンコーダは、プロンプトトークンへのクロスアテンションによって画像埋め込みを条件付ける;続くDETR式のデコーダのオブジェクトクエリが、クエリごとのマッチロジットとボックスデルタを予測する(ボックス領域の位置バイアスを伴う通常のアテンション;DAC-DETRのデュアル教師信号とAlign損失)、さらにMaskFormer由来のマスクヘッドと画素単位のセマンティックセグメンテーションヘッドを備える。
- プレゼンストークン: 認識(何が、大域的文脈)と局所化(どこに、局所的証拠)は1つのクエリ内では衝突するため、学習された大域トークン単体がを予測し、各クエリはのみを解く;最終スコアはこれらの積である。アブレーション:+1.5 cgF1、ハード負例句を用いた学習により画像レベルのIL_MCCが0.44から0.68に向上する。
- トラッカー: SAM 2のプロンプトエンコーダ、マスクデコーダ、メモリエンコーダ、メモリバンクを継承する(曖昧性に対処するためオブジェクト・フレームごとに3つの候補マスク;確信を持って存在するとされたフレームのみメモリに保持)。各フレームで以下を実行する。
- IoUベースのマッチングを用い、マッチしなかった検出に対して新しいマスクレットを生成し、検出とマッチしなくなった追跡を抑制する時間的なマスクレット検出スコアを用い、確信度の高い検出マスクでトラッカーを定期的に再プロンプトすることでメモリバンクが信頼できる参照を保持し続けるようにする。個々のマスク/マスクレットはSAM式の正例/負例クリックで精緻化可能なままである。
- 学習段階: PE事前学習 → 検出器事前学習 → 検出器ファインチューニング → 凍結バックボーン上でのトラッカー学習。
データエンジン(4段階、人間とAIをループ内に含む): AIアノテータが2240万ノードのWikidataベースのオントロジーから名詞句と敵対的なハード負例を提案する;SAM 3が候補マスクを提案する;ファインチューニングされたLlama 3.2のAI検証器がマスク品質と網羅性の検証を人間に近い精度で行い、アノテーション処理能力をおよそ2倍にしつつ人間を最も難しい失敗事例へと誘導する。成果:SA-Co/HQ——520万枚の画像、400万個のユニークな名詞句、5200万個のマスク;3800万個の句と14億個のマスクからなる合成セット;SA-Co/VIDEO——5万2500本のビデオ、46万7000個のマスクレット;そしてSA-Coベンチマーク——12万1000枚の画像・ビデオにわたる20万7000個のユニークな句とハード負例、既存ベンチマークの50倍以上の概念数。主要な評価指標はキャリブレーションを強制する(信頼度0.5を超える予測のみをカウントする):。
実験結果
- テキストによる画像PCS: ゼロショットでLVISマスクAP 48.8——従来最良の38.5に対して;SA-Co/Goldでは54.1 cgF1——最強のベースラインOWLv2(24.6)の2倍以上であり、推定人間性能(72.8)の74%に相当する;COCOおよびCOCO-Oボックスで新たなゼロショット最先端。
- エグザンプラプロンプト: 単一のエグザンプラボックスがT-Rex2をCOCOで+18.3 AP+、LVISで+10.3、ODinWで+20.5上回る;対話的には、3個のエグザンプラプロンプトによりテキストのみに対して+21.6 cgF1、理想的なPVS式インスタンスごとの修正ベースラインに対して+2.0を得る。
- テキストによるビデオPCS: SA-Co/VEvalのSA-V/YT-Temporal-1B/SmartGlassesで30.3/50.8/36.4 cgF1——人間のpHOTAの80%超——加えてLVVISでテストmAP 36.3、OVISでval mAP 60.5であり、GLEEおよびそれ自身のtracking-by-detectionバリアントを大きく上回る。
- PVSもさらに改善: SA-V val/testでVOSのが83.5/84.4(SAM 2.1 L: 77.9/78.4)、DAVIS17で92.2、難しいMOSEv2で60.3(先行研究に対し+6.5);SA-37での対話的画像セグメンテーションは3/5クリックでmIoU 81.3/85.1に達し、SAM 2.1の80.3/84.3を上回る。
- カウンティング: CountBenchでMAE 0.12 / 精度93.8%、Gemini 2.5 ProやMolmo-72Bを上回る——しかもマスクも同時に返す。
- SAM 3エージェント: MLLMが名詞句クエリを提案する構成で、ゼロショットReasonSeg valのgIoUは77.0(Gemini 2.5 Pro)に達し、従来のファインチューニング済み手法を上回る。
- 速度: H200上で100個以上の検出物体を含む画像1枚あたり30ms;ビデオのレイテンシは物体数に応じてスケールし、同時に約5個の概念であればほぼリアルタイムである。
SLAMにおける意義
ConceptGraphsのようなオープン語彙マッピングパイプラインは現在、グラウンディング検出器、クラス不問のSAMマスク、CLIP特徴をフレームごとにつなぎ合わせ、フレーム間のオブジェクト対応付けは自前で解いている。SAM 3はこの検出・セグメント・追跡ループを1つのキャリブレーションされたモデルに統合する:テキストでプロンプト可能な網羅的なインスタンスマスクが永続的な同一性を伴って得られることで、オブジェクトレベルのマッピングに短期的なデータアソシエーションが無償で与えられる;プレゼンススコアはマップへの挿入を判断するための既製の存在確信度である;そしてエグザンプラプロンプトにより、オペレータは再学習なしにオンラインでまれな領域固有のオブジェクトをマッパーに教えられる。誠実な留保点:SAM 3が知っているのは概念であり、幾何やポーズではない——これはマッピングバックエンドに供給する知覚モジュールであり、ローカライザではない;PCSは短い(30秒以下の)クリップ上で定義されるため、長期的なマップレベルの再対応付けは依然としてSLAM側の仕事である;また近リアルタイム性は同時に追跡される物体が約5個程度の場合にのみ成り立ち、分布外の語彙は明示された限界である。
関連ノート
- SAM — プロンプト可能な単一オブジェクト画像セグメンタの原型
- SAM 2 — SAM 3が継承するストリーミングメモリベースのビデオトラッカー
- Grounding DINO — 従来のオープンセットテキストプロンプト検出、本論文でのベースライン
- DETR — SAM 3の検出器の基盤となるクエリベースの検出パラダイム
- ConceptGraphs — このクラスのモデルが供給するオープン語彙オブジェクトレベルマッピング