SAM 3
Carion 2025 · 论文
一句话总结 — 在图像和视频中统一了对某个视觉概念所有实例的检测、分割与跟踪——通过一个简短的名词短语、图像样例(exemplar)或两者结合进行提示——在新提出的可提示概念分割(Promptable Concept Segmentation)任务上,精度大约是现有系统的两倍,同时在SAM 2的视觉提示分割任务上依然有所提升。
问题
SAM和SAM 2根据点/框/掩码,每个提示只分割一个物体——它们无法回答”分割这段视频中所有的猫”这样的问题。SAM 3将**可提示概念分割(Promptable Concept Segmentation, PCS)**形式化为:给定一张图像或一段短视频(≤30秒)以及一个概念提示——一个简单的名词短语(“黄色校车”)、正/负样例框,或两者结合——检测、分割并跟踪每一个匹配的实例,赋予其持久身份,并可交互式地进行修正。文本被刻意限制为原子名词短语(较长的指称表达则交给一个MLLM封装器处理),然而开放词汇本身就存在固有的歧义性(一词多义、主观修饰语、边界模糊),因此评测对每个短语采用三份专家标注,并接受多种有效的解释。由于此前不存在具备所需概念多样性的数据集——模型与数据引擎必须再次一起构建。
方法与架构
一个基于DETR的检测器与一个SAM 2风格的跟踪器共享单一对齐的**感知编码器(Perception Encoder, PE)**视觉-语言骨干网络;这种解耦避免了任务冲突,因为检测器必须与身份无关,而跟踪器的任务恰恰是区分不同身份:
- 检测器(DETR范式):PE对图像和文本进行编码;每个样例框都会被编码(位置嵌入+标签嵌入+ROI池化特征,由一个小型Transformer融合),并与文本token拼接成”提示token”。一个融合编码器通过对提示token做交叉注意力来条件化图像嵌入;随后一个DETR风格解码器的对象查询预测每个查询的匹配logit和框偏移量(带框-区域位置偏置的普通注意力;DAC-DETR双重监督和Align损失),并配有一个源自MaskFormer的掩码头和一个逐像素语义分割头。
- 存在性token:识别(是什么,全局上下文)与定位(在哪里,局部证据)在同一个查询内部相互冲突,因此单独用一个可学习的全局token预测,而每个查询只需求解;最终得分为二者的乘积。消融实验:带来+1.5 cgF1的提升,而使用困难负例短语训练则将图像级IL_MCC从0.44提升到0.68。
- 跟踪器:继承了SAM 2的提示编码器、掩码解码器、记忆编码器和记忆库(每个物体每帧生成三个候选掩码以处理歧义性;只有置信度足够高的、确认存在的帧才会保留在记忆中)。每一帧执行
- 采用基于IoU的匹配,未匹配的检测会生成新的masklet,一个时序性的masklet检测分数会抑制不再与检测匹配的轨迹,并周期性地用高置信度的检测掩码重新提示跟踪器,使记忆库保持可靠的参考。单个掩码/masklet仍可通过SAM风格的正/负点击进行修正。
- 训练阶段:PE预训练 → 检测器预训练 → 检测器微调 → 在冻结骨干网络上进行跟踪器训练。
数据引擎(四个阶段,人类与AI协同):AI标注员从一个基于Wikidata、包含2240万节点的本体中提出名词短语及对抗性困难负例;SAM 3提出候选掩码;经过微调的Llama 3.2 AI验证器以接近人类的准确率执行掩码质量与穷尽性验证,将标注吞吐量提高约一倍,并将人工精力引导至最难的失败案例。产出:SA-Co/HQ——520万张图像、400万个独特名词短语、5200万个掩码;一个包含3800万个短语和14亿个掩码的合成集合;SA-Co/VIDEO——5.25万段视频、46.7万个masklet;以及SA-Co基准——覆盖12.1万张图像与视频、含困难负例的20.7万个独特短语,概念数量是现有基准的50倍以上。主指标强制要求校准(只有置信度高于0.5的预测才计入):。
实验结果
- 基于文本的图像PCS:零样本LVIS mask AP为48.8,对比此前最好成绩38.5;在SA-Co/Gold上cgF1为54.1——是最强基线OWLv2(24.6)的两倍以上,达到估计人类表现(72.8)的74%;在COCO和COCO-O边界框上创下新的零样本最优成绩。
- 样例提示:单个样例框在COCO上比T-Rex2高出+18.3 AP,在LVIS上高出+10.3,在ODinW上高出+20.5;在交互式场景中,3个样例提示相比仅用文本提升了+21.6 cgF1,比一个理想的PVS风格逐实例修正基线也高出+2.0。
- 基于文本的视频PCS:在SA-Co/VEval的SA-V/YT-Temporal-1B/SmartGlasses上分别取得30.3/50.8/36.4 cgF1——超过人类pHOTA的80%——此外在LVVIS上取得36.3 test mAP,在OVIS上取得60.5 val mAP,明显高于GLEE以及其自身的检测式跟踪变体。
- PVS依然有所提升:在SA-V val/test上VOS 为83.5/84.4(SAM 2.1 L为77.9/78.4),DAVIS17上为92.2,在困难的MOSEv2上为60.3(比此前工作高+6.5);在SA-37上的交互式图像分割,3/5次点击后mIoU达到81.3/85.1,对比SAM 2.1的80.3/84.3。
- 计数:在CountBench上MAE为0.12/准确率93.8%,领先于Gemini 2.5 Pro和Molmo-72B——同时还能返回掩码。
- SAM 3 Agent:由一个MLLM提出名词短语查询,零样本ReasonSeg val的gIoU达到77.0(Gemini 2.5 Pro),超越此前经过微调的工作。
- 速度:在H200上,检测100个以上物体时每张图像耗时30毫秒;视频延迟随物体数量增长,在约5个并发物体时接近实时。
对SLAM的意义
像ConceptGraphs这样的开放词汇建图流水线,目前是逐帧将一个定位(grounding)检测器、类别无关的SAM掩码和CLIP特征拼凑在一起,再自行解决跨帧物体关联问题。SAM 3将这一”检测-分割-跟踪”循环折叠进一个经过校准的模型中:文本可提示、穷尽式的实例掩码加上持久身份,为物体级建图免费提供了短时程的数据关联;存在性分数是现成的、用于决定是否插入地图的存在置信度;样例提示则让操作者能够在线地教会建图器一个罕见的、特定领域的物体,而无需重新训练。需要诚实指出的局限:SAM 3懂的是概念,而非几何或位姿——它是为建图后端提供输入的感知模块,而非定位器;PCS的定义仅限于短(≤30秒)视频片段,因此长期的地图级重新关联仍需交给SLAM一侧解决;而接近实时的表现也只在约5个并发跟踪物体的规模下成立,域外词汇则是论文明确指出的局限之一。
相关条目
- SAM — 最初的可提示单物体图像分割器
- SAM 2 — SAM 3所继承的基于流式记忆的视频跟踪器
- Grounding DINO — 此前的开放集文本提示检测方法,此处作为基线
- DETR — SAM 3检测器背后基于查询的检测范式
- ConceptGraphs — 这类模型所服务的开放词汇物体级建图