SAM 3

Carion 2025 · 论文

一句话总结 — 在图像和视频中统一了对某个视觉概念所有实例的检测、分割与跟踪——通过一个简短的名词短语、图像样例(exemplar)或两者结合进行提示——在新提出的可提示概念分割(Promptable Concept Segmentation)任务上,精度大约是现有系统的两倍,同时在SAM 2的视觉提示分割任务上依然有所提升。

问题

SAM和SAM 2根据点/框/掩码,每个提示只分割一个物体——它们无法回答”分割这段视频中所有的猫”这样的问题。SAM 3将**可提示概念分割(Promptable Concept Segmentation, PCS)**形式化为:给定一张图像或一段短视频(≤30秒)以及一个概念提示——一个简单的名词短语(“黄色校车”)、正/负样例框,或两者结合——检测、分割并跟踪每一个匹配的实例,赋予其持久身份,并可交互式地进行修正。文本被刻意限制为原子名词短语(较长的指称表达则交给一个MLLM封装器处理),然而开放词汇本身就存在固有的歧义性(一词多义、主观修饰语、边界模糊),因此评测对每个短语采用三份专家标注,并接受多种有效的解释。由于此前不存在具备所需概念多样性的数据集——模型与数据引擎必须再次一起构建。

方法与架构

一个基于DETR的检测器与一个SAM 2风格的跟踪器共享单一对齐的**感知编码器(Perception Encoder, PE)**视觉-语言骨干网络;这种解耦避免了任务冲突,因为检测器必须与身份无关,而跟踪器的任务恰恰是区分不同身份:

M^t=propagate(Mt1),Ot=detect(It,P),Mt=match_and_update(M^t,Ot)\hat{\mathcal{M}}_t = \mathrm{propagate}(\mathcal{M}_{t-1}), \quad \mathcal{O}_t = \mathrm{detect}(I_t, P), \quad \mathcal{M}_t = \mathrm{match\_and\_update}(\hat{\mathcal{M}}_t, \mathcal{O}_t)

数据引擎(四个阶段,人类与AI协同):AI标注员从一个基于Wikidata、包含2240万节点的本体中提出名词短语及对抗性困难负例;SAM 3提出候选掩码;经过微调的Llama 3.2 AI验证器以接近人类的准确率执行掩码质量与穷尽性验证,将标注吞吐量提高约一倍,并将人工精力引导至最难的失败案例。产出:SA-Co/HQ——520万张图像、400万个独特名词短语、5200万个掩码;一个包含3800万个短语和14亿个掩码的合成集合;SA-Co/VIDEO——5.25万段视频、46.7万个masklet;以及SA-Co基准——覆盖12.1万张图像与视频、含困难负例的20.7万个独特短语,概念数量是现有基准的50倍以上。主指标强制要求校准(只有置信度高于0.5的预测才计入):cgF1=100pmF1IL_MCC\mathrm{cgF_1} = 100 \cdot \mathrm{pmF_1} \cdot \mathrm{IL\_MCC}

实验结果

对SLAM的意义

像ConceptGraphs这样的开放词汇建图流水线,目前是逐帧将一个定位(grounding)检测器、类别无关的SAM掩码和CLIP特征拼凑在一起,再自行解决跨帧物体关联问题。SAM 3将这一”检测-分割-跟踪”循环折叠进一个经过校准的模型中:文本可提示、穷尽式的实例掩码加上持久身份,为物体级建图免费提供了短时程的数据关联;存在性分数是现成的、用于决定是否插入地图的存在置信度;样例提示则让操作者能够在线地教会建图器一个罕见的、特定领域的物体,而无需重新训练。需要诚实指出的局限:SAM 3懂的是概念,而非几何或位姿——它是为建图后端提供输入的感知模块,而非定位器;PCS的定义仅限于短(≤30秒)视频片段,因此长期的地图级重新关联仍需交给SLAM一侧解决;而接近实时的表现也只在约5个并发跟踪物体的规模下成立,域外词汇则是论文明确指出的局限之一。

相关条目