SAM 2

Meta 2024 · 论文

一句话总结 — 通过流式记忆注意力架构将Segment Anything扩展到视频领域,在整个视频序列中一致地跟踪和分割物体,同时在静态图像上比SAM更准确、快6倍。

问题

SAM独立地分割每一张图像,因此在视频上运行会丢失帧间的物体身份——但机器人、AR和视频编辑都需要在运动、形变、遮挡和光照变化中随时间保持一致地分割同一个物体,且常常需要在较低的单帧质量(模糊、相机运动)下完成。SAM 2提出了可提示视觉分割(Promptable Visual Segmentation, PVS):给定视频任意一帧上的点击/框/掩码提示,预测该物体在整个视频中的时空掩码(“masklet”),并可在任意帧上通过进一步的提示进行修正。现有的VOS模型在这个意义上并不具备可提示性,视频掩码标注也很稀缺——因此模型和数据集必须一起构建。

方法与架构

这是SAM的流式泛化版本——逐帧消费视频,当记忆为空时,该模型就是作用于单张图像的SAM:

训练在图像和视频上联合进行:8帧序列,最多包含2个已提示帧,纠正性点击从真值和模型预测中采样;初始提示为真值掩码(p=0.5)、正点击(p=0.25)或框(p=0.25)。

数据引擎(三个阶段):阶段1,逐帧SAM标注,6 FPS——每帧37.8秒,1.6万个masklet;阶段2,SAM 2 Mask传播第一帧掩码——每帧7.4秒(5.1倍加速),6.35万个masklet;阶段3,全流程SAM 2循环标注,偶尔加入纠正性点击——每帧4.5秒(8.4倍加速,质量相当),19.7万个masklet,并配有单独的验证环节和用于覆盖率的自动网格提示masklet。结果:SA-V——5.09万个视频,64.26万个masklet,3550万个掩码,掩码数量比之前任何VOS数据集多53倍(不含自动标注时为15倍),以CC-BY 4.0协议发布。

实验结果

对SLAM的意义

对SLAM来说,逐帧掩码是不够的——系统必须知道自己在不同时间看到的是同一个物体,才能构建语义地图并处理动态场景。SAM 2的流式记忆设计与SLAM流水线的顺序特性天然契合:时间上一致的masklet使动态物体移除、物体级建图以及数据关联所需的持久实例身份成为可能,而遮挡头明确建模了地图维护必须处理的消失/重新出现问题。时空度量-语义建图系统(例如Khronos风格的系统)是这一能力的天然使用者。

相关条目