描述
隆重推出 Meta Segment Anything Model 2 (SAM 2),这是 AI 驱动的图像和视频分割领域的重大进展。SAM 2 由 Meta FAIR 开发,是首个能够以惊人的速度和精度跨静态图像和动态视频分割对象的统一模型。这个强大的工具允许用户通过简单的输入(如点击、边界框或掩码)来选择图像或视频帧中的任何对象。
SAM 2 的核心创新在于其将可提示分割能力扩展到视频领域。它包含一个会话内记忆模块,可以跨帧保留目标对象的信息。这使得 SAM 2 即使在目标对象暂时消失的情况下也能跟踪选定的对象,并利用先前帧的上下文信息。此外,用户可以通过在任何帧上提供额外的提示来精炼模型预测,从而实现对分割掩码的精确调整。
该模型展示了强大的零样本性能,这意味着它可以有效地分割在训练过程中未遇到过的对象、图像和视频。这种适应性使 SAM 2 适用于广泛的现实世界应用。其设计通过流式推理优先考虑高效的视频处理,从而实现实时、交互式应用。SAM 2 实现了最先进的性能,在图像和视频的对象分割方面均超越了现有模型,尤其是在跟踪对象部件方面,并且与其它交互式视频分割方法相比,所需的交互时间更少。
Meta 致力于开放式创新,向研究社区发布了预训练的 SAM 2 模型、SA-V 数据集、演示以及相关代码。SA-V 数据集包含约 51,000 个视频中的 600,000 多个掩码片段,是使用交互式、模型辅助的数据引擎创建的,并强调地理多样性和现实场景。此次发布旨在促进 AI 驱动分割领域的进一步研究和开发。
Meta Segment Anything Model 2的核心功能
统一的图像和视频分割模型
通过点击、框选或掩码提示进行精确的对象选择
用于跨视频帧对象跟踪的会话内记忆模块
通过在任何帧上提供额外提示进行精炼的能力
对未见过对象和视频的强大零样本性能
通过流式推理实现实时交互性
对象分割领域的最新性能
超越现有的视频对象分割模型
比传统方法需要更少的交互时间
开源预训练模型、数据集和代码
大型且多样化的 SA-V 数据集,包含 60 万多个掩码片段
训练数据中包含地理多样化的现实场景
可扩展的输出,用于与其他 AI 系统集成
可扩展的输入,用于创意实时交互
如何使用 Meta Segment Anything Model 2?
探索演示:与 SAM 2 交互,对示例图像和视频中的对象进行分割。
下载模型:获取预训练的 SAM 2 模型,以便集成到您的项目中。
探索数据集:访问 SA-V 数据集,用于训练和研究目的。
集成 SAM 2:利用模型的 API 或代码进行自定义分割任务。
精炼预测:使用额外的提示按需调整分割掩码。
应用于各种场景:利用 SAM 2 的能力进行视频编辑、内容创作等。
Meta Segment Anything Model 2的使用案例
- 视频对象跟踪
- 图像分割
- 交互式视频编辑
- 内容创作
- 实时应用
- AI 研究
- 对象掩码生成
- 零样本分割






