説明
Meta Segment Anything Model 2 (SAM 2) のご紹介です。これは、AIを活用した画像および動画セグメンテーションにおける重要な進歩です。Meta FAIRによって開発されたSAM 2は、静止画像と動的な動画の両方で、驚異的な速度と精度でオブジェクトをセグメント化できる初の統合モデルです。この強力なツールにより、ユーザーはクリック、バウンディングボックス、またはマスクといったシンプルな入力を使用して、画像または動画フレーム内の任意のオブジェクトを選択できます。
SAM 2の核心的な革新は、プロンプト可能なセグメンテーションを動画ドメインに拡張できる能力にあります。セッションごとのメモリモジュールを組み込み、フレーム間でターゲットオブジェクトに関する情報を保持します。これにより、SAM 2は、オブジェクトが一時的に表示されなくなっても、前のフレームからのコンテキスト情報を活用して選択されたオブジェクトを追跡できます。さらに、ユーザーは任意のフレームに追加のプロンプトを提供することでモデルの予測を洗練させることができ、セグメンテーションマスクの正確な調整を可能にします。
このモデルは、トレーニング中に遭遇したことのないオブジェクト、画像、動画でも効果的にセグメント化できる、堅牢なゼロショット性能を示します。この適応性により、SAM 2は幅広い実世界のアプリケーションに適しています。その設計は、ストリーミング推論による効率的な動画処理を優先し、リアルタイムでインタラクティブなアプリケーションを促進します。SAM 2は最先端のパフォーマンスを達成し、特にオブジェクトパーツの追跡において、画像と動画の両方のオブジェクトセグメンテーションで既存のモデルを上回り、他のインタラクティブ動画セグメンテーション手法と比較してインタラクション時間が短縮されています。
Metaはオープンイノベーションにコミットしており、事前学習済みのSAM 2モデル、SA-Vデータセット、デモ、および関連コードを研究コミュニティに公開しています。約51,000本の動画にわたる600,000以上のマスクレットを含むSA-Vデータセットは、インタラクティブなモデルインザループデータエンジンを使用して作成され、地理的な多様性と実世界のシナリオを重視しています。このリリースは、AI駆動型セグメンテーション分野におけるさらなる研究開発を促進することを目的としています。
Meta Segment Anything Model 2の主要機能
画像と動画に対応した統合セグメンテーションモデル
クリック、ボックス、またはマスクプロンプトによる正確なオブジェクト選択
動画フレーム間でのオブジェクト追跡のためのセッションごとのメモリモジュール
任意のフレームでの追加プロンプトによる洗練機能
未見のオブジェクトおよび動画に対する堅牢なゼロショット性能
ストリーミング推論によるリアルタイムインタラクティビティ
オブジェクトセグメンテーションにおける最先端のパフォーマンス
既存の動画オブジェクトセグメンテーションモデルを上回る性能
従来のメソッドよりも短いインタラクション時間
オープンソース化された事前学習済みモデル、データセット、コード
60万以上のマスクレットを含む、大規模で多様なSA-Vデータセット
トレーニングデータにおける地理的に多様な実世界のシナリオ
他のAIシステムとの統合のための拡張可能な出力
クリエイティブなリアルタイムインタラクションのための拡張可能な入力
Meta Segment Anything Model 2の使い方は?
デモを探索する: SAM 2と対話し、サンプル画像や動画のオブジェクトをセグメント化します。
モデルをダウンロードする: プロジェクトへの統合のために、事前学習済みのSAM 2モデルを取得します。
データセットを探索する: トレーニングおよび研究目的でSA-Vデータセットにアクセスします。
SAM 2を統合する: カスタムセグメンテーションタスクにモデルのAPIまたはコードを利用します。
予測を洗練する: 追加のプロンプトを使用して、必要に応じてセグメンテーションマスクを調整します。
アプリケーションに適用する: 動画編集、コンテンツ作成などのためのSAM 2の機能を利用します。
Meta Segment Anything Model 2の使用例
- 動画オブジェクト追跡
- 画像セグメンテーション
- インタラクティブ動画編集
- コンテンツ作成
- リアルタイムアプリケーション
- AI研究
- オブジェクトマスク生成
- ゼロショットセグメンテーション






