説明
IDEFICS(Image-aware Decoder Enhanced à la Flamingo with Interleaved Cross-attention)は、AIにおける透明性と民主化を推進するために開発されたオープンアクセス可能なビジュアル言語モデルです。これは、一般公開されていない最先端のビジュアル言語モデルであるDeepMindのFlamingoのオープン再現版です。GPT-4のようなモデルと同様に、IDEFICSは画像とテキストの任意のシーケンスを処理し、一貫性のあるテキスト出力を生成できます。
公開されているデータとモデル(LLaMA v1およびOpenCLIPを含む)のみで構築されたIDEFICSは、ベースバージョンとインストラクトバージョンの2つのバリアントで利用可能です。各バリアントは、90億および800億の2つのパラメータサイズで提供されます。このプロジェクトは、公開データのみを使用し、トレーニングデータセットを探索するためのツールを提供し、技術的な学習内容を共有し、リリース前に敵対的プロンプティング(レッドチーミング)による内部倫理評価を実施することで、透明性を重視しています。
IDEFICSは、画像に関する質問への回答、視覚コンテンツの説明、複数の画像に基づいた物語の作成などのタスクに優れています。そのパフォーマンスは、さまざまな画像-テキスト理解ベンチマークにおいて、オリジナルのクローズドソースFlamingoモデルに匹敵します。このモデルは、Wikipedia、Public Multimodal Dataset、LAIONなどの公開されているデータセットと、OBELICSと呼ばれる新たに作成された115Bトークンのデータセット(1億4100万のインターリーブされた画像-テキストWebドキュメントで構成)の混合データでトレーニングされました。
開発チームは、マルチモーダルAIシステムにおけるオープンリサーチの促進にコミットしています。IDEFICSは、OpenFlamingoのような他のオープン再現版を補完する、AIコミュニティにとって堅牢な基盤となることを目指しています。プロジェクトの倫理憲章は、自己批判、透明性、公平性を優先する決定を導きました。ユーザーは、デモ、モデルカード、データセットカードを探索し、これらのモデルの継続的な改善と大規模マルチモーダルAIへのアクセスを支援するためにフィードバックを提供するよう奨励されています。
IDEFICS Visual Language Modelのハイライト
オープンアクセス可能なビジュアル言語モデル
最先端の機能を再現
インターリーブされた画像とテキスト入力を受け付ける
テキスト出力を生成する
プロプライエタリモデルに匹敵するパフォーマンス
9Bおよび80Bのパラメータサイズで利用可能
ベースバージョンとインストラクトバージョンを提供
公開されているデータとモデルでトレーニング済み
マルチモーダルAIの研究をサポート
レッドチーミングによる倫理評価を含む
トレーニングデータセットのインタラクティブな可視化が可能
IDEFICS Visual Language Modelをはじめる
モデルへのアクセス: Hugging Face HubでIDEFICSモデルを見つけます。
環境設定: 最新のtransformersバージョンがインストールされていることを確認します。
モデルとプロセッサのロード: 必要なクラスをインポートし、目的のIDEFICSチェックポイントをロードします。
入力の準備: インターリーブされたテキスト文字列と画像URLまたはPIL Imageを含むプロンプトを作成します。
API経由での統合: 準備された入力と生成引数を使用して`generate`メソッドを使用します。
出力のデコード: 生成されたIDを処理して、人間が読めるテキストを取得します。
推論の実行: マルチモーダル入力に基づいてテキストを生成するためにコードを実行します。
IDEFICS Visual Language Modelの使用例
- 画像質問応答
- 視覚コンテンツの説明
- マルチモーダルストーリーテリング
- オープンリサーチ基盤
- AIの透明性
- AIの民主化







