説明
ALIGNは、10億以上の画像とaltテキストのペアからなる大規模データセットを活用することで、堅牢な視覚および視覚言語表現の学習における重要な進歩を表しています。細心の注意を払ってキュレーションおよびラベル付けされたデータセットに依存していた以前の最先端モデルとは異なり、ALIGNは公開されている、たとえノイズが多くても、画像altテキストデータを利用します。このアプローチは、広範なデータ収集およびクリーニング手順を回避し、はるかに大きく強力なモデルのトレーニングを可能にします。
ALIGNの主な革新は、ノイズの多いテキスト監視を受け入れることによる表現学習のスケーリング能力にあります。このモデルは、単純なデュアルエンコーダーアーキテクチャを採用しており、画像エンコーダーとテキストエンコーダーで構成され、対照的な損失を使用してトレーニングされます。この損失関数は、同じバッチ内の一致する画像テキストペアの埋め込みを整列させ、一致しないペアの埋め込みを分離します。データセットの規模、18億の画像テキストペアは、固有のノイズを補償し、優れた表現につながります。
ALIGNは、さまざまなベンチマークで最先端のパフォーマンスを示しています。Flickr30KやMS-COCOなどのクロスモーダル検索タスクでは、ALIGNは、ゼロショットおよびファインチューニングされた設定の両方で、より複雑なクロスアテンションモデルを含む既存の方法を上回っています。視覚のみのタスクでは、ALIGNは、大規模なラベル付きデータでトレーニングされたモデルと比較して、ImageNet分類で競争力のある、または優れた結果を達成しています。ALIGNによって可能になる重要な機能は、ゼロショット画像分類です。これは、埋め込み空間を整列させることにより、特定のクラスのトレーニングデータなしで画像を分類できることを意味します。
モデルによって学習された表現は、強力な画像検索機能も促進します。ALIGNはクロスモーダル検索を可能にし、ユーザーはテキストの説明を使用して画像を検索したり、画像にテキストを検索したり、画像とテキストのクエリを組み合わせた検索を実行したりできます。このマルチモーダルクエリ機能は新しい機能であり、埋め込み空間でのベクトル演算を通じて視覚的アナロジーを見つけたり、画像内の属性を削除/変更したりするような複雑な操作を可能にします。
ALIGNは大きなメリットを提供しますが、著者は責任ある展開の必要性を認識しています。altテキスト内の有害なテキストデータの可能性、公平性、データバランス、および人口統計分布や文化的アイテムに関連するバイアスの軽減に関する考慮事項は、その実用的なアプリケーションにとって非常に重要です。この研究は、入手可能な、たとえノイズが多くても、Webデータから強力な視覚および視覚言語表現を学習するためのスケーラブルで効果的な方法を強調しています。
ALIGN: VisualおよびVision-Language表現学習のスケーリングのハイライト
ノイズの多い画像-altテキストペアから視覚および視覚言語表現を学習します。
18億以上の画像-テキストペアのデータセットを利用します。
対照的な損失を持つデュアルエンコーダーアーキテクチャを採用します。
画像-テキスト検索で最先端のパフォーマンスを達成します。
タスク固有のトレーニングデータなしでゼロショット画像分類を可能にします。
クロスモーダル検索(画像からテキスト、テキストから画像)をサポートします。
画像とテキストのクエリを組み合わせたマルチモーダル画像検索を促進します。
ImageNet分類などの視覚のみの下流タスクで強力なパフォーマンスを示します。
画像エンコーディングにはEfficientNet-L2、テキストエンコーディングにはBERT-largeまでモデルサイズをスケーリングします。
整列された視覚と言語空間に埋め込みを表現します。
ImageNetバリアント全体でのゼロショット分類における堅牢性を示します。
きめ細かく複雑な概念のセマンティック検索を可能にします。
ALIGN: VisualおよびVision-Language表現学習のスケーリングをはじめる
モデルへのアクセス: ALIGNモデルまたはその事前トレーニング済み重みへのアクセスを取得します。
環境設定: 必要なディープラーニングフレームワークとライブラリを構成します。
API経由での統合: モデル推論のために提供されたAPIエンドポイントを利用します。
エンコーダーのロード: 画像エンコーダーとテキストエンコーダーをインスタンス化します。
埋め込みの生成: 画像とテキストをそれぞれのエンコーダーに渡します。
検索の実行: バッチ内の埋め込みのコサイン類似度を使用して画像-テキストマッチングを行います。
画像の分類: クラス名を埋め込みにマッピングしてゼロショット分類を行います。
ALIGN: VisualおよびVision-Language表現学習のスケーリングの使用例
- 画像-テキスト検索
- ゼロショット分類
- マルチモーダル検索
- ビジュアル検索エンジン
- コンテンツ理解
- 画像生成ガイダンス
- クロスモーダルアプリケーション







