メインコンテンツへスキップ
ToolPotion

UNITER Research Code

UNITERは、ECCV 2020の論文「UNITER: UNiversal Image-TExt Representation Learning」の研究コードリポジトリです。VQA、VCR、画像-テキスト検索など、様々なビジョンと言語のタスクにおけるファインチューニングと推論のためのコードを提供します。UNITER-baseおよびUNITER-largeの事前学習済みチェックポイントが利用可能です。

URLを訪問

説明

ECCV 2020の論文「UNITER: UNiversal Image-TExt Representation Learning」で発表されたUNITER研究コードリポジトリは、マルチモーダルAI研究のための包括的なツールセットを提供します。このリポジトリは、Visual Question Answering (VQA)、Visual Commonsense Reasoning (VCR)、SNLI-VE (Visual Entailment)、COCOやFlickr30kなどのデータセットに対する画像-テキスト検索、およびReferring Expression Comprehensions (RefCOCO, RefCOCO+, RefCOCO-g) を含む、一連のビジョンと言語のタスクにおけるファインチューニングと推論を容易にします。

UNITERは、ユニバーサルな画像-テキスト表現学習フレームワーク上に構築されています。このコードは、UNITER-baseとUNITER-largeの両方の事前学習済みチェックポイントをサポートしており、ドメイン内事前学習のオプションも提供します。リポジトリには、データの前処理、モデルのトレーニング、および推論のためのスクリプトが含まれています。PyTorch、HuggingFace Transformers、OpenNMT、NvidiaのDeepLearningExamplesなどの外部ライブラリを活用しており、画像特徴量はBUTDを使用して抽出されます。

再現性を容易にするために、Dockerイメージが提供されており、特定のNVIDIAドライバーとDockerバージョンが必要です。セットアップには、ソースコードとデータディレクトリをコンテナにマウントすることが含まれます。リポジトリは、NLVR2のようなタスクのクイックスタートガイドを詳細に説明しており、データダウンロード、Dockerコンテナの起動、ファインチューニング、および推論/評価手順を示しています。コマンドライン引数とJSON設定ファイルを通じてカスタマイズがサポートされており、Horovodを使用したマルチGPUトレーニングのオプションもあります。

このプロジェクトでは、VQA、VCR(第2段階の事前学習オプションを含む)、Visual Entailment、Image-Text Retrieval(ゼロショットおよびFlickr30kとCOCO用のハードネガティブを使用したファインチューニング)、Referring Expressions、およびドメイン内事前学習などの下流タスクの手順も概説しています。ユーザーは、特定のデータセットのダウンロードと、それぞれのトレーニングおよび推論スクリプトの実行について案内されます。リポジトリはMITライセンスの下で公開されています。

UNITER Research Codeのハイライト

  • ECCV 2020論文「UNITER: UNiversal Image-TExt Representation Learning」の公式研究コード

  • NLVR2、VQA、VCR、SNLI-VE、画像-テキスト検索、およびReferring Expressionsのファインチューニングをサポート

  • UNITER-baseおよびUNITER-largeモデルの事前学習済みチェックポイントを提供

  • データ前処理、モデルトレーニング、および推論のためのスクリプトを含む

  • 再現性と環境設定を簡素化するためのDockerイメージを提供

  • HorovodによるマルチGPUトレーニングをサポート

  • 画像-テキスト検索タスクのゼロショットおよびファインチューニングのためのコードを含む

  • ドメイン内事前学習およびVCR第2段階事前学習を容易にする

UNITER Research Codeをはじめる

  1. 提供されているbashスクリプトを使用して、事前学習済みチェックポイントとタスク固有のデータをダウンロードします。

  2. 一貫性のある再現可能な環境のためにDockerコンテナを起動します。

  3. カスタム設定でファインチューニングスクリプトを実行して、モデルトレーニングを統合します。

  4. 専用の推論スクリプトを使用して、下流タスクで推論を実行します。

  5. 提供されている評価スクリプトを使用するか、リーダーボードに結果を提出してモデルのパフォーマンスを評価します。

  6. コマンドライン引数またはJSON設定ファイルを通じてトレーニングオプションをカスタマイズします。

UNITER Research Codeの使用例

  • Visual Question Answering
  • Visual Commonsense Reasoning
  • Image-Text Retrieval
  • Referring Expression Comprehension
  • Visual Entailment
  • Multimodal Pre-training

UNITER Research CodeのFAQ

UNITER Research Code のレビュー

読み込み中...

UNITER Research Code に似た人気のAIツール

Phi-4-reasoning-vision-15Bは、Microsoftによって開発されたマルチモーダルAIモデルで、視覚と言語の理解および推論能力を必要とするタスクに設計されています。科学的推論やコンピュータ使用エージェントタスクに優れており、さまざまなアプリケーションに適しています。

注目AIモデルとLLM

AI モデル

OscarとVinVLは、ビジョン・言語タスクのための高度なAIモデルです。Oscarはオブジェクト・セマンティクス・アラインメントを用いた事前学習により、最先端の結果を達成しています。VinVLは視覚表現を強化し、様々なビジョン・言語ベンチマークでの性能をさらに向上させています。このプロジェクトでは、再現およびさらなる研究のためのコード、事前学習済みモデル…

AIモデルとLLM

ALIGNは、10億以上の画像とaltテキストのペアから得られるノイズの多いテキスト監視を使用して、視覚および視覚言語表現学習をスケーリングするAIモデルです。クロスモーダル検索および視覚のみのタスクで最先端の結果を達成し、ゼロショット分類およびマルチモーダル検索を可能にします。

AIモデルとLLM

AI モデル

MiniGPT-4は、凍結されたビジュアルエンコーダーと大規模言語モデルを連携させることで、視覚と言語の理解を強化するAIモデルです。詳細な画像説明の生成、ドラフトからのウェブサイト作成、画像に触発された物語の執筆、視覚的な問題の解決など、高度なマルチモーダル能力を発揮します。

AIモデルとLLM

AI モデル

LLaVAは、汎用的な視覚と言語の理解のために、ビジョンエンコーダーと言語モデルを組み合わせた大規模マルチモーダルモデルです。マルチモーダルチャット機能に優れ、GPT-4を模倣し、視覚的指示チューニングを通じてScience QAのようなベンチマークで最先端の精度を達成しています。

AIモデルとLLM

LLaVAは、大規模言語とビジョン機能を組み合わせたビジュアル指示チューニングモデルです。GPT-4Vレベルのパフォーマンスを目指し、マルチモーダルな理解とインタラクションを可能にします。このプロジェクトは、研究者や開発者向けにコード、モデル、リソースを提供します。

AIモデルとLLM

Flamingoは、Google DeepMindが開発した単一のビジュアル言語モデル(VLM)であり、多様なマルチモーダルタスクにおける少数の例からの学習(few-shot learning)に優れています。画像、動画、テキストが混在した入力を処理し、関連する言語出力を生成します。追加のトレーニングなしで、タスク固有の例を最小限で済ませることができます。

AIモデルとLLM

Gemini 3.1 Proは、複雑なタスクと深い推論のために設計された高度なAIモデルです。マルチモーダル理解に優れ、スマートで簡潔な応答を提供し、学習、計画、革新的なアプリケーションの構築に最適です。

注目AIモデルとLLM