説明
ECCV 2020の論文「UNITER: UNiversal Image-TExt Representation Learning」で発表されたUNITER研究コードリポジトリは、マルチモーダルAI研究のための包括的なツールセットを提供します。このリポジトリは、Visual Question Answering (VQA)、Visual Commonsense Reasoning (VCR)、SNLI-VE (Visual Entailment)、COCOやFlickr30kなどのデータセットに対する画像-テキスト検索、およびReferring Expression Comprehensions (RefCOCO, RefCOCO+, RefCOCO-g) を含む、一連のビジョンと言語のタスクにおけるファインチューニングと推論を容易にします。
UNITERは、ユニバーサルな画像-テキスト表現学習フレームワーク上に構築されています。このコードは、UNITER-baseとUNITER-largeの両方の事前学習済みチェックポイントをサポートしており、ドメイン内事前学習のオプションも提供します。リポジトリには、データの前処理、モデルのトレーニング、および推論のためのスクリプトが含まれています。PyTorch、HuggingFace Transformers、OpenNMT、NvidiaのDeepLearningExamplesなどの外部ライブラリを活用しており、画像特徴量はBUTDを使用して抽出されます。
再現性を容易にするために、Dockerイメージが提供されており、特定のNVIDIAドライバーとDockerバージョンが必要です。セットアップには、ソースコードとデータディレクトリをコンテナにマウントすることが含まれます。リポジトリは、NLVR2のようなタスクのクイックスタートガイドを詳細に説明しており、データダウンロード、Dockerコンテナの起動、ファインチューニング、および推論/評価手順を示しています。コマンドライン引数とJSON設定ファイルを通じてカスタマイズがサポートされており、Horovodを使用したマルチGPUトレーニングのオプションもあります。
このプロジェクトでは、VQA、VCR(第2段階の事前学習オプションを含む)、Visual Entailment、Image-Text Retrieval(ゼロショットおよびFlickr30kとCOCO用のハードネガティブを使用したファインチューニング)、Referring Expressions、およびドメイン内事前学習などの下流タスクの手順も概説しています。ユーザーは、特定のデータセットのダウンロードと、それぞれのトレーニングおよび推論スクリプトの実行について案内されます。リポジトリはMITライセンスの下で公開されています。
UNITER Research Codeのハイライト
ECCV 2020論文「UNITER: UNiversal Image-TExt Representation Learning」の公式研究コード
NLVR2、VQA、VCR、SNLI-VE、画像-テキスト検索、およびReferring Expressionsのファインチューニングをサポート
UNITER-baseおよびUNITER-largeモデルの事前学習済みチェックポイントを提供
データ前処理、モデルトレーニング、および推論のためのスクリプトを含む
再現性と環境設定を簡素化するためのDockerイメージを提供
HorovodによるマルチGPUトレーニングをサポート
画像-テキスト検索タスクのゼロショットおよびファインチューニングのためのコードを含む
ドメイン内事前学習およびVCR第2段階事前学習を容易にする
UNITER Research Codeをはじめる
提供されているbashスクリプトを使用して、事前学習済みチェックポイントとタスク固有のデータをダウンロードします。
一貫性のある再現可能な環境のためにDockerコンテナを起動します。
カスタム設定でファインチューニングスクリプトを実行して、モデルトレーニングを統合します。
専用の推論スクリプトを使用して、下流タスクで推論を実行します。
提供されている評価スクリプトを使用するか、リーダーボードに結果を提出してモデルのパフォーマンスを評価します。
コマンドライン引数またはJSON設定ファイルを通じてトレーニングオプションをカスタマイズします。
UNITER Research Codeの使用例
- Visual Question Answering
- Visual Commonsense Reasoning
- Image-Text Retrieval
- Referring Expression Comprehension
- Visual Entailment
- Multimodal Pre-training







