Description
Le dépôt de code de recherche UNITER, présenté dans l'article ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning', offre un ensemble complet d'outils pour la recherche en IA multimodale. Ce dépôt facilite le fine-tuning et l'inférence pour une gamme de tâches vision-langage, y compris la réponse visuelle aux questions (VQA), le raisonnement de bon sens visuel (VCR), SNLI-VE (inférence visuelle), la récupération d'images-texte pour des ensembles de données tels que COCO et Flickr30k, et la compréhension des expressions de référence (RefCOCO, RefCOCO+, RefCOCO-g).
UNITER est basé sur un framework universel d'apprentissage de représentation image-texte. Le code prend en charge les checkpoints pré-entraînés UNITER-base et UNITER-large, avec des options pour le pré-entraînement dans le domaine. Le dépôt comprend des scripts pour le prétraitement des données, l'entraînement du modèle et l'inférence. Il s'appuie sur des bibliothèques externes telles que PyTorch, HuggingFace Transformers, OpenNMT et DeepLearningExamples de Nvidia, avec des caractéristiques d'image extraites à l'aide de BUTD.
Pour faciliter la reproduction, une image Docker est fournie, nécessitant des versions spécifiques de pilotes NVIDIA et de Docker. La configuration implique le montage des répertoires de code source et de données dans le conteneur. Le dépôt détaille des guides de démarrage rapide pour des tâches telles que NLVR2, démontrant le téléchargement des données, le lancement du conteneur Docker, les procédures de fine-tuning et d'inférence/évaluation. La personnalisation est prise en charge via des arguments de ligne de commande et des fichiers de configuration JSON, avec des options pour l'entraînement multi-GPU à l'aide de Horovod.
Le projet décrit également les étapes pour les tâches en aval telles que VQA, VCR (y compris une option de pré-entraînement de second niveau), l'inférence visuelle, la récupération d'images-texte (à la fois zero-shot et fine-tuning avec des négatifs difficiles pour Flickr30k et COCO), les expressions de référence et le pré-entraînement dans le domaine. Les utilisateurs sont guidés sur le téléchargement d'ensembles de données spécifiques et l'exécution des scripts d'entraînement et d'inférence respectifs. Le dépôt est sous licence MIT.
Points forts de Code de Recherche UNITER
Code de recherche officiel pour l'article ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning'
Prend en charge le fine-tuning pour NLVR2, VQA, VCR, SNLI-VE, la récupération d'images-texte et les expressions de référence
Fournit des checkpoints pré-entraînés pour les modèles UNITER-base et UNITER-large
Comprend des scripts pour le prétraitement des données, l'entraînement du modèle et l'inférence
Offre une image Docker pour une reproduction et une configuration d'environnement simplifiées
Prend en charge l'entraînement multi-GPU via Horovod
Inclut du code pour le fine-tuning et le zero-shot des tâches de récupération d'images-texte
Facilite le pré-entraînement dans le domaine et le pré-entraînement de second niveau pour VCR
Premiers pas avec Code de Recherche UNITER
Télécharger les checkpoints pré-entraînés et les données spécifiques à la tâche à l'aide des scripts bash fournis.
Lancer le conteneur Docker pour un environnement cohérent et reproductible.
Intégrer l'entraînement du modèle en exécutant les scripts de fine-tuning avec des configurations personnalisées.
Effectuer l'inférence sur les tâches en aval à l'aide de scripts d'inférence dédiés.
Évaluer les performances du modèle à l'aide des scripts d'évaluation fournis ou en soumettant les résultats aux classements.
Personnaliser les options d'entraînement via des arguments de ligne de commande ou des fichiers de configuration JSON.
Cas d'utilisation de Code de Recherche UNITER
- Réponse Visuelle aux Questions
- Raisonnement de Bon Sens Visuel
- Récupération d'Images-Texte
- Compréhension des Expressions de Référence
- Inférence Visuelle
- Pré-entraînement Multimodal







