Aller au contenu principal
ToolPotion

Code de Recherche UNITER

UNITER est un dépôt de code de recherche pour l'article ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning'. Il fournit du code pour le fine-tuning et l'inférence sur diverses tâches vision-langage, y compris VQA, VCR et la récupération d'images-texte. Des checkpoints pré-entraînés sont disponibles pour UNITER-base et UNITER-large.

Visiter l'URL

Description

Le dépôt de code de recherche UNITER, présenté dans l'article ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning', offre un ensemble complet d'outils pour la recherche en IA multimodale. Ce dépôt facilite le fine-tuning et l'inférence pour une gamme de tâches vision-langage, y compris la réponse visuelle aux questions (VQA), le raisonnement de bon sens visuel (VCR), SNLI-VE (inférence visuelle), la récupération d'images-texte pour des ensembles de données tels que COCO et Flickr30k, et la compréhension des expressions de référence (RefCOCO, RefCOCO+, RefCOCO-g).

UNITER est basé sur un framework universel d'apprentissage de représentation image-texte. Le code prend en charge les checkpoints pré-entraînés UNITER-base et UNITER-large, avec des options pour le pré-entraînement dans le domaine. Le dépôt comprend des scripts pour le prétraitement des données, l'entraînement du modèle et l'inférence. Il s'appuie sur des bibliothèques externes telles que PyTorch, HuggingFace Transformers, OpenNMT et DeepLearningExamples de Nvidia, avec des caractéristiques d'image extraites à l'aide de BUTD.

Pour faciliter la reproduction, une image Docker est fournie, nécessitant des versions spécifiques de pilotes NVIDIA et de Docker. La configuration implique le montage des répertoires de code source et de données dans le conteneur. Le dépôt détaille des guides de démarrage rapide pour des tâches telles que NLVR2, démontrant le téléchargement des données, le lancement du conteneur Docker, les procédures de fine-tuning et d'inférence/évaluation. La personnalisation est prise en charge via des arguments de ligne de commande et des fichiers de configuration JSON, avec des options pour l'entraînement multi-GPU à l'aide de Horovod.

Le projet décrit également les étapes pour les tâches en aval telles que VQA, VCR (y compris une option de pré-entraînement de second niveau), l'inférence visuelle, la récupération d'images-texte (à la fois zero-shot et fine-tuning avec des négatifs difficiles pour Flickr30k et COCO), les expressions de référence et le pré-entraînement dans le domaine. Les utilisateurs sont guidés sur le téléchargement d'ensembles de données spécifiques et l'exécution des scripts d'entraînement et d'inférence respectifs. Le dépôt est sous licence MIT.

Points forts de Code de Recherche UNITER

  • Code de recherche officiel pour l'article ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning'

  • Prend en charge le fine-tuning pour NLVR2, VQA, VCR, SNLI-VE, la récupération d'images-texte et les expressions de référence

  • Fournit des checkpoints pré-entraînés pour les modèles UNITER-base et UNITER-large

  • Comprend des scripts pour le prétraitement des données, l'entraînement du modèle et l'inférence

  • Offre une image Docker pour une reproduction et une configuration d'environnement simplifiées

  • Prend en charge l'entraînement multi-GPU via Horovod

  • Inclut du code pour le fine-tuning et le zero-shot des tâches de récupération d'images-texte

  • Facilite le pré-entraînement dans le domaine et le pré-entraînement de second niveau pour VCR

Premiers pas avec Code de Recherche UNITER

  1. Télécharger les checkpoints pré-entraînés et les données spécifiques à la tâche à l'aide des scripts bash fournis.

  2. Lancer le conteneur Docker pour un environnement cohérent et reproductible.

  3. Intégrer l'entraînement du modèle en exécutant les scripts de fine-tuning avec des configurations personnalisées.

  4. Effectuer l'inférence sur les tâches en aval à l'aide de scripts d'inférence dédiés.

  5. Évaluer les performances du modèle à l'aide des scripts d'évaluation fournis ou en soumettant les résultats aux classements.

  6. Personnaliser les options d'entraînement via des arguments de ligne de commande ou des fichiers de configuration JSON.

Cas d'utilisation de Code de Recherche UNITER

  • Réponse Visuelle aux Questions
  • Raisonnement de Bon Sens Visuel
  • Récupération d'Images-Texte
  • Compréhension des Expressions de Référence
  • Inférence Visuelle
  • Pré-entraînement Multimodal

FAQ de Code de Recherche UNITER

Avis sur Code de Recherche UNITER

Chargement...

Outils IA populaires comme Code de Recherche UNITER

Phi-4-reasoning-vision-15B est un modèle IA multimodal développé par Microsoft, conçu pour des tâches nécessitant une compréhension et des capacités de raisonnement en…

En vedetteModèles d'IA et LLM

Modèles IA

Oscar et VinVL sont des modèles d'IA avancés pour les tâches de vision-langage. Oscar utilise le pré-entraînement aligné sur les sémantiques d'objets pour obtenir des résultats de…

Modèles d'IA et LLM

Modèles IA

MiniGPT-4 est un modèle d'IA qui améliore la compréhension vision-langage en alignant un encodeur visuel figé avec un grand modèle linguistique. Il peut générer des descriptions…

Modèles d'IA et LLM

Modèles IA

LLaVA est un grand modèle multimodal qui combine un encodeur de vision avec un modèle de langage pour une compréhension visuelle et linguistique générale. Il excelle dans les…

Modèles d'IA et LLM

LLaVA est un modèle d'ajustement d'instructions visuelles qui combine les capacités des grands modèles de langage et de vision. Il vise à atteindre des performances de niveau…

Modèles d'IA et LLM

Flamingo est un modèle unique de langage visuel (VLM) de Google DeepMind qui excelle dans l'apprentissage à quelques exemples (few-shot learning) pour diverses tâches…

Modèles d'IA et LLM

Gemini 3.1 Pro est un modèle d'IA avancé conçu pour des tâches complexes et un raisonnement approfondi. Il excelle dans la compréhension multimodale, fournissant des réponses…

En vedetteModèles d'IA et LLM