Zum Hauptinhalt springen
ToolPotion

UNITER Research Code

UNITER ist ein Repository für Forschungscode für die ECCV 2020-Arbeit 'UNITER: UNiversal Image-TExt Representation Learning'. Es bietet Code für Finetuning und Inferenz für verschiedene Vision-and-Language-Aufgaben, einschließlich VQA, VCR und Bild-Text-Retrieval. Vortrainierte Checkpoints sind für UNITER-base und UNITER-large verfügbar.

URL besuchen

Beschreibung

Das UNITER-Repository für Forschungscode, vorgestellt in der ECCV 2020-Arbeit 'UNITER: UNiversal Image-TExt Representation Learning', bietet einen umfassenden Satz von Werkzeugen für die multimodale KI-Forschung. Dieses Repository erleichtert das Finetuning und die Inferenz für eine Reihe von Vision-and-Language-Aufgaben, einschließlich Visual Question Answering (VQA), Visual Commonsense Reasoning (VCR), SNLI-VE (Visual Entailment), Image-Text Retrieval für Datensätze wie COCO und Flickr30k sowie Referring Expression Comprehensions (RefCOCO, RefCOCO+, RefCOCO-g).

UNITER basiert auf einem universellen Framework für das Lernen von Bild-Text-Repräsentationen. Der Code unterstützt sowohl vortrainierte Checkpoints für UNITER-base als auch für UNITER-large, mit Optionen für das In-Domain-Pre-Training. Das Repository enthält Skripte für die Datenvorverarbeitung, das Modelltraining und die Inferenz. Es nutzt externe Bibliotheken wie PyTorch, HuggingFace Transformers, OpenNMT und Nvidia's DeepLearningExamples, wobei Bildmerkmale mit BUTD extrahiert werden.

Zur Vereinfachung der Reproduzierbarkeit wird ein Docker-Image bereitgestellt, das spezifische NVIDIA-Treiber- und Docker-Versionen erfordert. Die Einrichtung umfasst das Mounten von Quellcode- und Datenverzeichnissen in den Container. Das Repository beschreibt Schnellstartanleitungen für Aufgaben wie NLVR2, die den Download von Daten, den Start des Docker-Containers, das Finetuning sowie Inferenz-/Evaluierungsverfahren demonstrieren. Die Anpassung wird über Befehlszeilenargumente und JSON-Konfigurationsdateien unterstützt, mit Optionen für das Multi-GPU-Training mit Horovod.

Das Projekt beschreibt auch Schritte für nachgelagerte Aufgaben wie VQA, VCR (einschließlich einer Option für ein zweistufiges Pre-Training), Visual Entailment, Image-Text Retrieval (sowohl Zero-Shot als auch Finetuning mit Hard Negatives für Flickr30k und COCO), Referring Expressions und In-Domain-Pre-Training. Benutzer werden beim Herunterladen spezifischer Datensätze und beim Ausführen der entsprechenden Trainings- und Inferenzskripte angeleitet. Das Repository ist unter der MIT-Lizenz lizenziert.

UNITER Research Code im Überblick

  • Offizieller Forschungscode für die ECCV 2020-Arbeit 'UNITER: UNiversal Image-TExt Representation Learning'

  • Unterstützt Finetuning für NLVR2, VQA, VCR, SNLI-VE, Image-Text Retrieval und Referring Expressions

  • Bietet vortrainierte Checkpoints für UNITER-base und UNITER-large Modelle

  • Enthält Skripte für Datenvorverarbeitung, Modelltraining und Inferenz

  • Bietet ein Docker-Image für vereinfachte Reproduktion und Umgebungssetup

  • Unterstützt Multi-GPU-Training über Horovod

  • Enthält Code für Zero-Shot- und Finetuning von Image-Text Retrieval-Aufgaben

  • Ermöglicht In-Domain-Pre-Training und zweistufiges Pre-Training für VCR

Erste Schritte mit UNITER Research Code

  1. Laden Sie vortrainierte Checkpoints und aufgaben-spezifische Daten mit den bereitgestellten Bash-Skripten herunter.

  2. Starten Sie den Docker-Container für eine konsistente und reproduzierbare Umgebung.

  3. Integrieren Sie das Modelltraining, indem Sie Finetuning-Skripte mit benutzerdefinierten Konfigurationen ausführen.

  4. Führen Sie die Inferenz für nachgelagerte Aufgaben mit dedizierten Inferenzskripten durch.

  5. Bewerten Sie die Modellleistung mit den bereitgestellten Evaluationsskripten oder durch Einreichung von Ergebnissen auf Leaderboards.

  6. Passen Sie Trainingsoptionen über Befehlszeilenargumente oder JSON-Konfigurationsdateien an.

UNITER Research Code's Anwendungsfälle

  • Visuelle Beantwortung von Fragen
  • Visuelles Common-Sense-Reasoning
  • Bild-Text-Retrieval
  • Referring Expression Comprehension
  • Visuelles Entailment
  • Multimodales Pre-Training

FAQ von UNITER Research Code

UNITER Research Code Bewertungen

Wird geladen...

Beliebte KI-Tools wie UNITER Research Code

Phi-4-reasoning-vision-15B ist ein multimodales KI-Modell, das von Microsoft entwickelt wurde und für Aufgaben konzipiert ist, die ein Verständnis von Vision und Sprache sowie…

EmpfohlenKI-Modelle & LLMs

KI-Modelle

Oscar und VinVL sind fortschrittliche KI-Modelle für Vision-Language-Aufgaben. Oscar nutzt Object-Semantics Alignment für das Pre-training und erzielt State-of-the-Art-Ergebnisse.…

KI-Modelle & LLMs

KI-Modelle

MiniGPT-4 ist ein KI-Modell, das das Verständnis von Sprache und Bild verbessert, indem es einen fixierten visuellen Encoder mit einem großen Sprachmodell abgleicht. Es kann…

KI-Modelle & LLMs

KI-Modelle

LLaVA ist ein großes multimodales Modell, das einen Vision Encoder mit einem Sprachmodell für allgemeine visuelle und sprachliche Verständnisfähigkeiten kombiniert. Es zeichnet…

KI-Modelle & LLMs

LLaVA ist ein Modell für visuelles Instruction Tuning, das große Sprach- und Bildfähigkeiten kombiniert. Es zielt darauf ab, eine Leistung auf GPT-4V-Niveau zu erreichen und…

KI-Modelle & LLMs

Flamingo ist ein einzelnes visuelles Sprachmodell (VLM) von Google DeepMind, das sich durch Few-Shot-Learning über diverse multimodale Aufgaben auszeichnet. Es verarbeitet…

KI-Modelle & LLMs

Gemini 3.1 Pro ist ein fortschrittliches KI-Modell, das für komplexe Aufgaben und tiefes Denken entwickelt wurde. Es zeichnet sich durch multimodales Verständnis aus, bietet…

EmpfohlenKI-Modelle & LLMs