Beschreibung
Das UNITER-Repository für Forschungscode, vorgestellt in der ECCV 2020-Arbeit 'UNITER: UNiversal Image-TExt Representation Learning', bietet einen umfassenden Satz von Werkzeugen für die multimodale KI-Forschung. Dieses Repository erleichtert das Finetuning und die Inferenz für eine Reihe von Vision-and-Language-Aufgaben, einschließlich Visual Question Answering (VQA), Visual Commonsense Reasoning (VCR), SNLI-VE (Visual Entailment), Image-Text Retrieval für Datensätze wie COCO und Flickr30k sowie Referring Expression Comprehensions (RefCOCO, RefCOCO+, RefCOCO-g).
UNITER basiert auf einem universellen Framework für das Lernen von Bild-Text-Repräsentationen. Der Code unterstützt sowohl vortrainierte Checkpoints für UNITER-base als auch für UNITER-large, mit Optionen für das In-Domain-Pre-Training. Das Repository enthält Skripte für die Datenvorverarbeitung, das Modelltraining und die Inferenz. Es nutzt externe Bibliotheken wie PyTorch, HuggingFace Transformers, OpenNMT und Nvidia's DeepLearningExamples, wobei Bildmerkmale mit BUTD extrahiert werden.
Zur Vereinfachung der Reproduzierbarkeit wird ein Docker-Image bereitgestellt, das spezifische NVIDIA-Treiber- und Docker-Versionen erfordert. Die Einrichtung umfasst das Mounten von Quellcode- und Datenverzeichnissen in den Container. Das Repository beschreibt Schnellstartanleitungen für Aufgaben wie NLVR2, die den Download von Daten, den Start des Docker-Containers, das Finetuning sowie Inferenz-/Evaluierungsverfahren demonstrieren. Die Anpassung wird über Befehlszeilenargumente und JSON-Konfigurationsdateien unterstützt, mit Optionen für das Multi-GPU-Training mit Horovod.
Das Projekt beschreibt auch Schritte für nachgelagerte Aufgaben wie VQA, VCR (einschließlich einer Option für ein zweistufiges Pre-Training), Visual Entailment, Image-Text Retrieval (sowohl Zero-Shot als auch Finetuning mit Hard Negatives für Flickr30k und COCO), Referring Expressions und In-Domain-Pre-Training. Benutzer werden beim Herunterladen spezifischer Datensätze und beim Ausführen der entsprechenden Trainings- und Inferenzskripte angeleitet. Das Repository ist unter der MIT-Lizenz lizenziert.
UNITER Research Code im Überblick
Offizieller Forschungscode für die ECCV 2020-Arbeit 'UNITER: UNiversal Image-TExt Representation Learning'
Unterstützt Finetuning für NLVR2, VQA, VCR, SNLI-VE, Image-Text Retrieval und Referring Expressions
Bietet vortrainierte Checkpoints für UNITER-base und UNITER-large Modelle
Enthält Skripte für Datenvorverarbeitung, Modelltraining und Inferenz
Bietet ein Docker-Image für vereinfachte Reproduktion und Umgebungssetup
Unterstützt Multi-GPU-Training über Horovod
Enthält Code für Zero-Shot- und Finetuning von Image-Text Retrieval-Aufgaben
Ermöglicht In-Domain-Pre-Training und zweistufiges Pre-Training für VCR
Erste Schritte mit UNITER Research Code
Laden Sie vortrainierte Checkpoints und aufgaben-spezifische Daten mit den bereitgestellten Bash-Skripten herunter.
Starten Sie den Docker-Container für eine konsistente und reproduzierbare Umgebung.
Integrieren Sie das Modelltraining, indem Sie Finetuning-Skripte mit benutzerdefinierten Konfigurationen ausführen.
Führen Sie die Inferenz für nachgelagerte Aufgaben mit dedizierten Inferenzskripten durch.
Bewerten Sie die Modellleistung mit den bereitgestellten Evaluationsskripten oder durch Einreichung von Ergebnissen auf Leaderboards.
Passen Sie Trainingsoptionen über Befehlszeilenargumente oder JSON-Konfigurationsdateien an.
UNITER Research Code's Anwendungsfälle
- Visuelle Beantwortung von Fragen
- Visuelles Common-Sense-Reasoning
- Bild-Text-Retrieval
- Referring Expression Comprehension
- Visuelles Entailment
- Multimodales Pre-Training







