Deskripsi
Repositori kode riset UNITER, yang disajikan dalam makalah ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning', menawarkan seperangkat alat yang komprehensif untuk riset AI multimodal. Repositori ini memfasilitasi penyempurnaan dan inferensi untuk berbagai tugas visual-dan-bahasa, termasuk Visual Question Answering (VQA), Visual Commonsense Reasoning (VCR), SNLI-VE (Visual Entailment), Image-Text Retrieval untuk dataset seperti COCO dan Flickr30k, dan Referring Expression Comprehensions (RefCOCO, RefCOCO+, RefCOCO-g).
UNITER dibangun di atas kerangka kerja pembelajaran representasi gambar-teks universal. Kode ini mendukung checkpoint yang telah dilatih sebelumnya untuk UNITER-base dan UNITER-large, dengan opsi untuk pra-pelatihan dalam domain. Repositori ini mencakup skrip untuk pra-pemrosesan data, pelatihan model, dan inferensi. Ini memanfaatkan pustaka eksternal seperti PyTorch, HuggingFace Transformers, OpenNMT, dan Nvidia's DeepLearningExamples, dengan fitur gambar diekstraksi menggunakan BUTD.
Untuk kemudahan reproduksi, gambar Docker disediakan, yang memerlukan versi driver NVIDIA dan Docker tertentu. Pengaturan melibatkan pemasangan direktori kode sumber dan data ke dalam kontainer. Repositori merinci panduan memulai cepat untuk tugas-tugas seperti NLVR2, mendemonstrasikan unduhan data, peluncuran kontainer Docker, penyempurnaan, dan prosedur inferensi/evaluasi. Kustomisasi didukung melalui argumen baris perintah dan file konfigurasi JSON, dengan opsi untuk pelatihan multi-GPU menggunakan Horovod.
Proyek ini juga menguraikan langkah-langkah untuk tugas hilir seperti VQA, VCR (termasuk opsi pra-pelatihan tahap kedua), Visual Entailment, Image-Text Retrieval (baik zero-shot maupun penyempurnaan dengan hard negative untuk Flickr30k dan COCO), Referring Expressions, dan pra-pelatihan dalam domain. Pengguna dipandu tentang cara mengunduh dataset tertentu dan menjalankan skrip pelatihan dan inferensi yang sesuai. Repositori ini dilisensikan di bawah lisensi MIT.
Sorotan Kode Riset UNITER
Kode riset resmi untuk makalah ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning'
Mendukung penyempurnaan untuk NLVR2, VQA, VCR, SNLI-VE, Image-Text Retrieval, dan Referring Expressions
Menyediakan checkpoint yang telah dilatih sebelumnya untuk model UNITER-base dan UNITER-large
Mencakup skrip untuk pra-pemrosesan data, pelatihan model, dan inferensi
Menawarkan gambar Docker untuk reproduksi dan pengaturan lingkungan yang disederhanakan
Mendukung pelatihan multi-GPU melalui Horovod
Mencakup kode untuk penyempurnaan zero-shot dan Image-Text Retrieval
Memfasilitasi pra-pelatihan dalam domain dan pra-pelatihan tahap kedua VCR
Memulai dengan Kode Riset UNITER
Unduh checkpoint yang telah dilatih sebelumnya dan data spesifik tugas menggunakan skrip bash yang disediakan.
Luncurkan kontainer Docker untuk lingkungan yang konsisten dan dapat direproduksi.
Integrasikan pelatihan model dengan menjalankan skrip penyempurnaan dengan konfigurasi kustom.
Lakukan inferensi pada tugas hilir menggunakan skrip inferensi khusus.
Evaluasi kinerja model menggunakan skrip evaluasi yang disediakan atau dengan mengirimkan hasil ke papan peringkat.
Sesuaikan opsi pelatihan melalui argumen baris perintah atau file konfigurasi JSON.
Kasus Penggunaan Kode Riset UNITER
- Visual Question Answering
- Visual Commonsense Reasoning
- Image-Text Retrieval
- Referring Expression Comprehension
- Visual Entailment
- Multimodal Pre-training







