Deskripsi
Adept merilis Fuyu-8B, versi ringkas dari model AI multimodal yang mendukung produk mereka, menjadikannya tersedia di HuggingFace di bawah lisensi CC-BY-NC. Model ini patut diperhatikan karena arsitektur dan prosedur pelatihannya yang jauh lebih sederhana dibandingkan dengan model multimodal lainnya, yang meningkatkan pemahaman, skalabilitas, dan kemudahan penerapan.
Fuyu-8B direkayasa dari awal untuk agen digital, memungkinkannya menangani resolusi gambar arbitrer. Kemampuan ini sangat penting untuk tugas-tugas seperti menjawab pertanyaan tentang grafik dan diagram, menanggapi kueri berbasis UI, dan melakukan lokalisasi terperinci pada gambar layar. Keunggulan utamanya adalah kecepatannya, memberikan respons untuk gambar besar dalam waktu kurang dari 100 milidetik. Meskipun dioptimalkan untuk kasus penggunaan spesifik Adept, Fuyu-8B menunjukkan kinerja yang kuat pada tolok ukur pemahaman gambar standar seperti visual question-answering dan natural image captioning.
Arsitekturnya menghindari pengkode gambar terpisah, sebaliknya memproyeksikan tambalan gambar secara linier langsung ke lapisan pertama transformer. Ini melewati kebutuhan untuk pencarian embedding dan menyederhanakan pelatihan dan inferensi. Model memperlakukan token gambar mirip dengan token teks, mendukung ukuran gambar variabel dan menghilangkan persyaratan untuk tahap pelatihan resolusi tinggi dan rendah yang terpisah. Pendekatan yang disederhanakan ini memungkinkan perhatian kausal dan tanpa pooling, memperlakukan dekoder transformer sebagai transformer gambar.
Meskipun Fuyu-8B adalah rilis model mentah yang memerlukan fine-tuning untuk aplikasi tertentu, kinerjanya pada tolok ukur seperti VQAv2, OKVQA, COCO Captions, dan AI2D kompetitif, bahkan terhadap model yang lebih besar. Adept menyoroti bahwa model internal mereka, yang dibangun di atas arsitektur Fuyu, memiliki kemampuan canggih seperti OCR yang andal pada gambar beresolusi tinggi, lokalisasi terperinci dari elemen teks dan UI, dan kemampuan untuk menjawab pertanyaan tentang antarmuka pengguna, menawarkan sekilas tentang pengembangan produk di masa depan.
Desain Fuyu-8B membuatnya sangat cocok untuk pekerja pengetahuan dan aplikasi yang membutuhkan pemahaman visual mendalam dan interaksi dengan antarmuka digital. Pembukaan sumber model ini bertujuan untuk mendorong inovasi dan pengembangan komunitas di bidang agen AI dan AI multimodal.
Sorotan Arsitektur Multimodal Fuyu-8B
Model AI multimodal untuk agen digital
Arsitektur yang disederhanakan untuk kemudahan pemahaman, penskalaan, dan penerapan
Mendukung resolusi gambar arbitrer
Waktu respons cepat untuk gambar besar (di bawah 100ms)
Berkinerja baik pada tolok ukur pemahaman gambar standar
Dirancang untuk pemahaman grafik, diagram, dan elemen UI
Sumber terbuka di bawah lisensi CC-BY-NC
Tersedia di HuggingFace
Tidak ada pengkode gambar terpisah; tambalan gambar diproyeksikan langsung ke transformer
Memperlakukan token gambar seperti token teks untuk ukuran gambar variabel
Memerlukan fine-tuning untuk kasus penggunaan spesifik
Memulai dengan Arsitektur Multimodal Fuyu-8B
Akses Model: Unduh bobot Fuyu-8B dari HuggingFace.
Siapkan Lingkungan: Siapkan lingkungan Python Anda dengan pustaka yang diperlukan.
Integrasikan melalui API: Muat model dan tokenizer untuk inferensi.
Proses Gambar: Konversi gambar menjadi urutan token yang kompatibel dengan model.
Ajukan Pertanyaan ke Model: Masukkan token gambar dan prompt teks untuk mendapatkan respons.
Fine-tune: Sesuaikan model dengan persyaratan aplikasi spesifik Anda.
Kasus Penggunaan Arsitektur Multimodal Fuyu-8B
- Pengembangan Agen AI
- Visual Question Answering
- Interaksi UI
- Analisis Dokumen
- Image Captioning
- Interpretasi Grafik dan Bagan





