Deskripsi
Florence-2 adalah model fondasi visi yang canggih yang dikembangkan oleh Microsoft, dihosting di Hugging Face. Model ini dirancang untuk memajukan representasi terpadu untuk berbagai tugas visi. Model ini menggunakan pendekatan berbasis prompt untuk menangani berbagai tugas visi dan bahasa-visi dengan efisien, seperti penulisan keterangan, deteksi objek, dan segmentasi. Florence-2 memanfaatkan dataset FLD-5B, yang berisi 5,4 miliar anotasi dari 126 juta gambar, untuk unggul dalam pembelajaran multi-tugas.
Arsitektur model ini adalah sequence-to-sequence, memungkinkan kinerja yang baik dalam pengaturan zero-shot dan fine-tuned. Ini adalah model fondasi visi yang kompetitif, mampu menginterpretasikan prompt teks sederhana untuk menjalankan berbagai tugas. Florence-2 telah dilatih sebelumnya dengan panjang konteks 4k, menggunakan hanya 0,1 miliar sampel untuk pelatihan lanjutan, yang mungkin mempengaruhi kualitas pelatihannya.
Kemampuan Florence-2 mencakup menangani tugas seperti pengkondisian keterangan ke frasa, deteksi objek, penulisan keterangan untuk daerah padat, dan OCR dengan output daerah. Kinerja model ini dalam pengaturan zero-shot sangat mencolok, dengan skor CIDEr yang tinggi pada dataset COCO dan NoCaps. Selain itu, Florence-2 telah di-fine-tune pada kumpulan tugas hilir, menghasilkan model seperti Florence-2-base-ft dan Florence-2-large-ft, yang berkinerja baik di berbagai tugas penulisan keterangan dan VQA.
Model ini tersedia dalam berbagai ukuran, termasuk Florence-2-base dengan 0,23 miliar parameter dan Florence-2-large dengan 0,77 miliar parameter. Sumber daya seperti laporan teknis dan Jupyter Notebooks tersedia bagi pengguna untuk memulai dengan model ini. Florence-2 adalah alat yang berharga bagi peneliti dan pengembang yang bekerja pada tugas visi dan bahasa-visi, menawarkan fondasi yang kuat untuk pengembangan dan aplikasi lebih lanjut.
Sorotan Model Florence-2
Model fondasi visi canggih
Pendekatan berbasis prompt
Menangani tugas bahasa-visi
Arsitektur sequence-to-sequence
Pengaturan zero-shot dan fine-tuned
Menggunakan dataset FLD-5B
Mendukung penulisan keterangan dan deteksi objek
OCR dengan output daerah
Memulai dengan Model Florence-2
Akses halaman: Kunjungi halaman model Hugging Face
Muat model: Unduh model Florence-2
Konfigurasi lingkungan: Siapkan ketergantungan yang diperlukan
Integrasi: Gunakan model dalam aplikasi
Fine-tune: Sesuaikan model untuk tugas tertentu
Kasus Penggunaan Model Florence-2
- Penulisan Keterangan Gambar
- Deteksi Objek
- Tugas Bahasa-Visi
- OCR dengan Daerah
- Penulisan Keterangan untuk Daerah Padat









