Deskripsi
nomic-embed-text-v2-moe adalah model embedding teks Mixture of Experts (MoE) multibahasa yang dirancang untuk unggul dalam tugas pengambilan multibahasa. Model ini mendukung sekitar 100 bahasa dan dilatih pada lebih dari 1,6 miliar pasangan, menjadikannya sangat efektif untuk berbagai aplikasi linguistik. Model ini menawarkan dimensi embedding yang fleksibel, memanfaatkan Matryoshka Embeddings untuk mencapai pengurangan biaya penyimpanan hingga tiga kali lipat dengan penurunan kinerja yang minimal.
Arsitektur nomic-embed-text-v2-moe mencakup total 475 juta parameter, dengan 305 juta aktif selama inferensi. Model ini memiliki konfigurasi MoE dengan delapan ahli dan routing top-2, memungkinkan pemrosesan yang efisien dan kinerja tinggi. Panjang urutan maksimum model ini adalah 512 token, dan mendukung dimensi embedding yang berkisar dari 768 hingga 256.
nomic-embed-text-v2-moe sepenuhnya open-source, dengan bobot model, kode, dan data pelatihan tersedia untuk penggunaan publik. Transparansi ini memastikan reproduktifitas dan memfasilitasi penelitian dan pengembangan lebih lanjut. Model ini telah menunjukkan kinerja yang superior pada tolok ukur seperti BEIR dan MIRACL, mengungguli model dalam kelas parameter yang sama dan tetap kompetitif dengan model yang lebih besar.
Meskipun memiliki banyak keunggulan, pengguna harus menyadari beberapa keterbatasan. Kinerja dapat bervariasi di berbagai bahasa, dan kebutuhan sumber daya dapat lebih tinggi dibandingkan model padat tradisional karena arsitektur MoE. Selain itu, pengguna harus mengaktifkan trust_remote_code=True saat memuat model untuk memanfaatkan implementasi arsitektur kustom.
Secara keseluruhan, nomic-embed-text-v2-moe adalah alat yang kuat untuk tugas embedding teks multibahasa, menawarkan fleksibilitas, efisiensi, dan kinerja tinggi untuk berbagai aplikasi.
Sorotan nomic-embed-text-v2-moe
Kinerja multibahasa yang canggih
Mendukung sekitar 100 bahasa
Dilatih pada lebih dari 1,6 miliar pasangan
Dimensi embedding yang fleksibel
Bobot model dan kode open-source
Arsitektur Mixture of Experts
Penyimpanan efisien dengan Matryoshka Embeddings
Kinerja tinggi pada tolok ukur BEIR dan MIRACL
Memulai dengan nomic-embed-text-v2-moe
Akses halaman: Kunjungi halaman model Hugging Face
Muat model: Gunakan SentenceTransformers atau Transformers
Konfigurasi lingkungan: Siapkan GPU untuk kinerja terbaik
Integrasi: Gunakan prefiks instruksi tugas untuk kueri dan dokumen
Fine-tune: Sesuaikan dimensi embedding untuk kebutuhan spesifik
Kasus Penggunaan nomic-embed-text-v2-moe
- Pengambilan Multibahasa
- Embedding Teks
- Analisis Data
- Pemrosesan Bahasa
- Penelitian dan Pengembangan







