Deskripsi
Model intfloat multilingual-e5-large adalah alat AI canggih yang dikembangkan untuk menyediakan embedding teks multibahasa. Model ini dibangun di atas kerangka kerja xlm-roberta-large dan telah dilatih lebih lanjut pada campuran dataset multibahasa. Model ini mendukung 100 bahasa, meskipun kinerja dapat bervariasi untuk bahasa dengan sumber daya rendah. Model ini memiliki 24 lapisan dengan ukuran embedding 1024, menjadikannya cocok untuk tugas pemrosesan teks yang kompleks.
Model ini menjalani proses pelatihan dua tahap. Tahap pertama melibatkan pra-pelatihan kontrasif dengan pengawasan lemah di berbagai dataset, termasuk mC4, CC News, Wikipedia, dan lainnya, yang totalnya mencapai miliaran pasangan teks. Tahap kedua adalah fine-tuning terawasi menggunakan dataset seperti MS MARCO, NQ, dan SQuAD, dengan fokus pada bahasa Inggris dan bahasa lainnya.
Hasil benchmark menunjukkan bahwa model multilingual-e5-large mencapai rata-rata MRR@10 sebesar 70.5, mengungguli model yang lebih kecil dalam berbagai bahasa. Model ini sangat efektif dalam tugas seperti pengambilan teks dan kesamaan semantik, di mana ia menggunakan prefiks tertentu seperti 'query:' dan 'passage:' untuk mempertahankan kinerja.
Model ini terintegrasi dengan sentence_transformers, memerlukan versi paket tertentu untuk kinerja optimal. Model ini dirancang untuk menangani embedding teks secara efisien, meskipun memotong teks panjang hingga 512 token. Kinerja model ini kuat di berbagai benchmark, menjadikannya alat yang berharga bagi peneliti dan pengembang yang bekerja dengan data teks multibahasa.
Sorotan intfloat multilingual-e5-large
Mendukung 100 bahasa
24 lapisan dengan ukuran embedding 1024
Diinisialisasi dari xlm-roberta-large
Pra-pelatihan kontrasif dengan pengawasan lemah
Fine-tuning terawasi pada dataset yang beragam
Kinerja tinggi dalam benchmark multibahasa
Integrasi dengan sentence_transformers
Menangani embedding teks hingga 512 token
Memulai dengan intfloat multilingual-e5-large
Akses halaman: Kunjungi halaman model Hugging Face
Muat model: Unduh dan inisialisasi model
Konfigurasi lingkungan: Siapkan paket yang diperlukan
Integrasi: Gunakan dengan sentence_transformers
Fine-tune: Terapkan dataset terawasi untuk tugas tertentu
Kasus Penggunaan intfloat multilingual-e5-large
- Embedding Teks Multibahasa
- Kesamaan Semantik
- Pengambilan Teks
- Klasifikasi Teks
- Pengambilan Informasi







