Langsung ke konten utama
ToolPotion

Jina Embeddings v3

Jina Embeddings v3 adalah model embedding teks multibahasa dan multi-tugas yang dirancang untuk berbagai aplikasi NLP. Model ini mendukung urutan input yang panjang dan embedding spesifik tugas, menjadikannya serbaguna untuk berbagai kasus penggunaan.

Lihat Model
Bagikan

Deskripsi

Jina Embeddings v3 adalah model embedding teks multibahasa yang canggih yang dikembangkan oleh Jina AI. Model ini dirancang untuk memenuhi berbagai aplikasi pemrosesan bahasa alami (NLP). Model ini didasarkan pada arsitektur Jina-XLM-RoBERTa dan menggabungkan Rotary Position Embeddings (RoPE), yang memungkinkannya menangani urutan input panjang hingga 8192 token. Kemampuan ini sangat bermanfaat untuk aplikasi yang memerlukan pemrosesan teks yang luas.

Model ini memiliki lima adaptor LoRA, yang memungkinkan generasi embedding spesifik tugas secara efisien. Pengguna dapat menyesuaikan embedding untuk berbagai tugas, termasuk kueri pengambilan, embedding pasal, pengelompokan, klasifikasi, dan pencocokan teks. Fleksibilitas ini membuat Jina Embeddings v3 cocok untuk tugas pengambilan asimetris, aplikasi pengelompokan dan peringkat ulang, tugas klasifikasi, dan tugas yang mengukur kesamaan teks.

Jina Embeddings v3 mendukung Matryoshka Embeddings, menawarkan ukuran embedding yang fleksibel mulai dari 32 hingga 1024. Fitur ini memungkinkan pengguna untuk memotong embedding agar sesuai dengan kebutuhan aplikasi tertentu. Model ini telah disetel untuk 30 bahasa, termasuk Arab, Cina, Inggris, Prancis, Jerman, Hindi, Jepang, Korea, dan Spanyol, di antara bahasa lainnya.

Pembaruan penting dalam model ini adalah penyelesaian bug dalam fungsi encode, yang memastikan normalisasi embedding yang dipotong secara konsisten. Pengguna disarankan untuk menerapkan mean pooling saat mengintegrasikan model, karena pendekatan ini menghasilkan embedding kalimat berkualitas tinggi. Model ini dapat digunakan melalui Jina Embedding API atau langsung melalui paket Transformers.

Jina Embeddings v3 kompatibel dengan GPU yang mendukung FlashAttention-2, seperti GPU Ampere, Ada, atau Hopper. Model ini dilisensikan di bawah CC BY-NC 4.0, dengan pertanyaan penggunaan komersial diarahkan ke Jina AI. Model ini telah melihat penggunaan yang signifikan, dengan lebih dari 2 juta unduhan bulan lalu, dan terdaftar di platform AWS dan Azure.

Sorotan Jina Embeddings v3

  • Dukungan multibahasa untuk 30 bahasa

  • Panjang urutan yang diperpanjang hingga 8192 token

  • Embedding spesifik tugas dengan adaptor LoRA

  • Matryoshka Embeddings untuk ukuran yang fleksibel

  • Mean pooling untuk embedding kalimat berkualitas tinggi

  • Kompatibilitas dengan GPU FlashAttention-2

  • Dukungan fine-tuning dengan SentenceTransformerTrainer

  • Inferensi ONNX untuk pemrosesan yang efisien

  • Perbaikan bug untuk normalisasi fungsi encode

  • Lisensi CC BY-NC 4.0

Memulai dengan Jina Embeddings v3

  1. Akses halaman: Kunjungi huggingface.co/jinaai/jina-embeddings-v3

  2. Muat model: Gunakan AutoModel.from_pretrained

  3. Konfigurasi lingkungan: Pastikan kompatibilitas GPU

  4. Integrasi: Terapkan mean pooling untuk embedding

  5. Fine-tune: Gunakan SentenceTransformerTrainer untuk tugas

Kasus Penggunaan Jina Embeddings v3

  • Pengambilan Teks
  • Klasifikasi Teks
  • Pengelompokan
  • Pencocokan Teks
  • Pemrosesan Multibahasa

FAQ dari Jina Embeddings v3

From Jina AI

Ulasan Jina Embeddings v3

Memuat...

Alat AI Populer Seperti Jina Embeddings v3

nomic-embed-text-v2-moe adalah model embedding teks Mixture of Experts multibahasa yang canggih. Model ini mendukung sekitar 100 bahasa dan unggul dalam tugas pengambilan…

Model AI & LLM

BAAI/bge-large-en-v1.5 adalah model embedding canggih yang dirancang untuk model bahasa yang ditingkatkan dengan pengambilan. Model ini meningkatkan kemampuan pengambilan dan…

UnggulanModel AI & LLM

BAAI/bge-small-en-v1.5 adalah model embedding skala kecil yang dirancang untuk tugas model bahasa yang ditingkatkan dengan pengambilan. Model ini menawarkan kinerja yang…

UnggulanModel AI & LLM

Model intfloat multilingual-e5-large adalah alat AI yang kuat dirancang untuk embedding teks multibahasa. Model ini mendukung 100 bahasa dan dioptimalkan untuk tugas seperti…

Model AI & LLM

Longformer Base 4096 adalah model transformer yang dirancang untuk memproses dokumen panjang. Model ini dibangun di atas RoBERTa, yang telah dilatih sebelumnya pada urutan yang…

Model AI & LLM

MUSE adalah pustaka Python untuk membuat embedding kata multibahasa, mendukung metode unsupervised dan supervised. Pustaka ini menyelaraskan embedding fastText ke dalam ruang umum…

Model AI & LLM

Qwen1.5-110B adalah model bahasa berbasis transformer yang menawarkan peningkatan kinerja yang signifikan, dukungan multibahasa, dan panjang konteks stabil 32K. Ideal untuk…

Model AI & LLM

BAAI/bge-reranker-v2-m3 adalah model reranker ringan dan multibahasa yang dirancang untuk inferensi cepat dan penyebaran yang mudah. Model ini menghasilkan skor kesamaan untuk…

Model AI & LLM