تخطَّ إلى المحتوى الرئيسي
ToolPotion

Jina Embeddings v3

Jina Embeddings v3 هو نموذج تضمين نصوص متعدد اللغات ومتعدد المهام مصمم لتطبيقات معالجة اللغة الطبيعية المختلفة. يدعم تسلسلات الإدخال الطويلة وتضمينات محددة للمهام، مما يجعله متعدد الاستخدامات لمختلف حالات الاستخدام.

عرض النموذج
مشاركة

الوصف

Jina Embeddings v3 هو نموذج متقدم لتضمين النصوص متعدد اللغات تم تطويره بواسطة Jina AI. تم تصميمه لتلبية مجموعة واسعة من تطبيقات معالجة اللغة الطبيعية (NLP). يعتمد النموذج على بنية Jina-XLM-RoBERTa وي incorporات تضمينات المواقع الدوارة (RoPE)، مما يسمح له بالتعامل مع تسلسلات الإدخال الطويلة حتى 8192 رمزًا. هذه القدرة مفيدة بشكل خاص للتطبيقات التي تتطلب معالجة نصوص واسعة.

يتميز النموذج بخمسة محولات LoRA، مما يمكّن من توليد تضمينات محددة للمهام بكفاءة. يمكن للمستخدمين تخصيص التضمينات لمهام مختلفة، بما في ذلك استعلامات الاسترجاع، وتضمينات المقاطع، والتجميع، والتصنيف، ومطابقة النصوص. تجعل هذه المرونة Jina Embeddings v3 مناسبًا لمهام الاسترجاع غير المتناظرة، وتطبيقات التجميع وإعادة الترتيب، ومهام التصنيف، والمهام التي تقيس تشابه النصوص.

يدعم Jina Embeddings v3 تضمينات ماتريوشكا، مما يوفر أحجام تضمين مرنة تتراوح من 32 إلى 1024. تتيح هذه الميزة للمستخدمين تقصير التضمينات لتناسب احتياجات التطبيقات المحددة. تم ضبط النموذج لـ 30 لغة، بما في ذلك العربية والصينية والإنجليزية والفرنسية والألمانية والهندية واليابانية والكورية والإسبانية، من بين لغات أخرى.

تحديث ملحوظ في النموذج هو إصلاح خطأ في وظيفة التشفير، مما يضمن تطبيعًا متسقًا للتضمينات المقصورة. يُنصح المستخدمون بتطبيق تجميع المتوسط عند دمج النموذج، حيث إن هذه الطريقة تؤدي إلى تضمينات جمل عالية الجودة. يمكن استخدام النموذج عبر واجهة برمجة تطبيقات Jina Embedding أو مباشرة من خلال حزمة Transformers.

Jina Embeddings v3 متوافق مع وحدات معالجة الرسوميات التي تدعم FlashAttention-2، مثل وحدات معالجة الرسوميات Ampere وAda وHopper. يتم ترخيصه بموجب CC BY-NC 4.0، مع توجيه الاستفسارات المتعلقة بالاستخدام التجاري إلى Jina AI. شهد النموذج استخدامًا كبيرًا، حيث تم تنزيله أكثر من 2 مليون مرة في الشهر الماضي، وهو مدرج على منصات AWS وAzure.

أبرز ملامح Jina Embeddings v3

  • دعم متعدد اللغات لـ 30 لغة

  • طول تسلسل ممتد يصل إلى 8192 رمزًا

  • تضمينات محددة للمهام مع محولات LoRA

  • تضمينات ماتريوشكا لأحجام مرنة

  • تجميع المتوسط لتضمينات جمل عالية الجودة

  • توافق مع وحدات معالجة الرسوميات FlashAttention-2

  • دعم الضبط الدقيق مع SentenceTransformerTrainer

  • استدلال ONNX لمعالجة فعالة

  • إصلاح خطأ لتطبيع وظيفة التشفير

  • ترخيص CC BY-NC 4.0

البدء مع Jina Embeddings v3

  1. الوصول إلى الصفحة: زيارة huggingface.co/jinaai/jina-embeddings-v3

  2. تحميل النموذج: استخدام AutoModel.from_pretrained

  3. تكوين البيئة: التأكد من توافق وحدة معالجة الرسوميات

  4. دمج: تطبيق تجميع المتوسط للتضمينات

  5. الضبط الدقيق: استخدام SentenceTransformerTrainer للمهام

حالات استخدام Jina Embeddings v3

  • استرجاع النصوص
  • تصنيف النصوص
  • التجميع
  • مطابقة النصوص
  • المعالجة متعددة اللغات

الأسئلة الشائعة من Jina Embeddings v3

From Jina AI

تقييمات Jina Embeddings v3

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل Jina Embeddings v3

نماذج الذكاء الاصطناعي

nomic-embed-text-v2-moe هو نموذج متقدم لتضمين النصوص متعدد اللغات يعتمد على مزيج من الخبراء. يدعم حوالي 100 لغة ويتفوق في مهام الاسترجاع متعددة اللغات، مما يوفر أبعاد تضمين مرنة…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

BAAI/bge-large-en-v1.5 هو نموذج متقدم للتضمين مصمم لنماذج اللغة المعززة بالاسترجاع. يعزز قدرات الاسترجاع ويدعم مهامًا متنوعة، مما يجعله مناسبًا للتطبيقات في معالجة اللغة الطبيعية…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

BAAI/bge-small-en-v1.5 هو نموذج تضمين صغير الحجم مصمم لمهام نماذج اللغة المعززة بالاسترجاع. يقدم أداءً تنافسياً في تطبيقات معالجة اللغة الطبيعية المختلفة، مما يجعله مناسباً…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

نموذج intfloat multilingual-e5-large هو أداة ذكاء اصطناعي قوية مصممة لتضمين النصوص متعددة اللغات. يدعم 100 لغة ومُحسّن لمهام مثل استرجاع النصوص والتشابه الدلالي، مما يوفر أداءً…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Longformer Base 4096 هو نموذج محول مصمم لمعالجة المستندات الطويلة. يبني على RoBERTa، مدرب مسبقًا على تسلسلات موسعة تصل إلى 4096 رمزًا. يستخدم هذا النموذج آلية انتباه هجينة، تجمع…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

MUSE هي مكتبة Python لإنشاء تضمينات كلمات متعددة اللغات، تدعم كلاً من الطرق غير الخاضعة للإشراف والخاضعة للإشراف. تقوم بمحاذاة تضمينات fastText في مساحة مشتركة وتوفر قواميس ثنائية…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

نموذج Qwen1.5-110B هو نموذج لغوي يعتمد على المحولات ويقدم تحسينات كبيرة في الأداء، ودعم متعدد اللغات، وطول سياق ثابت يبلغ 32K. مثالي لتطبيقات الذكاء الاصطناعي المتقدمة.

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

BAAI/bge-reranker-v2-m3 هو نموذج إعادة ترتيب خفيف الوزن ومتعدد اللغات مصمم للاستدلال السريع وسهولة النشر. يقوم بإخراج درجات التشابه للاستفسارات والمستندات، ويدعم كل من اللغتين…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة