الوصف
nomic-embed-text-v2-moe هو نموذج متقدم لتضمين النصوص متعدد اللغات يعتمد على مزيج من الخبراء (MoE) مصمم للتفوق في مهام الاسترجاع متعددة اللغات. يدعم حوالي 100 لغة وتم تدريبه على أكثر من 1.6 مليار زوج، مما يجعله فعالاً للغاية في التطبيقات اللغوية المتنوعة. يقدم النموذج بعد تضمين مرن، مستخدماً تضمينات ماتريوشكا لتحقيق تقليل يصل إلى ثلاثة أضعاف في تكاليف التخزين مع الحد الأدنى من تدهور الأداء.
تتضمن بنية nomic-embed-text-v2-moe 475 مليون معلمة إجمالية، مع 305 مليون نشطة أثناء الاستدلال. يتميز بتكوين MoE مع ثمانية خبراء وتوجيه من النوع top-2، مما يسمح بمعالجة فعالة وأداء عالٍ. الحد الأقصى لطول التسلسل في النموذج هو 512 رمزاً، ويدعم أبعاد تضمين تتراوح من 768 إلى 256.
nomic-embed-text-v2-moe مفتوح المصدر بالكامل، مع أوزان النموذج، الشيفرة، وبيانات التدريب متاحة للاستخدام العام. تضمن هذه الشفافية إمكانية إعادة الإنتاج وتسهيل المزيد من البحث والتطوير. لقد أظهر النموذج أداءً متفوقاً على المعايير مثل BEIR وMIRACL، متفوقاً على النماذج في نفس فئة المعلمات والحفاظ على التنافسية مع النماذج الأكبر.
على الرغم من قوته، يجب أن يكون المستخدمون على دراية ببعض القيود. قد يختلف الأداء عبر اللغات المختلفة، وقد تكون متطلبات الموارد أعلى من النماذج الكثيفة التقليدية بسبب بنية MoE. بالإضافة إلى ذلك، يجب على المستخدمين تمكين trust_remote_code=True عند تحميل النموذج للاستفادة من تنفيذ البنية المخصصة.
بشكل عام، يعد nomic-embed-text-v2-moe أداة قوية لمهام تضمين النصوص متعددة اللغات، حيث يقدم المرونة والكفاءة والأداء العالي لمجموعة واسعة من التطبيقات.
أبرز ملامح nomic-embed-text-v2-moe
أداء متعدد اللغات متقدم
يدعم حوالي 100 لغة
تم تدريبه على أكثر من 1.6 مليار زوج
أبعاد تضمين مرنة
أوزان نموذج مفتوحة المصدر والشيفرة
بنية مزيج من الخبراء
تخزين فعال مع تضمينات ماتريوشكا
أداء عالٍ على معايير BEIR وMIRACL
البدء مع nomic-embed-text-v2-moe
الوصول إلى الصفحة: زيارة صفحة نموذج Hugging Face
تحميل النموذج: استخدام SentenceTransformers أو Transformers
تكوين البيئة: إعداد GPU للحصول على أفضل أداء
التكامل: استخدام بادئات تعليمات المهام للاستفسارات والمستندات
التخصيص: ضبط أبعاد التضمين وفقًا للاحتياجات المحددة
حالات استخدام nomic-embed-text-v2-moe
- استرجاع متعدد اللغات
- تضمين النصوص
- تحليل البيانات
- معالجة اللغة
- البحث والتطوير







