الوصف
نموذج intfloat multilingual-e5-large هو أداة ذكاء اصطناعي متطورة تم تطويرها لتوفير تضمين النصوص متعددة اللغات. يعتمد على إطار عمل xlm-roberta-large وقد تم تدريبه بشكل إضافي على مزيج من مجموعات البيانات متعددة اللغات. يدعم هذا النموذج 100 لغة، على الرغم من أن الأداء قد يختلف بالنسبة للغات ذات الموارد المنخفضة. يتميز بـ 24 طبقة مع حجم تضمين يبلغ 1024، مما يجعله مناسبًا لمهام معالجة النصوص المعقدة.
يمر النموذج بعملية تدريب من مرحلتين. تتضمن المرحلة الأولى التدريب المسبق التبايني مع إشراف ضعيف عبر مجموعات بيانات متنوعة، بما في ذلك mC4 وCC News وWikipedia وغيرها، بإجمالي مليارات من أزواج النصوص. المرحلة الثانية هي التخصيص الخاضع للإشراف باستخدام مجموعات بيانات مثل MS MARCO وNQ وSQuAD، مع التركيز على اللغة الإنجليزية ولغات أخرى.
تظهر نتائج المعايير أن نموذج multilingual-e5-large يحقق متوسط MRR@10 يبلغ 70.5، متفوقًا على النماذج الأصغر في لغات متنوعة. إنه فعال بشكل خاص في مهام مثل استرجاع المقاطع والتشابه الدلالي، حيث يستخدم بادئات محددة مثل 'query:' و'passage:' للحفاظ على الأداء.
النموذج متكامل مع sentence_transformers، ويتطلب إصدارات محددة من الحزم لتحقيق الأداء الأمثل. تم تصميمه للتعامل مع تضمين النصوص بكفاءة، على الرغم من أنه يقوم بتقصير النصوص الطويلة إلى 512 رمزًا. أداء النموذج قوي عبر معايير مختلفة، مما يجعله أداة قيمة للباحثين والمطورين الذين يعملون مع بيانات النصوص متعددة اللغات.
أبرز ملامح intfloat multilingual-e5-large
يدعم 100 لغة
24 طبقة بحجم تضمين 1024
مستند من xlm-roberta-large
تدريب مسبق تبايني مع إشراف ضعيف
تخصيص خاضع للإشراف على مجموعات بيانات متنوعة
أداء عالي في المعايير متعددة اللغات
تكامل مع sentence_transformers
يتعامل مع تضمين النصوص حتى 512 رمزًا
البدء مع intfloat multilingual-e5-large
الوصول إلى الصفحة: زيارة صفحة نموذج Hugging Face
تحميل النموذج: تنزيل وتهيئة النموذج
تهيئة البيئة: إعداد الحزم المطلوبة
التكامل: استخدامه مع sentence_transformers
التخصيص: تطبيق مجموعات بيانات خاضعة للإشراف لمهام محددة
حالات استخدام intfloat multilingual-e5-large
- تضمين النصوص متعددة اللغات
- التشابه الدلالي
- استرجاع المقاطع
- تصنيف النصوص
- استرجاع المعلومات







