الوصف
Whisper Large V3 Turbo هو نموذج متقدم مصمم للتعرف التلقائي على الكلام (ASR) وترجمة الكلام. تم تطويره بواسطة OpenAI، وهو نسخة معدلة من نموذج Whisper large-v3، حيث تم تقليل عدد طبقات فك التشفير من 32 إلى 4. هذا التخفيض يعزز سرعة النموذج، على الرغم من وجود تنازل طفيف في الجودة. تم تدريب النموذج على أكثر من 5 ملايين ساعة من البيانات المعلّمة، مما يظهر قدرته على التعميم عبر مجموعات بيانات ومجالات مختلفة في إعداد عدم وجود بيانات مسبقة.
النموذج متكامل مع Hugging Face Transformers، مما يسمح للمستخدمين بنسخ ملفات الصوت ذات الطول العشوائي. يدعم عدة ملفات صوتية للنسخ المتوازي، ويمكن للمستخدمين تحديد لغة الصوت المصدر إذا كانت معروفة. يمكن لـ Whisper Large V3 Turbo أداء كل من النسخ والترجمة، حيث تقوم الأخيرة بترجمة الصوت المصدر إلى الإنجليزية.
بالنسبة لنسخ الصوت الطويل، يقدم النموذج خوارزميات متسلسلة ومجزأة. تُفضل الخوارزمية المتسلسلة من أجل الدقة، بينما تكون الخوارزمية المجزأة مثالية للسرعة. يدعم النموذج أيضًا ميزات متقدمة مثل الطوابع الزمنية على مستوى الجمل والكلمات، ويمكن تحسينه أكثر باستخدام تقنيات مثل torch.compile وFlash Attention 2، بشرط أن يدعم الجهاز هذه الميزات.
Whisper Large V3 Turbo مخصص بشكل أساسي للباحثين والمطورين في مجال الذكاء الاصطناعي الذين يعملون على حلول ASR. إنه فعال بشكل خاص في التعرف على الكلام باللغة الإنجليزية ولكنه يمكن أن يُعدل لمزيد من اللغات والمهام. على الرغم من قدراته، يُنصح المستخدمون بتقييم أداء النموذج في سياقات محددة قبل النشر، خاصة في المجالات عالية المخاطر. النموذج غير مناسب للنسخ في الوقت الحقيقي بشكل مباشر ولكنه يمكن استخدامه لبناء تطبيقات تقترب من أداء الوقت الحقيقي.
أبرز ملامح Whisper Large V3 Turbo
التعرف التلقائي على الكلام
ترجمة الكلام
دعم متعدد اللغات
تقليل طبقات فك التشفير للسرعة
التكامل مع Hugging Face Transformers
دعم النسخ الصوتي الطويل
خيارات متقدمة للطوابع الزمنية
قدرات التخصيص
البدء مع Whisper Large V3 Turbo
الوصول إلى الصفحة: زيارة صفحة نموذج Hugging Face
تحميل النموذج: استخدام مكتبة Transformers
تكوين البيئة: تثبيت المكتبات اللازمة
التكامل: استخدام فئة pipeline للنسخ
التخصيص: تخصيص النموذج لمهام محددة
حالات استخدام Whisper Large V3 Turbo
- التعرف على الكلام
- ترجمة الكلام
- الدعم متعدد اللغات
- الطوابع الزمنية
- التخصيص











