الوصف
Whisper-large-v3 هو نموذج متطور تم تطويره بواسطة OpenAI للتعرف التلقائي على الكلام (ASR) وترجمة الكلام. إنه جزء من عائلة نماذج Whisper، التي تهدف إلى تعزيز وتعميم الذكاء الاصطناعي من خلال مبادرات مفتوحة المصدر والعلم المفتوح. تم بناء النموذج على نفس بنية أسلافه، whisper-large و whisper-large-v2، مع بعض التحسينات التي تعزز من قدراته.
تضمن تدريب whisper-large-v3 أكثر من مليون ساعة من الصوت المسمى بشكل ضعيف و4 ملايين ساعة من الصوت المسمى بشكل زائف، مما أدى إلى نموذج يظهر قدرة قوية على التعميم عبر مجموعات بيانات ومجالات متنوعة. يظهر هذا النموذج انخفاضًا ملحوظًا في الأخطاء—بين 10% إلى 20%—مقارنةً بـ whisper-large-v2، مما يجعله خيارًا أكثر موثوقية للمهام المتعلقة بالتعرف على الكلام والترجمة.
Whisper-large-v3 متوافق مع مكتبة Hugging Face Transformers، مما يسمح للمستخدمين بدمجه بسهولة في تطبيقاتهم. يمكن للمستخدمين نسخ ملفات الصوت ذات الأطوال العشوائية وحتى معالجة ملفات متعددة في وقت واحد. يتنبأ النموذج تلقائيًا بلغة الصوت المصدر، مما يعزز من قابليته للاستخدام في التطبيقات متعددة اللغات. بالإضافة إلى ذلك، يدعم ميزات مثل توقع الطوابع الزمنية لكل من الطوابع الزمنية على مستوى الجملة والكلمة، مما يوفر للمستخدمين رؤى مفصلة حول محتوى الصوت.
بالنسبة للمطورين الذين يتطلعون إلى تحسين الأداء، يقدم whisper-large-v3 تحسينات إضافية في السرعة والذاكرة. يمكن للمستخدمين الاختيار بين الخوارزميات المتسلسلة والمجزأة لنسخ ملفات الصوت الطويلة، اعتمادًا على ما إذا كانت دقة النسخ أو السرعة هي الأولوية. يدعم النموذج أيضًا ميزات متقدمة مثل torch.compile لتسريع الأداء وFlash Attention 2 لتحسين الأداء على وحدات معالجة الرسوميات المتوافقة.
الجمهور المستهدف لـ whisper-large-v3 يشمل الباحثين والمطورين في مجال الذكاء الاصطناعي المهتمين بحلول ASR القوية. بينما أظهر النموذج أداءً قويًا في لغات متعددة، يُنصح المستخدمون بإجراء تقييمات شاملة في سياقاتهم المحددة لضمان الموثوقية. تمتد قدرات النموذج إلى ما هو أبعد من النسخ البسيط، مع تطبيقات محتملة في أدوات الوصول وحلول مبتكرة أخرى في مجال الذكاء الاصطناعي.
أبرز ملامح whisper-large-v3
التعرف التلقائي على الكلام
ترجمة الكلام
دعم متعدد اللغات
توقع الطوابع الزمنية
معالجة دفعات
دعم التخصيص
التوافق مع Hugging Face Transformers
تحسين تقليل الأخطاء
البدء مع whisper-large-v3
الوصول إلى صفحة Hugging Face لـ whisper-large-v3.
تثبيت مكتبة Transformers وأي تبعيات ضرورية.
تحميل نموذج whisper-large-v3 باستخدام فئة pipeline.
نسخ ملفات الصوت عن طريق تمرير مسار الملف إلى pipeline.
استخدام معالجة الدفعات لنسخ ملفات صوت متعددة في وقت واحد.
تمكين توقع الطوابع الزمنية عن طريق تعيين وسيط return_timestamps.
اختيار بين الخوارزميات المتسلسلة أو المجزأة لملفات الصوت الطويلة.
تحسين الأداء باستخدام torch.compile أو Flash Attention 2 إذا كانت مدعومة.
حالات استخدام whisper-large-v3
- نسخ الكلام
- ترجمة الكلام
- أدوات الوصول
- تطبيقات متعددة اللغات
- البحث والتطوير











