الوصف
Whisper هو نموذج قوي مفتوح المصدر للتعرف على الكلام طورته OpenAI، مبني على الإشراف الضعيف واسع النطاق. يعمل كنموذج متعدد المهام ومتعدد الاستخدامات قادر على أداء التعرف على الكلام متعدد اللغات، وترجمة الكلام، وتحديد اللغة. يسمح هذا النهج الموحد لنموذج تسلسل إلى تسلسل واحد من نوع Transformer بمعالجة المهام التي كانت تتطلب تقليديًا مراحل متعددة ومتميزة.
تم تدريب النموذج على مجموعة بيانات واسعة ومتنوعة من الصوت، مما يمكّنه من معالجة أنماط الكلام واللغات المختلفة بفعالية. تمثل بنيته بشكل مشترك مهام معالجة الكلام المختلفة كسلسلة من الرموز (tokens) التي يتنبأ بها المُفكك (decoder). يبسط هذا التصميم خط أنابيب معالجة الكلام بشكل كبير.
يقدم Whisper مجموعة من أحجام النماذج، بما في ذلك متغيرات مخصصة للغة الإنجليزية فقط، مما يوفر مفاضلة بين السرعة والدقة. هذه النماذج مناسبة لمتطلبات الأجهزة والأداء المختلفة. يوفر المشروع تعليمات واضحة للإعداد والاستخدام، بما في ذلك تثبيت حزمة Python والتبعيات الضرورية للنظام مثل ffmpeg. تتوفر واجهات سطر الأوامر وواجهة برمجة تطبيقات Python للتكامل السهل في سير العمل المختلف.
بالنسبة للمطورين والباحثين، يوفر Whisper المرونة في كيفية استخدامه. سواء كان ذلك لنسخ الملفات الصوتية مباشرة عبر سطر الأوامر أو دمج قدراته في تطبيقات Python، فإن النموذج مصمم ليكون سهل الوصول إليه. يشجع المشروع أيضًا على مساهمات المجتمع ومشاركة الأمثلة من خلال مناقشات GitHub الخاصة به.
تشمل القدرات الرئيسية النسخ الدقيق عبر لغات متعددة، وترجمة الكلام إلى اللغة الإنجليزية، وتحديد اللغات المنطوقة. يتيح توفر أحجام نماذج مختلفة، من 'tiny' إلى 'large'، للمستخدمين اختيار الأنسب لاحتياجاتهم الخاصة، مع الموازنة بين الموارد الحسابية والدقة المطلوبة. يقدم نموذج 'turbo' سرعة نسخ محسّنة وأسرع مع الحد الأدنى من التنازل عن الدقة.
تم إصدار المشروع بموجب ترخيص MIT، مما يجعله متاحًا مجانًا للاستخدام البحثي والتجاري على حد سواء. يعمل مستودع GitHub كمركز رئيسي للكود والتوثيق وتفاعل المجتمع، مما يعزز الشفافية والتطوير التعاوني.
الميزات الأساسية لـ OpenAI Whisper
التعرف على الكلام متعدد اللغات
ترجمة الكلام إلى اللغة الإنجليزية
تحديد اللغة
بنية تسلسل إلى تسلسل من نوع Transformer
أحجام نماذج متعددة (tiny, base, small, medium, large, turbo)
متغيرات نماذج للغة الإنجليزية فقط
واجهة سطر الأوامر
واجهة برمجة تطبيقات Python للتكامل
مفتوح المصدر بموجب ترخيص MIT
تم تدريبه على بيانات صوتية متنوعة واسعة النطاق
البدء مع OpenAI Whisper
استنساخ: استنسخ مستودع Whisper من GitHub.
تثبيت التبعيات: قم بتثبيت تبعيات Python باستخدام pip، بما في ذلك tiktoken من OpenAI و ffmpeg.
التكوين: تأكد من تثبيت Rust إذا لم تكن العجلات المُعدة مسبقًا لـ tiktoken متاحة.
التنفيذ: استخدم واجهة سطر الأوامر أو واجهة برمجة تطبيقات Python لنسخ، أو ترجمة، أو اكتشاف اللغة في الملفات الصوتية.
حالات استخدام OpenAI Whisper
- نسخ الصوت
- ترجمة الكلام
- تحديد اللغة
- اكتشاف نشاط الصوت
- تحليل المحتوى
- أدوات إمكانية الوصول
- تكامل المطورين







