تخطَّ إلى المحتوى الرئيسي
ToolPotion

OpenAI Whisper

مميزة

Whisper هو نموذج قوي للأغراض العامة للتعرف على الكلام طورته OpenAI. يتفوق في التعرف على الكلام متعدد اللغات، والترجمة، وتحديد اللغة. تم تدريبه على بيانات صوتية متنوعة، ويقدم نموذجًا واحدًا لمهام معالجة الكلام المختلفة، ليحل محل خطوط الأنابيب التقليدية متعددة المراحل بنهج موحد من تسلسل إلى تسلسل.

زيارة الرابط

الوصف

Whisper هو نموذج قوي مفتوح المصدر للتعرف على الكلام طورته OpenAI، مبني على الإشراف الضعيف واسع النطاق. يعمل كنموذج متعدد المهام ومتعدد الاستخدامات قادر على أداء التعرف على الكلام متعدد اللغات، وترجمة الكلام، وتحديد اللغة. يسمح هذا النهج الموحد لنموذج تسلسل إلى تسلسل واحد من نوع Transformer بمعالجة المهام التي كانت تتطلب تقليديًا مراحل متعددة ومتميزة.

تم تدريب النموذج على مجموعة بيانات واسعة ومتنوعة من الصوت، مما يمكّنه من معالجة أنماط الكلام واللغات المختلفة بفعالية. تمثل بنيته بشكل مشترك مهام معالجة الكلام المختلفة كسلسلة من الرموز (tokens) التي يتنبأ بها المُفكك (decoder). يبسط هذا التصميم خط أنابيب معالجة الكلام بشكل كبير.

يقدم Whisper مجموعة من أحجام النماذج، بما في ذلك متغيرات مخصصة للغة الإنجليزية فقط، مما يوفر مفاضلة بين السرعة والدقة. هذه النماذج مناسبة لمتطلبات الأجهزة والأداء المختلفة. يوفر المشروع تعليمات واضحة للإعداد والاستخدام، بما في ذلك تثبيت حزمة Python والتبعيات الضرورية للنظام مثل ffmpeg. تتوفر واجهات سطر الأوامر وواجهة برمجة تطبيقات Python للتكامل السهل في سير العمل المختلف.

بالنسبة للمطورين والباحثين، يوفر Whisper المرونة في كيفية استخدامه. سواء كان ذلك لنسخ الملفات الصوتية مباشرة عبر سطر الأوامر أو دمج قدراته في تطبيقات Python، فإن النموذج مصمم ليكون سهل الوصول إليه. يشجع المشروع أيضًا على مساهمات المجتمع ومشاركة الأمثلة من خلال مناقشات GitHub الخاصة به.

تشمل القدرات الرئيسية النسخ الدقيق عبر لغات متعددة، وترجمة الكلام إلى اللغة الإنجليزية، وتحديد اللغات المنطوقة. يتيح توفر أحجام نماذج مختلفة، من 'tiny' إلى 'large'، للمستخدمين اختيار الأنسب لاحتياجاتهم الخاصة، مع الموازنة بين الموارد الحسابية والدقة المطلوبة. يقدم نموذج 'turbo' سرعة نسخ محسّنة وأسرع مع الحد الأدنى من التنازل عن الدقة.

تم إصدار المشروع بموجب ترخيص MIT، مما يجعله متاحًا مجانًا للاستخدام البحثي والتجاري على حد سواء. يعمل مستودع GitHub كمركز رئيسي للكود والتوثيق وتفاعل المجتمع، مما يعزز الشفافية والتطوير التعاوني.

الميزات الأساسية لـ OpenAI Whisper

  • التعرف على الكلام متعدد اللغات

  • ترجمة الكلام إلى اللغة الإنجليزية

  • تحديد اللغة

  • بنية تسلسل إلى تسلسل من نوع Transformer

  • أحجام نماذج متعددة (tiny, base, small, medium, large, turbo)

  • متغيرات نماذج للغة الإنجليزية فقط

  • واجهة سطر الأوامر

  • واجهة برمجة تطبيقات Python للتكامل

  • مفتوح المصدر بموجب ترخيص MIT

  • تم تدريبه على بيانات صوتية متنوعة واسعة النطاق

البدء مع OpenAI Whisper

  1. استنساخ: استنسخ مستودع Whisper من GitHub.

  2. تثبيت التبعيات: قم بتثبيت تبعيات Python باستخدام pip، بما في ذلك tiktoken من OpenAI و ffmpeg.

  3. التكوين: تأكد من تثبيت Rust إذا لم تكن العجلات المُعدة مسبقًا لـ tiktoken متاحة.

  4. التنفيذ: استخدم واجهة سطر الأوامر أو واجهة برمجة تطبيقات Python لنسخ، أو ترجمة، أو اكتشاف اللغة في الملفات الصوتية.

حالات استخدام OpenAI Whisper

  • نسخ الصوت
  • ترجمة الكلام
  • تحديد اللغة
  • اكتشاف نشاط الصوت
  • تحليل المحتوى
  • أدوات إمكانية الوصول
  • تكامل المطورين

الأسئلة الشائعة من OpenAI Whisper

تقييمات OpenAI Whisper

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل OpenAI Whisper

Whisper-large-v3 هو نموذج متقدم للتعرف التلقائي على الكلام وترجمة الكلام، تم تدريبه على أكثر من 5 ملايين ساعة من البيانات. يقدم أداءً محسنًا عبر عدة لغات ومصمم للمطورين والباحثين…

مميزةأدوات التفريغ النصي بالذكاء الاصطناعي

مستودعات GitHub للذكاء الاصطناعي

StableLM هي سلسلة من نماذج اللغة مفتوحة المصدر التي طورتها Stability AI. يستضيف مستودع GitHub هذا التطوير المستمر، ويوفر الوصول إلى نقاط فحص مختلفة مثل StableLM-3B-4E1T و…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Funnel-Transformer هو نموذج ذكاء اصطناعي يضغط الحالات المخفية لتقليل تكلفة الحساب. يسمح بنماذج أعمق أو أوسع بنفس عدد العمليات الحسابية (FLOPs) ويمكنه استعادة تمثيلات على مستوى…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

AI Hugging Face

BLOOM هو نموذج لغوي كبير متعدد اللغات يعتمد على التوليد الذاتي تم تطويره بواسطة BigScience. يقوم بإنشاء نصوص متماسكة بـ 46 لغة و13 لغة برمجة، مما يمكّن من تطبيقات متنوعة في معالجة…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

تطبيقات الذكاء الاصطناعي

WhisperUI تقدم خدمة تحويل الكلام إلى نص بأسعار معقولة مدعومة بنموذج Whisper من OpenAI. قم بتحويل الملفات الصوتية بسهولة إلى نص وتنسيق SRT. تدعم أنواعًا صوتية مختلفة وأحجام ملفات…

أدوات التفريغ النصي بالذكاء الاصطناعي

مستودعات GitHub للذكاء الاصطناعي

whisper.cpp هو منفذ لنموذج Whisper من OpenAI تم تنفيذه بلغة C/C++. يتيح للمطورين المساهمة في تطويره على GitHub، مما يسهل التعاون والابتكار في تكنولوجيا التعرف على الصوت.

مميزةأدوات التفريغ النصي بالذكاء الاصطناعي

نماذج الذكاء الاصطناعي

UniLM هو إطار عمل تدريب مسبق ذاتي الإشراف واسع النطاق طورته Microsoft. يمكّن النماذج من التعلم عبر مهام ولغات وأنماط متنوعة، بما في ذلك النص والصورة والصوت. يوفر هذا المشروع نماذج…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

مستودعات GitHub للذكاء الاصطناعي

SGLang هو إطار تقديم عالي الأداء مصمم لنماذج اللغة الكبيرة والنماذج متعددة الوسائط. يوفر قدرات تقديم فعالة تعزز أداء تطبيقات الذكاء الاصطناعي، مما يجعله مناسبًا للمطورين والباحثين…

مميزةMLOps ونشر النماذج