تخطَّ إلى المحتوى الرئيسي
ToolPotion

whisper-large-v3 — Hugging Face

مميزة

Whisper-large-v3 هو نموذج متقدم للتعرف التلقائي على الكلام وترجمة الكلام، تم تدريبه على أكثر من 5 ملايين ساعة من البيانات. يقدم أداءً محسنًا عبر عدة لغات ومصمم للمطورين والباحثين في مجال الذكاء الاصطناعي.

عرض النموذج
مشاركة

الوصف

Whisper-large-v3 هو نموذج متطور تم تطويره بواسطة OpenAI للتعرف التلقائي على الكلام (ASR) وترجمة الكلام. إنه جزء من عائلة نماذج Whisper، التي تهدف إلى تعزيز وتعميم الذكاء الاصطناعي من خلال مبادرات مفتوحة المصدر والعلم المفتوح. تم بناء النموذج على نفس بنية أسلافه، whisper-large و whisper-large-v2، مع بعض التحسينات التي تعزز من قدراته.

تضمن تدريب whisper-large-v3 أكثر من مليون ساعة من الصوت المسمى بشكل ضعيف و4 ملايين ساعة من الصوت المسمى بشكل زائف، مما أدى إلى نموذج يظهر قدرة قوية على التعميم عبر مجموعات بيانات ومجالات متنوعة. يظهر هذا النموذج انخفاضًا ملحوظًا في الأخطاء—بين 10% إلى 20%—مقارنةً بـ whisper-large-v2، مما يجعله خيارًا أكثر موثوقية للمهام المتعلقة بالتعرف على الكلام والترجمة.

Whisper-large-v3 متوافق مع مكتبة Hugging Face Transformers، مما يسمح للمستخدمين بدمجه بسهولة في تطبيقاتهم. يمكن للمستخدمين نسخ ملفات الصوت ذات الأطوال العشوائية وحتى معالجة ملفات متعددة في وقت واحد. يتنبأ النموذج تلقائيًا بلغة الصوت المصدر، مما يعزز من قابليته للاستخدام في التطبيقات متعددة اللغات. بالإضافة إلى ذلك، يدعم ميزات مثل توقع الطوابع الزمنية لكل من الطوابع الزمنية على مستوى الجملة والكلمة، مما يوفر للمستخدمين رؤى مفصلة حول محتوى الصوت.

بالنسبة للمطورين الذين يتطلعون إلى تحسين الأداء، يقدم whisper-large-v3 تحسينات إضافية في السرعة والذاكرة. يمكن للمستخدمين الاختيار بين الخوارزميات المتسلسلة والمجزأة لنسخ ملفات الصوت الطويلة، اعتمادًا على ما إذا كانت دقة النسخ أو السرعة هي الأولوية. يدعم النموذج أيضًا ميزات متقدمة مثل torch.compile لتسريع الأداء وFlash Attention 2 لتحسين الأداء على وحدات معالجة الرسوميات المتوافقة.

الجمهور المستهدف لـ whisper-large-v3 يشمل الباحثين والمطورين في مجال الذكاء الاصطناعي المهتمين بحلول ASR القوية. بينما أظهر النموذج أداءً قويًا في لغات متعددة، يُنصح المستخدمون بإجراء تقييمات شاملة في سياقاتهم المحددة لضمان الموثوقية. تمتد قدرات النموذج إلى ما هو أبعد من النسخ البسيط، مع تطبيقات محتملة في أدوات الوصول وحلول مبتكرة أخرى في مجال الذكاء الاصطناعي.

أبرز ملامح whisper-large-v3

  • التعرف التلقائي على الكلام

  • ترجمة الكلام

  • دعم متعدد اللغات

  • توقع الطوابع الزمنية

  • معالجة دفعات

  • دعم التخصيص

  • التوافق مع Hugging Face Transformers

  • تحسين تقليل الأخطاء

البدء مع whisper-large-v3

  1. الوصول إلى صفحة Hugging Face لـ whisper-large-v3.

  2. تثبيت مكتبة Transformers وأي تبعيات ضرورية.

  3. تحميل نموذج whisper-large-v3 باستخدام فئة pipeline.

  4. نسخ ملفات الصوت عن طريق تمرير مسار الملف إلى pipeline.

  5. استخدام معالجة الدفعات لنسخ ملفات صوت متعددة في وقت واحد.

  6. تمكين توقع الطوابع الزمنية عن طريق تعيين وسيط return_timestamps.

  7. اختيار بين الخوارزميات المتسلسلة أو المجزأة لملفات الصوت الطويلة.

  8. تحسين الأداء باستخدام torch.compile أو Flash Attention 2 إذا كانت مدعومة.

حالات استخدام whisper-large-v3

  • نسخ الكلام
  • ترجمة الكلام
  • أدوات الوصول
  • تطبيقات متعددة اللغات
  • البحث والتطوير

الأسئلة الشائعة من whisper-large-v3

أدوات ذكاء اصطناعي شائعة مثل whisper-large-v3

نماذج الذكاء الاصطناعي

Whisper Large V3 Turbo هو نموذج متقدم للتعرف على الكلام والترجمة، مصمم لتحقيق السرعة مع تقليل طبقات فك التشفير. يدعم عدة لغات ويقدم قدرات قوية في النسخ.

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

نموذج OpenAI Whisper هو نموذج مدرب مسبقًا للتعرف التلقائي على الكلام والترجمة. يدعم عدة لغات ومصمم للتعميم عبر مجموعات البيانات دون الحاجة إلى ضبط دقيق، مما يجعله متعدد…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Whisper هو نموذج قوي للأغراض العامة للتعرف على الكلام طورته OpenAI. يتفوق في التعرف على الكلام متعدد اللغات، والترجمة، وتحديد اللغة. تم تدريبه على بيانات صوتية متنوعة، ويقدم…

مميزةأدوات التفريغ النصي بالذكاء الاصطناعي

نماذج الذكاء الاصطناعي

Llama-3.1-8B-Instruct هو نموذج لغوي كبير متعدد اللغات تم تطويره بواسطة Meta، مُحسّن للمهام المعتمدة على التعليمات. تم تصميمه للتطبيقات التجارية والبحثية، حيث يوفر قدرات متقدمة في…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Mistral-7B-v0.1 هو نموذج نصي توليدي مدرب مسبقًا يحتوي على 7 مليارات معلمة، مصمم لتعزيز الذكاء الاصطناعي من خلال المصادر المفتوحة. يتفوق على Llama 2 13B في مختلف المعايير، مما…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Mixtral-8x7B-Instruct-v0.1 هو نموذج مختلط مسبق التدريب من نوع Sparse Mixture of Experts مصمم لتطبيقات الذكاء الاصطناعي المتقدمة. يتفوق على Llama 2 70B في العديد من المعايير، مما…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Mistral Large 3 هو نموذج ذكاء اصطناعي متطور مصمم للمؤسسات، مما يتيح التخصيص، والتدريب الدقيق، ونشر المساعدين والوكلاء الذكيين. يتميز بهندسة مختلطة نادرة من الخبراء مع 41 مليار…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Wav2Vec2 Large XLSR-53 هو نموذج صوتي مدرب مسبقًا مصمم للتعرف على الكلام عبر اللغات. يتطلب ضبطًا دقيقًا لمهام محددة مثل التعرف التلقائي على الكلام، مما يوفر معدلات خطأ محسنة عبر…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة