تخطَّ إلى المحتوى الرئيسي
ToolPotion

نموذج Dia-1.6B الذكي

نموذج Dia-1.6B هو نموذج تحويل النص إلى كلام من تطوير Nari Labs، ويتميز بـ 1.6 مليار معلمة. يقوم بإنشاء حوارات واقعية من النصوص، ويدعم التحكم في العواطف والنغمة، ويمكنه إنتاج أصوات غير لفظية. حاليًا، يدعم اللغة الإنجليزية فقط.

عرض النموذج
مشاركة

الوصف

نموذج Dia-1.6B هو نموذج متقدم لتحويل النص إلى كلام تم تطويره بواسطة Nari Labs، ويتميز بـ 1.6 مليار معلمة. تم تصميم هذا النموذج لإنشاء حوارات واقعية للغاية من النصوص، مما يسمح للمستخدمين بتكييف المخرجات على الصوت للتحكم في العواطف والنغمة. بالإضافة إلى ذلك، يمكن لنموذج Dia-1.6B إنتاج اتصالات غير لفظية مثل الضحك والسعال وأصوات أخرى، مما يعزز من واقعية الكلام الناتج.

النموذج متكامل مع PytorchModelHubMixin وموجود على Hugging Face، حيث يمكن للمستخدمين الوصول إلى نقاط تفتيش النموذج المدرب مسبقًا وكود الاستدلال. حاليًا، يدعم نموذج Dia-1.6B توليد اللغة الإنجليزية فقط. النموذج مفيد بشكل خاص للباحثين والمطورين المهتمين باستكشاف قدرات تحويل النص إلى كلام المتقدمة.

تم اختبار نموذج Dia-1.6B على وحدات معالجة الرسوميات (GPUs) مع PyTorch 2.0+ وCUDA 12.6، ويتطلب حوالي 10 جيجابايت من VRAM للتشغيل. بينما من المتوقع إضافة دعم لوحدات المعالجة المركزية قريبًا، يمكن للنموذج توليد الصوت في الوقت الحقيقي على وحدات معالجة الرسوميات الخاصة بالشركات. يمكن للمستخدمين الذين لا يمتلكون الأجهزة اللازمة الانضمام إلى قائمة الانتظار للوصول إلى إصدارات أكبر من النموذج.

النموذج مرخص بموجب رخصة Apache 2.0، واستخدامه مخصص للأغراض البحثية والتعليمية. يُنصح المستخدمون بعدم استخدام النموذج في أي استخدامات غير قانونية أو محتوى مضلل. تشجع Nari Labs على المساهمات في المشروع وتقدم الدعم المجتمعي من خلال خادم Discord الخاص بهم.

أبرز ملامح نموذج Dia-1.6B الذكي

  • نموذج تحويل النص إلى كلام بـ 1.6 مليار معلمة

  • توليد حوارات واقعية

  • التحكم في العواطف والنغمة

  • إنتاج أصوات غير لفظية

  • دعم اللغة الإنجليزية

  • نقاط تفتيش النموذج المدرب مسبقًا

  • كود الاستدلال متاح

  • تحسين لوحدات معالجة الرسوميات

البدء مع نموذج Dia-1.6B الذكي

  1. الوصول إلى الصفحة: زيارة صفحة النموذج على Hugging Face

  2. تحميل النموذج: تنزيل نقاط تفتيش النموذج المدرب مسبقًا

  3. تكوين البيئة: إعداد PyTorch 2.0+ وCUDA 12.6

  4. التكامل: استخدام PytorchModelHubMixin للتكامل

  5. التخصيص: ضبط المعلمات لحالات الاستخدام المحددة

حالات استخدام نموذج Dia-1.6B الذكي

  • توليد الحوارات
  • التحكم في العواطف
  • إنتاج الأصوات غير اللفظية
  • البحث والتطوير
  • الاستخدام التعليمي

الأسئلة الشائعة من نموذج Dia-1.6B الذكي

تقييمات نموذج Dia-1.6B الذكي

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل نموذج Dia-1.6B الذكي

نماذج الذكاء الاصطناعي

بارك هو نموذج تحويل قائم على المحولات لتحويل النص إلى صوت من تطوير سونو، قادر على توليد خطاب متعدد اللغات واقعي وأشكال صوتية أخرى. يدعم البحث من خلال نقاط تفتيش نموذج مدربة مسبقًا…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

سونك هي واجهة برمجة التطبيقات لتحويل النص إلى كلام في الوقت الحقيقي من كارتيسيا، والتي تولد أصواتًا تعبيرية مع الضحك بـ 44 لغة. مصممة لوكلاء الذكاء الاصطناعي والتطبيقات التفاعلية،…

مميزةتحويل النص إلى كلام

نماذج الذكاء الاصطناعي

Sesame CSM هو نموذج محادثة صوتية يقوم بتوليد رموز صوتية من مدخلات النص والصوت. يستخدم هيكل Llama ومصمم لأغراض البحث والتعليم، مما يعزز الاستخدام المسؤول لتكنولوجيا الذكاء…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

ESPnet هو مجموعة أدوات مفتوحة المصدر لمعالجة الكلام من طرف إلى طرف. يوفر وصفات وأدوات شاملة لمهام مثل التعرف التلقائي على الكلام (ASR)، وتحويل النص إلى كلام (TTS)، وتحسين الكلام.…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Chatterbox Turbo هو نموذج تحويل النص إلى كلام مفتوح المصدر من Resemble AI، يقدم أداءً فائق السرعة مع 350 مليون معلمة وزمن استجابة يبلغ 75 مللي ثانية. يتميز باستنساخ الصوت من 5…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

إنكلينغ هو نموذج ذكاء اصطناعي متعدد الوسائط يحتوي على 975 مليار معلمة مصمم للمطورين. يقبل مدخلات نصية وصورية وصوتية، وينتج مخرجات نصية لتطبيقات متنوعة، بما في ذلك روبوتات الدردشة…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

هذه صفحة عرض توضيحي غير رسمية لـ Parallel WaveGAN ونماذج توليد الصوت ذات الصلة. تعرض عينات صوتية تم إنشاؤها بواسطة تطبيقات مختلفة، بما في ذلك MelGAN و Multiband-MelGAN و HiFi-GAN…

تحويل النص إلى كلام

نماذج الذكاء الاصطناعي

Whisper-large-v3 هو نموذج متقدم للتعرف التلقائي على الكلام وترجمة الكلام، تم تدريبه على أكثر من 5 ملايين ساعة من البيانات. يقدم أداءً محسنًا عبر عدة لغات ومصمم للمطورين والباحثين…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة