الوصف
نموذج Dia-1.6B هو نموذج متقدم لتحويل النص إلى كلام تم تطويره بواسطة Nari Labs، ويتميز بـ 1.6 مليار معلمة. تم تصميم هذا النموذج لإنشاء حوارات واقعية للغاية من النصوص، مما يسمح للمستخدمين بتكييف المخرجات على الصوت للتحكم في العواطف والنغمة. بالإضافة إلى ذلك، يمكن لنموذج Dia-1.6B إنتاج اتصالات غير لفظية مثل الضحك والسعال وأصوات أخرى، مما يعزز من واقعية الكلام الناتج.
النموذج متكامل مع PytorchModelHubMixin وموجود على Hugging Face، حيث يمكن للمستخدمين الوصول إلى نقاط تفتيش النموذج المدرب مسبقًا وكود الاستدلال. حاليًا، يدعم نموذج Dia-1.6B توليد اللغة الإنجليزية فقط. النموذج مفيد بشكل خاص للباحثين والمطورين المهتمين باستكشاف قدرات تحويل النص إلى كلام المتقدمة.
تم اختبار نموذج Dia-1.6B على وحدات معالجة الرسوميات (GPUs) مع PyTorch 2.0+ وCUDA 12.6، ويتطلب حوالي 10 جيجابايت من VRAM للتشغيل. بينما من المتوقع إضافة دعم لوحدات المعالجة المركزية قريبًا، يمكن للنموذج توليد الصوت في الوقت الحقيقي على وحدات معالجة الرسوميات الخاصة بالشركات. يمكن للمستخدمين الذين لا يمتلكون الأجهزة اللازمة الانضمام إلى قائمة الانتظار للوصول إلى إصدارات أكبر من النموذج.
النموذج مرخص بموجب رخصة Apache 2.0، واستخدامه مخصص للأغراض البحثية والتعليمية. يُنصح المستخدمون بعدم استخدام النموذج في أي استخدامات غير قانونية أو محتوى مضلل. تشجع Nari Labs على المساهمات في المشروع وتقدم الدعم المجتمعي من خلال خادم Discord الخاص بهم.
أبرز ملامح نموذج Dia-1.6B الذكي
نموذج تحويل النص إلى كلام بـ 1.6 مليار معلمة
توليد حوارات واقعية
التحكم في العواطف والنغمة
إنتاج أصوات غير لفظية
دعم اللغة الإنجليزية
نقاط تفتيش النموذج المدرب مسبقًا
كود الاستدلال متاح
تحسين لوحدات معالجة الرسوميات
البدء مع نموذج Dia-1.6B الذكي
الوصول إلى الصفحة: زيارة صفحة النموذج على Hugging Face
تحميل النموذج: تنزيل نقاط تفتيش النموذج المدرب مسبقًا
تكوين البيئة: إعداد PyTorch 2.0+ وCUDA 12.6
التكامل: استخدام PytorchModelHubMixin للتكامل
التخصيص: ضبط المعلمات لحالات الاستخدام المحددة
حالات استخدام نموذج Dia-1.6B الذكي
- توليد الحوارات
- التحكم في العواطف
- إنتاج الأصوات غير اللفظية
- البحث والتطوير
- الاستخدام التعليمي






