الوصف
Chatterbox Turbo، الذي طورته Resemble AI، هو نموذج تحويل النص إلى كلام (TTS) مفتوح المصدر مصمم للسرعة والتعبيرية. مع 350 مليون معلمة، يحقق زمن استجابة يبلغ 75 مللي ثانية فقط، مما يجعله أسرع حتى ست مرات من الزمن الحقيقي على وحدة معالجة الرسوميات (GPU). يدعم هذا النموذج استنساخ الصوت بدون تدريب مسبق، مما يسمح للمستخدمين بتكرار أي صوت باستخدام خمس ثوانٍ فقط من الصوت المرجعي، دون الحاجة إلى تدريب إضافي أو ضبط دقيق.
يتميز Chatterbox Turbo بدمج التحفيزات البارالينغويستية، مما يمكّن النموذج من أداء ردود فعل صوتية طبيعية مثل التنهدات، والدهشات، والسعال في الصوت المستنسخ. تعزز هذه الميزة التعبيرية للصوت الناتج، مما يجعله مناسبًا للتطبيقات في مساعدات الصوت، ووسائط التفاعل، ودورات الوكلاء في الزمن الحقيقي.
تم بناء النموذج مع مراعاة جاهزية الإنتاج، حيث يقدم عملية تثبيت بسيطة ووثائق شاملة. وهو متاح بموجب ترخيص MIT، مما يضمن مرونة للمطورين. يتضمن Chatterbox Turbo أيضًا تقنية العلامة المائية PerTh، وهي تقنية نفسية صوتية تدمج البيانات في المخرجات الصوتية، مما يضمن الأصالة وقابلية التتبع دون التأثير على جودة الصوت.
تم اختبار أداء Chatterbox Turbo مقابل نماذج ملكية مثل ElevenLabs Turbo v2.5 وCartesia Sonic 3، مما يظهر نتائج متفوقة في السيناريوهات بدون تدريب مسبق. النموذج متاح عبر GitHub وHugging Face، مما يوفر للمطورين الأدوات والموارد اللازمة لدمجه بسرعة في مشاريعهم.
أبرز ملامح Chatterbox Turbo
نموذج TTS مفتوح المصدر
350 مليون معلمة
75 مللي ثانية زمن استجابة
استنساخ الصوت بدون تدريب مسبق
تحفيز بارالينغويستي
علامة مائية PerTh
ترخيص MIT
استدلال جاهز للبث
البدء مع Chatterbox Turbo
التثبيت: استخدم pip للتثبيت
التكوين: إعداد باستخدام السكربتات المرجعية
الاستخدام: استنساخ الأصوات وتوليد الكلام
تحسين: ضبط العواطف وعلامات البارالينغويستية
حالات استخدام Chatterbox Turbo
- مساعدات الصوت
- وسائط تفاعلية
- استنساخ الصوت
- تحكم في العواطف
- صوت آمن








