الوصف
Sesame CSM، المستضاف على Hugging Face، هو نموذج محادثة صوتية يقوم بتوليد رموز صوتية RVQ من كل من مدخلات النص والصوت. تم بناء هذا النموذج على هيكل Llama، مدعومًا بمفكك صوتي أصغر ينتج رموز صوتية Mimi. تم تصميم نموذج CSM لتعزيز وتعميم الذكاء الاصطناعي من خلال المصادر المفتوحة والعلوم المفتوحة، مما يجعله متاحًا للجمهور مع ضرورة موافقة المستخدمين على شروط محددة للوصول إلى ملفاته ومحتواه.
نموذج CSM فعال بشكل خاص عند تزويده بالسياق، مما يسمح له بتوليد جمل متماسكة. يدعم الاستدلال المجمع، مما يمكّن المستخدمين من معالجة مدخلات متعددة في وقت واحد. بالإضافة إلى ذلك، فإن CSM متوافق مع تجميع الرسم البياني الكامل باستخدام رسوم CUDA، مما يعزز أدائه وكفاءته. يمكن للمستخدمين أيضًا ضبط النموذج باستخدام مدرب Transformers، مما يجعله قابلاً للتكيف مع تطبيقات متنوعة.
بينما يمكن لنموذج CSM إنتاج مجموعة متنوعة من الأصوات، من المهم ملاحظة أنه نموذج توليد أساسي ولم يتم ضبطه على أي صوت محدد. هذا يعني أنه بينما يمكنه توليد الكلام، إلا أنه ليس مصممًا لمهام اللغة متعددة الوسائط العامة ولا يمكنه توليد النص. يُشجع المستخدمون على استخدام نموذج لغة منفصل لمهام توليد النص.
يمتلك النموذج بعض القدرة على اللغات غير الإنجليزية بسبب تلوث البيانات في بيانات تدريبه، لكن أداؤه في هذه اللغات قد لا يكون مثاليًا. يؤكد مبتكرو CSM على أهمية الاستخدام الأخلاقي، حيث يحظرون صراحة الانتحال، والمعلومات المضللة، وأي أنشطة غير قانونية أو ضارة. من خلال استخدام هذا النموذج، يوافق المستخدمون على الالتزام بالقوانين المعمول بها والإرشادات الأخلاقية، مما يضمن استخدام التكنولوجيا بشكل مسؤول ولأغراض تعليمية.
أبرز ملامح Sesame CSM
نوع النموذج: توليد الكلام
API متاحة: نعم
دعم الضبط: نعم
الاستدلال المجمع: نعم
دعم رسوم CUDA: نعم
مفتوح المصدر: نعم
البدء مع Sesame CSM
الوصول إلى النموذج: زيارة صفحة Hugging Face لنموذج Sesame CSM.
المصادقة: الموافقة على الشروط للوصول إلى محتوى النموذج.
إعداد البيئة: التأكد من تثبيت المكتبات اللازمة.
التكامل عبر API: استخدام API المقدم للاتصال بالنموذج.
تحسين: ضبط النموذج حسب الحاجة لحالة الاستخدام الخاصة بك.
حالات استخدام Sesame CSM
- توليد الصوت
- توليد الكلام
- أدوات تعليمية
- عروض صوتية
- ضبط النماذج






