Deskripsi
Sesame CSM, yang dihosting di Hugging Face, adalah model ucapan percakapan yang menghasilkan kode audio RVQ dari input teks dan audio. Model ini dibangun di atas backbone Llama, dilengkapi dengan dekoder audio yang lebih kecil yang menghasilkan kode audio Mimi. Model CSM dirancang untuk memajukan dan mendemokratisasi kecerdasan buatan melalui sumber terbuka dan ilmu terbuka, menjadikannya dapat diakses oleh publik sambil mengharuskan pengguna untuk menyetujui syarat tertentu untuk mengakses file dan kontennya.
Model CSM sangat efektif ketika diberikan konteks, memungkinkan untuk menghasilkan kalimat yang koheren. Model ini mendukung inferensi batch, memungkinkan pengguna untuk memproses beberapa input secara bersamaan. Selain itu, CSM kompatibel dengan kompilasi grafik penuh menggunakan grafik CUDA, yang meningkatkan kinerja dan efisiensinya. Pengguna juga dapat melakukan fine-tuning pada model menggunakan Trainer dari Transformers, menjadikannya dapat disesuaikan untuk berbagai aplikasi.
Meskipun model CSM mampu menghasilkan berbagai suara, penting untuk dicatat bahwa ini adalah model generasi dasar dan belum di-fine-tune pada suara tertentu. Ini berarti bahwa meskipun dapat menghasilkan ucapan, model ini tidak dirancang untuk tugas bahasa multimodal umum dan tidak dapat menghasilkan teks. Pengguna disarankan untuk menggunakan model bahasa terpisah untuk tugas generasi teks.
Model ini memiliki beberapa kapasitas untuk bahasa non-Inggris karena kontaminasi data dalam data latihnya, tetapi kinerjanya dalam bahasa-bahasa ini mungkin tidak optimal. Para pencipta CSM menekankan pentingnya penggunaan yang etis, secara eksplisit melarang peniruan, informasi yang salah, dan aktivitas ilegal atau berbahaya. Dengan menggunakan model ini, pengguna setuju untuk mematuhi hukum yang berlaku dan pedoman etika, memastikan bahwa teknologi digunakan secara bertanggung jawab dan untuk tujuan pendidikan.
Sorotan Sesame CSM
Tipe Model: Generasi Ucapan
API Tersedia: Ya
Dukungan Fine-tuning: Ya
Inferensi Batch: Ya
Dukungan Grafik CUDA: Ya
Sumber Terbuka: Ya
Memulai dengan Sesame CSM
Akses model: Kunjungi halaman Hugging Face untuk Sesame CSM.
Autentikasi: Setujui syarat untuk mengakses konten model.
Siapkan lingkungan: Pastikan Anda memiliki pustaka yang diperlukan terinstal.
Integrasi melalui API: Gunakan API yang disediakan untuk terhubung ke model.
Optimalkan: Lakukan fine-tuning pada model sesuai kebutuhan untuk kasus penggunaan spesifik Anda.
Kasus Penggunaan Sesame CSM
- Generasi Audio
- Sintesis Ucapan
- Alat Pendidikan
- Demo Suara
- Fine-tuning Model






