Deskripsi
Peneliti Meta AI telah mengembangkan Voicebox, sebuah model AI generatif mutakhir untuk ucapan yang menunjukkan kemampuan generalisasi di berbagai tugas yang tidak dilatih secara spesifik untuknya, mencapai kinerja mutakhir. Berbeda dengan model AI ucapan sebelumnya yang memerlukan data pelatihan spesifik tugas, Voicebox belajar dari audio mentah dan transkripsi yang menyertainya menggunakan pendekatan Flow Matching yang baru, sebuah kemajuan dari model difusi.
Voicebox unggul dalam membuat klip audio berkualitas tinggi, mampu mensintesis ucapan dalam enam bahasa: Inggris, Prancis, Spanyol, Jerman, Polandia, dan Portugis. Fleksibilitasnya meluas ke tugas pengeditan ucapan tingkat lanjut seperti penghilangan kebisingan, pengeditan konten, dan konversi gaya. Inovasi utama adalah kemampuannya untuk memodifikasi bagian mana pun dari sampel audio, tidak hanya di akhir, membuatnya lebih fleksibel daripada model autoregresif.
Dalam tolok ukur kinerja, Voicebox secara signifikan melampaui model yang ada. Model ini mencapai kejelasan dan kesamaan audio yang unggul dibandingkan VALL-E pada tugas text-to-speech zero-shot, sambil menjadi hingga 20 kali lebih cepat. Untuk transfer gaya lintas bahasa, Voicebox mengurangi tingkat kesalahan kata dan meningkatkan kesamaan audio jika dibandingkan dengan YourTTS. Kemajuan ini menetapkan hasil mutakhir baru pada tolok ukur bahasa Inggris dan multibahasa untuk metrik tingkat kesalahan kata dan kesamaan gaya audio.
Kemampuan Voicebox memungkinkan beberapa kasus penggunaan yang menarik. Model ini dapat melakukan sintesis text-to-speech dalam konteks, mencocokkan gaya sampel audio pendek untuk generasi ucapan baru. Transfer gaya lintas bahasa memungkinkan komunikasi alami lintas hambatan bahasa. Selain itu, fitur penghilangan kebisingan dan pengeditan suaranya dapat memperbaiki segmen audio yang rusak atau mengganti kata yang salah ucap dengan mulus, menyederhanakan pasca-produksi audio. Model ini juga dapat menghasilkan sampel ucapan yang beragam yang mewakili pola ucapan dunia nyata, yang dapat digunakan untuk melatih model asisten ucapan yang lebih kuat.
Mengingat potensi penyalahgunaan, Meta AI tidak membuat model atau kode Voicebox tersedia untuk umum saat ini. Sebaliknya, mereka membagikan sampel audio dan makalah penelitian terperinci yang menguraikan pendekatan dan hasilnya. Ini termasuk informasi tentang pengklasifikasi yang sangat efektif yang dikembangkan untuk membedakan antara audio otentik dan yang dihasilkan Voicebox, yang bertujuan untuk mengurangi potensi risiko dan mempromosikan pengembangan AI yang bertanggung jawab.
Sorotan Voicebox
Model AI generatif untuk ucapan
Menggeneralisasi di berbagai tugas ucapan
Kinerja mutakhir
Mensintesis ucapan dalam enam bahasa
Melakukan penghilangan kebisingan
Memungkinkan pengeditan konten
Mendukung konversi gaya
Menghasilkan sampel ucapan yang beragam
Menggunakan model Flow Matching
Memodifikasi bagian mana pun dari sampel audio
Melampaui VALL-E pada TTS zero-shot
Melampaui YourTTS pada transfer gaya lintas bahasa
Mencapai hasil mutakhir baru pada tolok ukur
Dilatih pada lebih dari 50.000 jam data ucapan
Memulai dengan Voicebox
Akses model: Dapatkan akses ke model Voicebox melalui publikasi penelitian dan sampel yang dibagikan.
Pahami pendekatan: Pelajari makalah penelitian yang merinci metode Flow Matching dan data pelatihan.
Evaluasi kinerja: Analisis sampel audio yang disediakan dan hasil tolok ukur untuk kejelasan dan kesamaan.
Jelajahi kemampuan: Tinjau kasus penggunaan seperti TTS dalam konteks, transfer lintas bahasa, dan pengeditan audio.
Nilai AI yang bertanggung jawab: Pahami pengklasifikasi yang dikembangkan untuk membedakan audio yang dihasilkan.
Kasus Penggunaan Voicebox
- Sintesis Ucapan
- Pengeditan Audio
- Transfer Gaya
- Komunikasi Lintas Bahasa
- Generasi Data Sintetis
- Alat Aksesibilitas
- Asisten Virtual





