Deskripsi
AudioGen adalah model generatif auto-regresif inovatif yang dirancang untuk pembuatan audio dari teks. Model ini menangani tugas kompleks menghasilkan sampel audio yang dikondisikan pada masukan teks deskriptif. Model beroperasi dengan menghasilkan audio dalam representasi audio diskrit yang dipelajari, memungkinkannya menghasilkan lanskap suara fidelitas tinggi.
Pengembangan AudioGen mengatasi beberapa tantangan signifikan yang melekat dalam pembuatan audio dari teks. Membedakan antara berbagai sumber suara, terutama ketika beberapa hadir secara bersamaan, sulit karena sifat propagasi audio. Kompleksitas ini semakin diperkuat oleh kondisi perekaman dunia nyata, termasuk kebisingan latar belakang dan gema. Kendala lain adalah kelangkaan anotasi teks, yang membatasi skalabilitas data pelatihan. Selain itu, pemodelan audio fidelitas tinggi memerlukan pengkodean pada tingkat pengambilan sampel yang tinggi, menghasilkan urutan yang sangat panjang yang intensif secara komputasi untuk diproses.
Untuk mengatasi hambatan ini, AudioGen menggabungkan beberapa teknik canggih. Strategi augmentasi yang melibatkan pencampuran sampel audio yang berbeda mendorong model untuk secara internal mempelajari pemisahan sumber. Untuk memerangi kelangkaan data teks-audio, sepuluh kumpulan data yang beragam dengan berbagai jenis audio dan anotasi teks dikurasi. Untuk peningkatan kecepatan inferensi, pemodelan multi-stream dieksplorasi, memungkinkan urutan yang lebih pendek sambil mempertahankan bitrate dan kualitas perseptual yang sebanding. Panduan bebas pengklasifikasi digunakan untuk meningkatkan kepatuhan model terhadap prompt teks yang diberikan. Evaluasi komparatif terhadap baseline yang ada menunjukkan bahwa AudioGen melampaui mereka dalam metrik objektif dan subjektif.
Di luar generasi awal, AudioGen juga mengeksplorasi kemampuannya untuk kelanjutan audio, baik secara kondisional maupun tanpa syarat. Fitur ini memungkinkan perpanjangan klip audio yang ada dengan konten baru yang dipandu oleh teks atau dihasilkan secara bebas. Arsitektur dan kinerja model ditampilkan melalui berbagai perbandingan sampel, termasuk ukuran model yang berbeda dan dampak pencampuran dan panduan bebas pengklasifikasi. Eksplorasi pemodelan multi-stream selanjutnya menyoroti fleksibilitasnya dalam mengelola panjang urutan dan kualitas.
Sorotan AudioGen
Menghasilkan sampel audio yang dikondisikan pada deskripsi teks
Beroperasi pada representasi audio diskrit yang dipelajari
Mencakup teknik augmentasi untuk pemisahan sumber
Memanfaatkan kumpulan data yang dikurasi untuk kelangkaan data teks-audio
Menggunakan pemodelan multi-stream untuk inferensi yang lebih cepat
Menerapkan panduan bebas pengklasifikasi untuk kepatuhan teks
Melampaui baseline pada metrik objektif dan subjektif
Mendukung kelanjutan audio (kondisional dan tanpa syarat)
Mengeksplorasi berbagai ukuran model (misalnya, AudioGen-large, AudioGen-base)
Menunjukkan dampak pencampuran dan skala panduan
Menangani kompleksitas audio dunia nyata seperti kebisingan latar belakang
Memulai dengan AudioGen
Akses Model: Dapatkan akses ke model AudioGen.
Autentikasi: Jika diperlukan, autentikasi akses Anda.
Siapkan Lingkungan: Siapkan lingkungan pengembangan Anda untuk integrasi.
Integrasikan melalui API: Gunakan endpoint API yang disediakan untuk mengirim prompt teks.
Hasilkan Audio: Terima sampel audio yang dihasilkan berdasarkan masukan teks Anda.
Optimalkan Parameter: Sesuaikan skala panduan dan konfigurasi model untuk keluaran yang diinginkan.
Kasus Penggunaan AudioGen
- Pembuatan Efek Suara
- Pembuatan Konten Audio
- Prototipe Audio
- Alat Aksesibilitas
- Pengalaman Audio Interaktif
- Musik dan Desain Suara
- Kelanjutan Audio



