Deskripsi
Make-An-Audio mewakili kemajuan signifikan dalam generasi audio dari teks, memanfaatkan model difusi yang ditingkatkan dengan prompt untuk mengatasi tantangan seperti keterbatasan dataset berkualitas tinggi dan kompleksitas pemodelan urutan audio yang panjang. Sistem ini memperkenalkan teknik peningkatan prompt semu yang baru, menggunakan pendekatan "distill-then-reprogram". Metode ini secara efektif mengurangi kelangkaan data dengan memasukkan data yang diawasi secara lemah, termasuk audio tanpa bahasa.
Selanjutnya, Make-An-Audio menggunakan autoencoder spektogram untuk memprediksi representasi audio yang diawasi sendiri daripada gelombang suara mentah. Pilihan arsitektur ini, dikombinasikan dengan representasi pretraining bahasa-audio kontrastif (CLAP) yang kuat, memungkinkan model untuk mencapai kinerja mutakhir dalam evaluasi objektif dan subjektif. Sistem ini menunjukkan kemampuan kontrol yang luar biasa melalui panduan bebas pengklasifikasi, memungkinkan pengguna untuk menyempurnakan output audio yang dihasilkan.
Selain generasi audio dari teks dasar, Make-An-Audio menunjukkan kemampuan generalisasi yang mengesankan untuk tugas X-to-Audio, mewujudkan prinsip "Tidak Ada Modalitas yang Tertinggal". Ini membuka kemampuan untuk menghasilkan audio definisi tinggi dan fidelitas tinggi berdasarkan input modalitas yang ditentukan pengguna. Sistem ini mendukung generasi audio dari teks yang dipersonalisasi, memungkinkan penyisipan objek unik ke dalam adegan baru dan transformasi antar gaya yang berbeda. Contohnya termasuk menghasilkan "tangisan bayi" dari suara awal "guntur", menghasilkan audio yang realistis dan setia. Sistem ini juga mendukung inpainting audio dan generasi gambar-ke-audio, memperluas potensi kreatifnya.
Sorotan Make-An-Audio
Model difusi yang ditingkatkan dengan prompt untuk generasi audio dari teks
Peningkatan prompt semu menggunakan pendekatan "distill-then-reprogram"
Autoencoder spektogram untuk prediksi representasi audio
Representasi pretraining bahasa-audio kontrastif (CLAP)
Panduan bebas pengklasifikasi untuk kemampuan kontrol
Generalisasi untuk tugas X-to-Audio (misalnya, gambar-ke-audio, video-ke-audio)
Generasi audio dari teks yang dipersonalisasi dengan penyisipan objek dan transformasi gaya
Kemampuan inpainting audio
Menghasilkan audio definisi tinggi dan fidelitas tinggi
Mengatasi kelangkaan data dalam generasi audio
Memulai dengan Make-An-Audio
Akses Model: Dapatkan akses ke model Make-An-Audio.
Integrasi melalui API: Hubungkan ke API model untuk penggunaan terprogram.
Berikan Prompt Teks: Masukkan deskripsi teks yang diinginkan untuk generasi audio.
Tentukan Input Modalitas (Opsional): Untuk X-to-Audio, berikan input gambar atau video yang relevan.
Konfigurasi Panduan: Gunakan panduan bebas pengklasifikasi untuk menyempurnakan karakteristik audio.
Hasilkan Audio: Mulai proses generasi audio.
Sempurnakan Output: Sesuaikan parameter untuk tugas audio yang dipersonalisasi atau inpainting.
Kasus Penggunaan Make-An-Audio
- Sintesis Ucapan dari Teks
- Generasi Efek Suara
- Inpainting Audio
- Gambar-ke-Audio
- Video-ke-Audio
- Konten Audio yang Dipersonalisasi
- Generasi Musik
- Penelitian AI


