Deskripsi
DreamTalk adalah implementasi resmi dari kerangka kerja generasi kepala berbicara ekspresif yang digerakkan oleh audio berbasis difusi. Alat ini dirancang untuk menghasilkan video kepala berbicara berkualitas tinggi yang secara akurat mencerminkan berbagai gaya dan emosi berbicara. Kemampuan intinya terletak pada kinerja yang kuat di berbagai input, termasuk ucapan standar, lagu, audio multibahasa, dan bahkan sinyal audio yang bising. Selain itu, DreamTalk menunjukkan ketahanan saat memproses potret di luar domain, menjadikannya solusi serbaguna untuk berbagai aplikasi.
Kerangka kerja ini memanfaatkan model probabilistik difusi untuk mencapai generasi video yang ekspresif dan realistis. Pengguna dapat menginstal proyek menggunakan conda dan pip, mengikuti persyaratan versi tertentu untuk PyTorch, torchvision, torchaudio, dan dependensi lainnya. Proses instalasi melibatkan pembuatan lingkungan conda khusus dan kemudian menginstal paket yang diperlukan dari file persyaratan.
Bagi pengguna yang tertarik untuk mendapatkan checkpoint yang telah dilatih sebelumnya, akses unduhan publik telah dihentikan karena pertimbangan dampak sosial. Pihak yang berkepentingan harus meminta checkpoint melalui email, secara eksplisit menyetujui penggunaannya hanya untuk tujuan penelitian akademis. Setelah diperoleh, checkpoint harus ditempatkan di folder 'checkpoints' yang ditentukan.
Inferensi dengan DreamTalk melibatkan menjalankan skrip Python dengan beberapa parameter utama. Ini termasuk jalur ke file audio input (mendukung berbagai format seperti wav, mp3, m4a, dan mp4), klip gaya referensi, urutan pose kepala, dan gambar potret input. Parameter tambahan seperti 'cfg_scale' mengontrol intensitas gaya bicara, sementara 'max_gen_len' mengatur durasi generasi video maksimum. Video output disimpan di folder 'output_video', dengan hasil perantara di folder sementara.
DreamTalk juga menawarkan solusi ad-hoc untuk meningkatkan resolusi video. Dua metode disarankan: CodeFormer untuk resolusi hingga 1024x1024, meskipun lebih lambat dan mungkin memiliki masalah inkonsistensi temporal, dan Model Super-Resolusi Temporal dari MetaPortrait untuk resolusi 512x512 dengan kinerja lebih cepat dan koherensi temporal, meskipun mungkin mengurangi intensitas emosi wajah. Proyek ini mengakui dan membangun karya sebelumnya di bidangnya, mengutip penelitian yang relevan dan menyediakan entri kutipan untuk penggunaan akademis.
Fitur Inti DreamTalk
Generasi kepala berbicara yang digerakkan oleh audio berbasis difusi
Output video berkualitas tinggi dengan berbagai gaya bicara
Kinerja kuat dengan berbagai input audio (ucapan, lagu, audio bising)
Menangani potret di luar domain
Mendukung banyak bahasa
Menyediakan kode implementasi resmi
Menyertakan skrip inferensi untuk generasi video
Menawarkan solusi ad-hoc untuk peningkatan resolusi (CodeFormer, MetaPortrait)
Parameter yang dapat disesuaikan untuk intensitas gaya dan panjang generasi
Mendukung inferensi CPU
Memulai dengan DreamTalk
Kloning: Kloning repositori DreamTalk dari GitHub.
Instal dependensi: Buat lingkungan conda dan instal paket yang diperlukan menggunakan requirements.txt yang disediakan.
Unduh Checkpoint: Minta checkpoint melalui email untuk penelitian akademis dan tempatkan di folder 'checkpoints'.
Siapkan Input: Kumpulkan audio input, klip gaya referensi, urutan pose kepala, dan gambar potret.
Konfigurasi Inferensi: Tentukan jalur input dan parameter seperti cfg_scale dan max_gen_len dalam skrip inferensi.
Eksekusi Inferensi: Jalankan skrip inferensi (misalnya, python inference_for_demo_video.py) untuk menghasilkan video kepala berbicara.
Tingkatkan Resolusi (Opsional): Terapkan CodeFormer atau MetaPortrait untuk resolusi video yang ditingkatkan.
Gunakan untuk Penelitian: Gunakan video yang dihasilkan untuk tujuan penelitian akademis.
Kasus Penggunaan DreamTalk
- Generasi Kepala Berbicara Ekspresif
- Sintesis Audio-Visual
- Penelitian dalam Animasi AI
- Kepala Berbicara Lintas Bahasa
- Transfer Gaya untuk Wajah
- Menangani Audio Bising






