Deskripsi
daVinci-MagiHuman adalah model AI sumber terbuka dengan 15 miliar parameter yang menghasilkan video berbicara yang disinkronkan dengan gerakan bibir dari satu foto. Anda mengunggah potret, menambahkan skrip atau audio, dan mendapatkan klip berbicara yang alami di mana audio dan video dihasilkan bersama-sama daripada dijahit dari jalur terpisah. Model ini dikembangkan oleh Sand.ai dan GAIR Lab (Universitas Jiao Tong Shanghai) dan dirilis di bawah lisensi Apache 2.0, sehingga bobotnya dapat diperiksa, dijalankan secara lokal, dan digunakan secara komersial sesuai dengan lisensi.
Model ini menggunakan Transformer aliran tunggal yang secara bersamaan menghilangkan noise dari token video dan audio dengan latent gambar referensi, menghasilkan output audio-video yang terpadu dari foto wajah ditambah teks atau audio. Pada satu GPU NVIDIA H100, ia dapat menghasilkan klip pendek 256p dalam waktu sekitar dua detik, dan evaluasi yang dipublikasikan melaporkan tingkat kesalahan kata yang kuat dan preferensi manusia yang tinggi dibandingkan dengan baseline seperti Ovi 1.1 dan LTX 2.3.
Pengguna dapat mencobanya melalui demo online gratis, mengunduh checkpoint dari Hugging Face, atau mengkloning repositori GitHub untuk di-host sendiri dan menjalankan inferensi dengan pengaturan dan resolusi kustom hingga 1080p. Ini mendukung beberapa bahasa untuk sinkronisasi bibir tergantung pada data pelatihan yang dirilis.
Layanan yang di-host menawarkan tingkat gratis dengan kredit pemula dan check-in harian (penyimpanan sementara 15 hari) ditambah rencana kredit Basic, Pro, dan Max yang menambahkan generasi HD, pemrosesan prioritas, penyimpanan aset permanen, dan hak penggunaan komersial.
Fitur Inti daVinci-MagiHuman
Generasi video berbicara dari satu foto dengan sinkronisasi bibir
Audio dan video yang disatukan dihasilkan bersama dalam satu proses model
Arsitektur Transformer aliran tunggal dengan 15B parameter
Sumber terbuka di bawah lisensi Apache 2.0
Inferensi cepat (~2 detik untuk klip 256p ~2 detik pada H100)
Sinkronisasi bibir multibahasa tergantung pada data pelatihan
Hosting sendiri melalui Hugging Face dan GitHub, atau demo online yang di-host
Resolusi output hingga 1080p
Cara menggunakan daVinci-MagiHuman?
Unggah potret: Tambahkan foto wajah yang jelas dan menghadap ke depan.
Tambahkan skrip atau audio: Masukkan teks atau unggah file audio untuk menggerakkan ucapan.
Pilih resolusi: Pilih resolusi output seperti 256p, 720p, atau 1080p.
Hasilkan: Jalankan model untuk membuat klip yang disinkronkan dengan gerakan bibir.
Unduh: Simpan video berbicara yang sudah selesai, atau di-host sendiri dari Hugging Face atau GitHub.
Kasus Penggunaan daVinci-MagiHuman
- Video avatar berbicara
- Generasi yang di-host sendiri
- Dubbing multibahasa
- Penelitian dan benchmarking
- Pembuatan konten






