Deskripsi
LTX-2.5 adalah model dunia terbuka mutakhir yang dikembangkan oleh Lightricks, dirancang untuk menghasilkan video dan audio berkualitas tinggi yang disinkronkan dari input teks, gambar, dan video. Model ini dibangun untuk eksekusi lokal dan fine-tuning, memberikan pengguna kontrol penuh dan opsi kustomisasi. Ini sangat bermanfaat bagi mereka yang berada di bidang yang sedang berkembang seperti robotika dan AI fisik, di mana kebutuhan untuk menghasilkan multimedia berkualitas tinggi sangat penting.
Salah satu fitur unggulan dari LTX-2.5 adalah kemampuannya untuk menghasilkan multishot secara native, memungkinkan pengguna untuk membuat adegan yang terhubung dalam satu kali proses. Ini berarti bahwa beberapa pengambilan dapat mempertahankan identitas karakter, lingkungan, pencahayaan, suara, dan gaya visual di seluruh pemotongan, meningkatkan pengalaman bercerita. Selain itu, model ini menggunakan rendering fidelity difusi, secara dinamis mengalokasikan sumber daya komputasi berdasarkan kompleksitas adegan, memastikan bahwa detail dirender di tempat yang paling penting sambil tetap efisien di tempat lain.
Pengenalan dekoder video difusi baru menggantikan tahap rekonstruksi VAE, menghasilkan wajah yang lebih tajam, tekstur yang lebih baik, dan gerakan yang lebih baik dengan lebih sedikit artefak di adegan yang menuntut. Pengkode teks Gemma 4 12B yang disesuaikan adalah kemajuan signifikan lainnya, mampu mempertahankan prompt yang kompleks tanpa kehilangan detail di seluruh urutan yang lebih panjang. Selain itu, enhancer prompt memperluas prompt pendek menjadi instruksi sinematik yang lebih kaya, meningkatkan kualitas output secara keseluruhan.
Bagi mereka yang ingin memprediksi panjang klip, LTX-2.5 menyertakan prediktor durasi opsional yang menetapkan jumlah frame berdasarkan prompt, menyederhanakan alur kerja. Model ini juga memiliki versi distilasi yang secara substansial ditingkatkan, yang mempertahankan banyak kualitas visual dan konsistensi gerakan dari model penuh sambil lebih kecil dan lebih cepat.
LTX-2.5 tersedia di bawah Lisensi Komunitas LTX-2.x, memungkinkan penggunaan komersial dan produksi tanpa biaya, meskipun transfer fine-tune mungkin memerlukan lisensi berbayar. Pengguna dapat mengakses model melalui berbagai opsi integrasi, termasuk Python dan ComfyUI, menjadikannya serbaguna untuk berbagai lingkungan teknis. Dengan kemampuan yang kuat dan sifat sumber terbuka, LTX-2.5 siap untuk memajukan dan mendemokratisasi kecerdasan buatan dalam generasi multimedia.
Sorotan LTX-2.5
Model Dunia Terbuka
Generasi Video Berkualitas Tinggi
Generasi Audio Berkualitas Tinggi
Generasi Multishot Native
Rendering Fidelity Difusi
Pengkode Teks Gemma 4 12B Kustom
Enhancer Prompt
Prediktor Durasi
Model Distilasi Tersedia
Lisensi Penggunaan Komersial
Memulai dengan LTX-2.5
Akses halaman: Kunjungi halaman model LTX-2.5 di Hugging Face.
Muat model: Unduh bobot dan komponen yang diperlukan untuk LTX-2.5.
Konfigurasi lingkungan: Pastikan pengaturan Anda memenuhi persyaratan (Python >= 3.12, CUDA >= 12.7, PyTorch ~= 2.7).
Integrasi: Gunakan flag CLI yang disediakan untuk memuat komponen model dalam aplikasi Anda.
Fine-tune: Gunakan LTX-2 Trainer untuk fine-tune model sesuai kebutuhan.
Kasus Penggunaan LTX-2.5
- Produksi Video
- Kreasi Audio
- Simulasi Robotika
- Pengembangan Game
- Konten Pendidikan





