الوصف
Wan2.1-T2V-14B هو نموذج متقدم لتوليد الفيديو تم تطويره بواسطة Wan-AI، وموجود على Hugging Face. تم تصميمه لتعزيز قدرات توليد الفيديو من خلال مبادرات العلوم المفتوحة والمصادر المفتوحة. النموذج هو جزء من مجموعة Wan2.1، التي تشمل نماذج أساسية مختلفة للفيديو تدفع حدود توليد الفيديو. يتفوق Wan2.1-T2V-14B باستمرار على النماذج الحالية والحلول التجارية عبر عدة معايير، مما يضع معيار أداء جديد.
يدعم النموذج وحدات معالجة الرسوميات من الفئة الاستهلاكية، حيث يتطلب فقط 8.19 جيجابايت من VRAM للنسخة T2V-1.3B، مما يجعله متاحًا للمستخدمين الذين يمتلكون أجهزة قياسية. يمكنه توليد فيديو مدته 5 ثوانٍ بدقة 480P على RTX 4090 في حوالي 4 دقائق دون تقنيات تحسين مثل التكميم. يتفوق Wan2.1-T2V-14B في مهام متعددة، بما في ذلك تحويل النص إلى فيديو، وتحويل الصورة إلى فيديو، وتحرير الفيديو، وتحويل النص إلى صورة، وتحويل الفيديو إلى صوت، مما يعزز مجال توليد الفيديو.
ميزة ملحوظة في Wan2.1-T2V-14B هي قدرته على توليد نصوص باللغتين الصينية والإنجليزية، مما يعزز تطبيقاته العملية. يدعم النموذج توليد الفيديو بدقتين 480P و720P، مما يوفر مرونة لمختلف حالات الاستخدام. بالإضافة إلى ذلك، يوفر Wan-VAE، وهو مشفر تلقائي قوي للفيديو، كفاءة وأداء استثنائيين، حيث يقوم بترميز وفك ترميز فيديوهات بدقة 1080P بأي طول مع الحفاظ على المعلومات الزمنية.
تم تصميم Wan2.1-T2V-14B باستخدام إطار عمل Flow Matching ضمن نموذج Transformers الانتشاري السائد. يستخدم مشفر T5 لترميز إدخال النص متعدد اللغات، مع تضمين الانتباه المتقاطع للنص في هيكل النموذج. تشمل بنية النموذج MLP مع طبقة خطية وطبقة SiLU لمعالجة تضمينات الوقت المدخلة وتوقع معلمات التعديل. تسهم هذه الابتكارات في تحقيق تقدم كبير في القدرات التوليدية، مما يجعل Wan2.1-T2V-14B أداة متعددة الاستخدامات وقوية لمهام توليد الفيديو.
أبرز ملامح Wan2.1-T2V-14B نموذج
أداء متقدم
يدعم وحدات معالجة الرسوميات من الفئة الاستهلاكية
توليد النص إلى فيديو
تحويل الصورة إلى فيديو
قدرات تحرير الفيديو
يولد نصوصًا بالصينية والإنجليزية
VAE للفيديو لترميز فعال
يدعم دقتي 480P و720P
إطار عمل Flow Matching
ترميز نص متعدد اللغات
تضمين الانتباه المتقاطع
MLP لتضمينات الوقت
ضغط مكاني زمني
معايير تقييم آلية
استراتيجيات تدريب قابلة للتوسع
البدء مع Wan2.1-T2V-14B نموذج
الوصول إلى الصفحة: زيارة مستودع Hugging Face
تحميل النموذج: تنزيل نموذج T2V-14B
تكوين البيئة: إعداد التبعيات
التكامل: استخدام عرض Gradio
التعديل الدقيق: ضبط معلمات النموذج
حالات استخدام Wan2.1-T2V-14B نموذج
- إنشاء نص إلى فيديو
- تحويل الصورة إلى فيديو
- تحرير الفيديو
- توليد نص متعدد اللغات
- توليد فيديو بدقة عالية








