الوصف
يمثل VideoPoet تقدمًا كبيرًا في توليف الفيديو المدفوع بالذكاء الاصطناعي، حيث يعمل كنموذج لغوي كبير مصمم لتوليد الفيديو بدون تدريب مسبق (zero-shot). يكمن ابتكاره الأساسي في طريقة نمذجة بسيطة تمكن من تحويل أي نموذج لغوي تنبؤي ذاتي إلى مولد فيديو متطور. يسمح هذا النهج بإنشاء مقاطع فيديو عالية الجودة من مطالبات نصية، مما يدل على قدرة ملحوظة على إنتاج مجموعة واسعة من الحركات الكبيرة والمثيرة للاهتمام وذات الدقة العالية.
في أساسه التقني، يستخدم VideoPoet مُرمّز فيديو MAGVIT V2 مُدرّب مسبقًا ومُرمّز صوت SoundStream. تقوم هذه المكونات بتحويل مقاطع الصور والفيديو والصوت ذات الأطوال المتغيرة إلى رموز منفصلة ضمن مفردات موحدة. هذه الرموز متوافقة مع النماذج اللغوية المستندة إلى النص، مما يسهل التكامل السلس مع الوسائط الأخرى مثل النص. بعد ذلك، يتعلم نموذج لغوي تنبؤي ذاتي عبر وسائط الفيديو والصورة والصوت والنص للتنبؤ بالرمز التالي للفيديو أو الصوت في التسلسل. يشتمل إطار التدريب على مزيج من أهداف التعلم التوليدي متعدد الوسائط، بما في ذلك التحويل من نص إلى فيديو، ومن نص إلى صورة، ومن صورة إلى فيديو، واستمرارية إطارات الفيديو، وملء وإخراج الفيديو، وتنميط الفيديو، ومن فيديو إلى صوت. يمكن تجميع هذه المهام لتحقيق قدرات إضافية بدون تدريب مسبق، مثل توليد الصوت من النص.
تمتد قدرات VideoPoet إلى ما هو أبعد من التوليد البسيط. يمكنه إخراج مقاطع فيديو ذات حركة عالية وطول متغير بناءً على مطالبات نصية، ويمكنه أيضًا إنشاء صوت لمطابقة فيديو مدخل دون توجيه نصي. يدعم النموذج إنشاء مقاطع فيديو بتنسيقات مربعة أو عمودية، مما يجعله مناسبًا للمحتوى القصير. علاوة على ذلك، فإنه يتفوق في تحرير الفيديو المتحكم فيه، مما يسمح للموضوعات باتباع حركات أو أنماط مختلفة، والتحرير التفاعلي حيث يمكن للمستخدمين الاختيار من بين المرشحين الذين تم إنشاؤهم لتحسين أنواع الحركة. يعد توليد الفيديو من الصور أيضًا ميزة رئيسية، حيث يقوم بتحويل أي صورة مدخلة إلى فيديو موجه بمطالبة نصية. يسمح التنميط بدون تدريب مسبق (zero-shot) لمقاطع الفيديو بتبني أنماط فنية مختلفة بناءً على مطالبات نصية، ويمكن تحديد حركات الكاميرا المتحكم فيها من خلال هندسة المطالبات، مما يتيح تأثيرات مثل التكبير، وتكبير دوللي، ولقطات طائرات بدون طيار FPV.
يعرض النموذج توليد فيديو متطور، خاصة في إنتاج حركات متنوعة وعالية الدقة. يمكنه إنشاء مقاطع فيديو أطول عن طريق التنبؤ بشكل متكرر بثانية واحدة من الإخراج بناءً على مقطع إدخال مدته ثانية واحدة، مما يظهر الحفاظ القوي على هوية الكائن. هذا يجعل VideoPoet أداة قوية لسرد القصص المرئية، وإنشاء المحتوى، واستكشاف أشكال جديدة من توليف الوسائط. يسلط البحث الضوء على إمكاناته في إنشاء روايات مرئية ديناميكية وتطبيق التأثيرات الأسلوبية بسهولة.
أبرز ملامح VideoPoet
توليد فيديو بدون تدريب مسبق (zero-shot) من مطالبات نصية
توليد صوت من فيديو بدون توجيه نصي
يدعم التحويل من نص إلى فيديو، ومن نص إلى صورة، ومن صورة إلى فيديو
يمكّن استمرارية إطارات الفيديو، وملء وإخراج الفيديو
يسهل تنميط الفيديو وحركات الكاميرا المتحكم فيها
قادر على توليد مقاطع فيديو ذات طول متغير
يحافظ على هوية الكائن بقوة في المقاطع الأطول
يدعم تنسيقات الفيديو المربعة والعمودية للمحتوى القصير
تحرير فيديو تفاعلي مع اختيار المرشحين
يجمع أهداف التعلم التوليدي للمهام متعددة الوسائط
يستخدم مُرمّزات MAGVIT V2 و SoundStream
ينتج محتوى فيديو عالي الحركة وعالي الدقة
البدء مع VideoPoet
الوصول إلى النموذج: استخدم واجهة البحث أو واجهة برمجة التطبيقات (API) الخاصة بـ VideoPoet.
إدخال المطالبة: قدم وصفًا نصيًا مفصلاً للمحتوى المرئي المطلوب.
تحديد المعلمات: حدد تنسيق الفيديو (مربع/عمودي) والطول المطلوب.
توليد الفيديو: ابدأ عملية التوليد لإنشاء تسلسل الفيديو.
توليد الصوت: اختياريًا، قم بتوليد صوت مطابق للفيديو الذي تم إنشاؤه.
تحرير الفيديو: قم بتطبيق التنميط، أو حركات الكاميرا، أو التحرير التفاعلي للتحسين.
التكامل: قم بدمج مقاطع الفيديو التي تم إنشاؤها في مشاريع سرد القصص أو المحتوى.
حالات استخدام VideoPoet
- إنشاء المحتوى
- سرد القصص
- تحرير الفيديو
- النماذج الأولية
- الاستكشاف الفني
- المزامنة الصوتية المرئية
- الفيديو القصير
- تصور المفاهيم





