الوصف
يمثل Imagen Video تقدمًا كبيرًا في توليد الفيديو المدعوم بالذكاء الاصطناعي، وهو مبني على بنية معقدة من نماذج الانتشار المتتالية للفيديو. تم تصميم هذا النظام لترجمة الأوصاف النصية إلى مقاطع فيديو عالية الدقة بدقة ملحوظة ودرجة عالية من التحكم. في جوهره، يستخدم Imagen Video نموذجًا أساسيًا لتوليد الفيديو ينتج فيديو أوليًا منخفض الدقة، والذي يتم تحسينه بعد ذلك بواسطة سلسلة من نماذج زيادة الدقة المكانية والزمانية المتداخلة. يسمح هذا النهج المتتالي بالزيادة التدريجية لدقة الفيديو، مما يؤدي في النهاية إلى إنشاء مخرجات مفصلة بدقة تصل إلى 1280x768 بكسل ومعدلات إطارات تصل إلى 24 إطارًا في الثانية.
تتضمن بنية النظام مشفر نص T5 لتفسير المطالبات المدخلة، وتحويلها إلى تضمينات نصية توجه عملية الانتشار. يولد نموذج الانتشار الأساسي للفيديو فيديو أساسيًا مكونًا من 16 إطارًا بدقة 40x24 ومعدل 3 إطارات في الثانية. تعمل نماذج زيادة الدقة الزمانية (TSR) وزيادة الدقة المكانية (SSR) اللاحقة بالتوازي لزيادة كل من عدد الإطارات والأبعاد المكانية، مما يؤدي إلى فيديو نهائي يصل إلى 128 إطارًا، بطول حوالي 5.3 ثوانٍ. تضمن هذه العملية المعقدة أن مقاطع الفيديو التي تم إنشاؤها ليست متماسكة بصريًا فحسب، بل تلتقط أيضًا ديناميكيات زمنية معقدة.
تمتد قدرات Imagen Video إلى ما هو أبعد من مجرد إنشاء الفيديو البسيط. إنه يظهر درجة عالية من المعرفة بالعالم، مما يمكّنه من إنشاء مقاطع فيديو متنوعة تعكس مفاهيم وأشياء العالم الحقيقي. النموذج بارع أيضًا في إنتاج رسوم متحركة بأنماط فنية مختلفة ويظهر فهمًا للأشياء ثلاثية الأبعاد، مما يعزز إمكاناته الإبداعية. بنية U-Net للفيديو، التي يستخدمها Imagen Video، ضرورية لالتقاط كل من الدقة المكانية والديناميكيات الزمنية، باستخدام الانتباه الذاتي الزماني في النموذج الأساسي والتلافيف الزمانية في مراحل زيادة الدقة. هذه البنية تمكن النموذج من إدارة التبعيات الزمنية طويلة المدى بفعالية داخل مقاطع الفيديو التي تم إنشاؤها.
بينما يعرض Imagen Video قدرات توليدية مثيرة للإعجاب، اعترفت Google Research بالاعتبارات الأخلاقية واحتمالية إساءة استخدام أدوات الذكاء الاصطناعي القوية هذه. قامت الشركة بتطبيق آليات تصفية داخلية لكل من المطالبات النصية المدخلة ومحتوى الفيديو الناتج للتخفيف من المخاطر مثل إنشاء محتوى مزيف أو يحض على الكراهية أو صريح أو ضار. ومع ذلك، لا تزال هناك تحديات في معالجة التحيزات الاجتماعية والصور النمطية المضمنة في بيانات التدريب. نظرًا لهذه المخاوف المستمرة المتعلقة بالسلامة والأخلاق، لم يتم إصدار النموذج وشفرته المصدرية للجمهور.
أبرز ملامح Imagen Video
توليد الفيديو المشروط بالنص
نماذج الانتشار المتتالية للفيديو
إخراج فيديو عالي الدقة (حتى 1280x768، 24 إطارًا في الثانية)
مشفر نص T5 لتفسير المطالبات
نموذج الانتشار الأساسي للفيديو
نماذج زيادة الدقة الزمانية (TSR)
نماذج زيادة الدقة المكانية (SSR)
بنية U-Net للفيديو
الانتباه الذاتي الزماني
التلافيف الزمانية
درجة عالية من التحكم
دمج المعرفة بالعالم
توليد فيديو متنوع
توليد الأنماط الفنية
فهم الأشياء ثلاثية الأبعاد
البدء مع Imagen Video
مطالبة نصية مدخلة: قدم وصفًا نصيًا مفصلاً للمحتوى المرئي المطلوب.
ترميز النص: يقوم مشفر نص T5 بمعالجة المطالبة إلى تضمينات.
توليد الفيديو الأساسي: ينشئ نموذج الانتشار للفيديو فيديو أوليًا منخفض الدقة.
تحسين زيادة الدقة: تقوم نماذج TSR و SSR المتتالية بزيادة دقة الفيديو إلى الدقة العالية.
الإخراج النهائي: إنشاء فيديو عالي الدقة وعالي الجودة بناءً على المطالبة.
حالات استخدام Imagen Video
- توليد المحتوى الإبداعي
- النماذج الأولية والتصور
- الرسوم المتحركة والرسومات المتحركة
- القصص المصورة والتصور المسبق
- إنشاء المحتوى التعليمي
- الرسوم المتحركة للنص





