تخطَّ إلى المحتوى الرئيسي
ToolPotion

Imagen Video

Imagen Video هو نظام لتوليد الفيديو المشروط بالنص طورته Google Research. يستفيد من سلسلة من نماذج الانتشار للفيديو لإنشاء مقاطع فيديو عالية الدقة من مطالبات نصية، مما يوفر دقة عالية وقابلية للتحكم ومعرفة بالعالم لتطبيقات إبداعية متنوعة.

زيارة الرابط

الوصف

يمثل Imagen Video تقدمًا كبيرًا في توليد الفيديو المدعوم بالذكاء الاصطناعي، وهو مبني على بنية معقدة من نماذج الانتشار المتتالية للفيديو. تم تصميم هذا النظام لترجمة الأوصاف النصية إلى مقاطع فيديو عالية الدقة بدقة ملحوظة ودرجة عالية من التحكم. في جوهره، يستخدم Imagen Video نموذجًا أساسيًا لتوليد الفيديو ينتج فيديو أوليًا منخفض الدقة، والذي يتم تحسينه بعد ذلك بواسطة سلسلة من نماذج زيادة الدقة المكانية والزمانية المتداخلة. يسمح هذا النهج المتتالي بالزيادة التدريجية لدقة الفيديو، مما يؤدي في النهاية إلى إنشاء مخرجات مفصلة بدقة تصل إلى 1280x768 بكسل ومعدلات إطارات تصل إلى 24 إطارًا في الثانية.

تتضمن بنية النظام مشفر نص T5 لتفسير المطالبات المدخلة، وتحويلها إلى تضمينات نصية توجه عملية الانتشار. يولد نموذج الانتشار الأساسي للفيديو فيديو أساسيًا مكونًا من 16 إطارًا بدقة 40x24 ومعدل 3 إطارات في الثانية. تعمل نماذج زيادة الدقة الزمانية (TSR) وزيادة الدقة المكانية (SSR) اللاحقة بالتوازي لزيادة كل من عدد الإطارات والأبعاد المكانية، مما يؤدي إلى فيديو نهائي يصل إلى 128 إطارًا، بطول حوالي 5.3 ثوانٍ. تضمن هذه العملية المعقدة أن مقاطع الفيديو التي تم إنشاؤها ليست متماسكة بصريًا فحسب، بل تلتقط أيضًا ديناميكيات زمنية معقدة.

تمتد قدرات Imagen Video إلى ما هو أبعد من مجرد إنشاء الفيديو البسيط. إنه يظهر درجة عالية من المعرفة بالعالم، مما يمكّنه من إنشاء مقاطع فيديو متنوعة تعكس مفاهيم وأشياء العالم الحقيقي. النموذج بارع أيضًا في إنتاج رسوم متحركة بأنماط فنية مختلفة ويظهر فهمًا للأشياء ثلاثية الأبعاد، مما يعزز إمكاناته الإبداعية. بنية U-Net للفيديو، التي يستخدمها Imagen Video، ضرورية لالتقاط كل من الدقة المكانية والديناميكيات الزمنية، باستخدام الانتباه الذاتي الزماني في النموذج الأساسي والتلافيف الزمانية في مراحل زيادة الدقة. هذه البنية تمكن النموذج من إدارة التبعيات الزمنية طويلة المدى بفعالية داخل مقاطع الفيديو التي تم إنشاؤها.

بينما يعرض Imagen Video قدرات توليدية مثيرة للإعجاب، اعترفت Google Research بالاعتبارات الأخلاقية واحتمالية إساءة استخدام أدوات الذكاء الاصطناعي القوية هذه. قامت الشركة بتطبيق آليات تصفية داخلية لكل من المطالبات النصية المدخلة ومحتوى الفيديو الناتج للتخفيف من المخاطر مثل إنشاء محتوى مزيف أو يحض على الكراهية أو صريح أو ضار. ومع ذلك، لا تزال هناك تحديات في معالجة التحيزات الاجتماعية والصور النمطية المضمنة في بيانات التدريب. نظرًا لهذه المخاوف المستمرة المتعلقة بالسلامة والأخلاق، لم يتم إصدار النموذج وشفرته المصدرية للجمهور.

أبرز ملامح Imagen Video

  • توليد الفيديو المشروط بالنص

  • نماذج الانتشار المتتالية للفيديو

  • إخراج فيديو عالي الدقة (حتى 1280x768، 24 إطارًا في الثانية)

  • مشفر نص T5 لتفسير المطالبات

  • نموذج الانتشار الأساسي للفيديو

  • نماذج زيادة الدقة الزمانية (TSR)

  • نماذج زيادة الدقة المكانية (SSR)

  • بنية U-Net للفيديو

  • الانتباه الذاتي الزماني

  • التلافيف الزمانية

  • درجة عالية من التحكم

  • دمج المعرفة بالعالم

  • توليد فيديو متنوع

  • توليد الأنماط الفنية

  • فهم الأشياء ثلاثية الأبعاد

البدء مع Imagen Video

  1. مطالبة نصية مدخلة: قدم وصفًا نصيًا مفصلاً للمحتوى المرئي المطلوب.

  2. ترميز النص: يقوم مشفر نص T5 بمعالجة المطالبة إلى تضمينات.

  3. توليد الفيديو الأساسي: ينشئ نموذج الانتشار للفيديو فيديو أوليًا منخفض الدقة.

  4. تحسين زيادة الدقة: تقوم نماذج TSR و SSR المتتالية بزيادة دقة الفيديو إلى الدقة العالية.

  5. الإخراج النهائي: إنشاء فيديو عالي الدقة وعالي الجودة بناءً على المطالبة.

حالات استخدام Imagen Video

  • توليد المحتوى الإبداعي
  • النماذج الأولية والتصور
  • الرسوم المتحركة والرسومات المتحركة
  • القصص المصورة والتصور المسبق
  • إنشاء المحتوى التعليمي
  • الرسوم المتحركة للنص

الأسئلة الشائعة من Imagen Video

تقييمات Imagen Video

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل Imagen Video

نماذج الذكاء الاصطناعي

Lumiere هو نموذج انتشار زمني مكاني من Google Research لتوليد مقاطع فيديو واقعية ومتنوعة ومتماسكة. يقوم بتصنيع مدة الفيديو بالكامل في تمريرة واحدة، مما يتيح مهام متقدمة من النص إلى…

مولّدات الفيديو بالذكاء الاصطناعي

نماذج الذكاء الاصطناعي

Imagen هو نموذج انتشار نص إلى صورة طورته Google Research. يقوم بإنشاء صور واقعية للغاية مع فهم عميق للغة. يتفوق Imagen في محاذاة الصورة والنص ودقة العينات، متفوقًا على النماذج…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

VideoPoet هو نموذج لغوي كبير من Google Research قادر على توليد الفيديو بدون تدريب مسبق (zero-shot). يقوم بتحويل نماذج اللغة التنبؤية الذاتية إلى مولدات فيديو عالية الجودة، ويدعم…

مولّدات الفيديو بالذكاء الاصطناعي

نماذج الذكاء الاصطناعي

Make-A-Video هو نظام ذكاء اصطناعي متقدم يولد مقاطع فيديو من مطالبات نصية. يستفيد من تقدم تحويل النص إلى صور وبيانات الفيديو غير المصنفة لفهم مظهر العالم وحركته، مما يمكّن…

مولّدات الفيديو بالذكاء الاصطناعي

تطبيقات الذكاء الاصطناعي

أنشئ مقاطع فيديو مذهلة تم إنشاؤها بواسطة الذكاء الاصطناعي مع تحكم إبداعي كامل. قم بتحميل الصور ونصوص التوجيه لإنشاء مقاطع فيديو عالية الدقة بسرعة وسهولة، دون الحاجة إلى برامج…

مولّدات الفيديو بالذكاء الاصطناعيالإعلام والترفيه

الذكاء الاصطناعي لتحويل الصور إلى فيديو مجاني هو مولد فيديو متعدد النماذج يسمح للمستخدمين بإنشاء مقاطع فيديو من النصوص أو الصور أو الإطارات الرئيسية. يجمع بين نماذج الفيديو…

مولّدات الفيديو بالذكاء الاصطناعي

تطبيقات الذكاء الاصطناعي

VideoAI هو مولد فيديو بالذكاء الاصطناعي يحول النصوص والصور إلى مقاطع فيديو باستخدام نماذج رائدة مثل Kling وWan وSeedance وVeo. كما يقدم أدوات للصور وتوليد موسيقى بالذكاء الاصطناعي…

مولّدات الفيديو بالذكاء الاصطناعيالإعلام والترفيه

تطبيقات الذكاء الاصطناعي

Yolly AI هو مولد فيديو وصورة بالذكاء الاصطناعي شامل يجمع بين النماذج الرائدة لإنشاء مقاطع فيديو بدقة 4K بمستوى سينمائي مع صوت وصور عالية الدقة من نصوص أو صور أو فيديوهات موجودة.

مولّدات الفيديو بالذكاء الاصطناعيالإعلام والترفيه