الوصف
يقدم TokenFlow إطار عمل مبتكر لتحرير الفيديو المتسق، مستفيدًا من نماذج الانتشار المدربة مسبقًا من النص إلى صورة دون الحاجة إلى أي تدريب أو ضبط إضافي. امتدت التطورات السريعة في الذكاء الاصطناعي التوليدي إلى توليد الفيديو، ومع ذلك غالبًا ما تقصر نماذج الفيديو المتطورة الحالية عن نماذج الصور من حيث الجودة المرئية والتحكم في المستخدم. تقدم هذه الورقة طريقة تستفيد من قوة نماذج الانتشار من النص إلى صورة لتحرير الفيديو المدفوع بالنص.
بالنظر إلى فيديو المصدر وموجه نصي مستهدف، يقوم TokenFlow بإنشاء فيديو عالي الجودة يتماشى مع النص المستهدف مع الحفاظ بدقة على التخطيط المكاني وديناميكيات فيديو الإدخال الأصلي. يكمن الابتكار الأساسي في ملاحظة أنه يمكن تحقيق الاتساق في الفيديو المُحرر من خلال فرض الاتساق داخل مساحة ميزات الانتشار. يتم تحقيق ذلك عن طريق نشر ميزات الانتشار بشكل صريح بناءً على الارتباطات بين الإطارات المتاحة بسهولة داخل النموذج. وبالتالي، يعمل الإطار دون الحاجة إلى أي تدريب أو ضبط وهو متوافق مع أي تقنية تحرير من النص إلى صورة جاهزة للاستخدام.
التطبيق متوفر في PyTorch وهو المستودع الرسمي لورقة "TokenFlow: Consistent Diffusion Features for Consistent Video Editing"، المقدمة في ICLR 2024. يوضح المشروع نتائج تحرير متطورة عبر مجموعة متنوعة من مقاطع الفيديو الواقعية. يمكن للمستخدمين استكشاف النتائج النموذجية وتفاصيل المشروع والأبحاث الأساسية من خلال الروابط المقدمة. تم تصميم الإطار للتحريرات التي تحافظ على الهيكل ويبني على تقنيات تحرير الصور الحالية مثل Plug-and-Play و ControlNet و SDEdit. يُنصح المستخدمون بالتأكد من التوافق مع تقنية التحرير الأساسية التي يختارونها، حيث قد يؤدي فك تشفير LDM إلى ظهور اهتزازات طفيفة اعتمادًا على محتوى الفيديو الأصلي.
الميزات الأساسية لـ TokenFlow
تطبيق PyTorch رسمي لـ TokenFlow
يتيح تحرير الفيديو المتسق باستخدام نماذج الانتشار المدربة مسبقًا
لا يتطلب تدريبًا أو ضبطًا إضافيًا
يحافظ على التخطيط المكاني وديناميكيات مقاطع الفيديو المدخلة
يحقق تحرير الفيديو المدفوع بالنص
يفرض الاتساق في مساحة ميزات الانتشار
يستخدم الارتباطات بين الإطارات لنشر الميزات
متوافق مع طرق التحرير الجاهزة من النص إلى صورة
يعرض نتائج تحرير متطورة
يدعم التحريرات التي تحافظ على الهيكل
يعمل مع تقنيات Plug-and-Play و ControlNet و SDEdit
البدء مع TokenFlow
استنساخ: استنسخ مستودع TokenFlow من GitHub.
تثبيت التبعيات: أنشئ بيئة conda وقم بتثبيت الحزم المطلوبة باستخدام `pip install -r requirements.txt`.
المعالجة المسبقة: قم بإعداد الفيديو الخاص بك عن طريق تشغيل `python preprocess.py` مع مسار البيانات المحدد وموجه الاستدعاء.
التكوين: قم بإنشاء ملف تكوين YAML لطريقة التحرير التي اخترتها (على سبيل المثال، `configs/config_pnp.yaml`).
التنفيذ: قم بتشغيل برنامج التحرير النصي، مثل `python run_tokenflow_pnp.py`، باستخدام التكوين الخاص بك.
حالات استخدام TokenFlow
- تعديل الفيديو المدفوع بالنص
- تحرير الفيديو الذي يحافظ على الهيكل
- إنشاء محتوى فيديو مدعوم بالذكاء الاصطناعي
- تحسين جودة الفيديو
- البحث والتطوير في ذكاء الفيديو الاصطناعي





