الوصف
DreamTalk هو تطبيق رسمي لإطار عمل قائم على الانتشار لتوليد وجوه متحدثة معبرة مدفوعة بالصوت. تم تصميم هذه الأداة لإنتاج مقاطع فيديو عالية الجودة لوجوه متحدثة تعكس بدقة أنماط التحدث والعواطف المتنوعة. تكمن قدرته الأساسية في أدائه القوي عبر مجموعة واسعة من المدخلات، بما في ذلك الكلام القياسي والأغاني والصوت متعدد اللغات، وحتى الإشارات الصوتية المشوشة. علاوة على ذلك، يُظهر DreamTalk مرونة عند معالجة صور شخصية خارج النطاق، مما يجعله حلاً متعدد الاستخدامات لمختلف التطبيقات.
يستفيد الإطار من نماذج الانتشار الاحتمالية لتحقيق توليد الفيديو المعبر والواقعي الخاص به. يمكن للمستخدمين تثبيت المشروع باستخدام conda و pip، مع اتباع متطلبات إصدار محددة لـ PyTorch و torchvision و torchaudio والتبعيات الأخرى. تتضمن عملية التثبيت إنشاء بيئة conda مخصصة ثم تثبيت الحزم اللازمة من ملف المتطلبات.
بالنسبة للمستخدمين المهتمين بالحصول على نقاط التحقق المدربة مسبقًا، تم إيقاف الوصول إلى التنزيل العام بسبب اعتبارات التأثير الاجتماعي. يجب على الأطراف المهتمة طلب نقاط التحقق عبر البريد الإلكتروني، والموافقة صراحةً على استخدامها لأغراض البحث الأكاديمي فقط. بمجرد الحصول عليها، يجب وضع نقاط التحقق في مجلد "checkpoints" المخصص.
يتضمن الاستدلال باستخدام DreamTalk تشغيل برنامج نصي Python مع العديد من المعلمات الرئيسية. تشمل هذه المسارات لملف الصوت المدخل (يدعم تنسيقات مختلفة مثل wav و mp3 و m4a و mp4)، ومقطع نمط مرجعي، وتسلسل وضع الرأس، وصورة الملف الشخصي المدخلة. تتحكم المعلمات الإضافية مثل "cfg_scale" في شدة أنماط التحدث، بينما تحدد "max_gen_len" الحد الأقصى لمدة توليد الفيديو. يتم حفظ الفيديو الناتج في مجلد "output_video"، مع النتائج الوسيطة في مجلد مؤقت.
يقدم DreamTalk أيضًا حلولًا مخصصة لتحسين دقة الفيديو. يُقترح طريقتان: CodeFormer لدقة تصل إلى 1024x1024، على الرغم من أنها أبطأ وقد تواجه مشكلات في عدم الاتساق الزمني، ونموذج الدقة الفائقة الزمني من MetaPortrait لدقة 512x512 مع أداء أسرع واتساق زمني، على الرغم من أنه قد يقلل من شدة تعابير الوجه. يعترف المشروع بالأعمال السابقة في هذا المجال ويبني عليها، مع الاستشهاد بالأبحاث ذات الصلة وتوفير إدخال اقتباس للاستخدام الأكاديمي.
الميزات الأساسية لـ DreamTalk
توليد وجوه متحدثة مدفوعة بالصوت تعتمد على الانتشار
إخراج فيديو عالي الجودة بأنماط تحدث متنوعة
أداء قوي مع مدخلات صوتية مختلفة (كلام، أغاني، صوت مشوش)
يتعامل مع صور شخصية خارج النطاق
يدعم لغات متعددة
يوفر كود تطبيق رسمي
يتضمن برنامج نصي للاستدلال لتوليد الفيديو
يقدم حلولًا مخصصة لتحسين الدقة (CodeFormer، MetaPortrait)
معلمات قابلة للتعديل لشدة النمط وطول التوليد
يدعم الاستدلال على وحدة المعالجة المركزية (CPU)
البدء مع DreamTalk
الاستنساخ: استنسخ مستودع DreamTalk من GitHub.
تثبيت التبعيات: قم بإنشاء بيئة conda وقم بتثبيت الحزم المطلوبة باستخدام requirements.txt المقدم.
تنزيل نقاط التحقق: اطلب نقاط التحقق عبر البريد الإلكتروني للبحث الأكاديمي وضعها في مجلد "checkpoints".
إعداد المدخلات: اجمع الصوت المدخل، ومقاطع النمط المرجعي، وتسلسلات وضع الرأس، وصور الملف الشخصي.
تكوين الاستدلال: حدد مسارات المدخلات والمعلمات مثل cfg_scale و max_gen_len في البرنامج النصي للاستدلال.
تنفيذ الاستدلال: قم بتشغيل البرنامج النصي للاستدلال (على سبيل المثال، python inference_for_demo_video.py) لتوليد مقاطع فيديو لوجوه متحدثة.
تحسين الدقة (اختياري): قم بتطبيق CodeFormer أو MetaPortrait لتحسين دقة الفيديو.
الاستخدام للبحث: استخدم مقاطع الفيديو المولدة لأغراض البحث الأكاديمي.
حالات استخدام DreamTalk
- توليد وجوه متحدثة معبرة
- توليف الصوت والفيديو
- البحث في الرسوم المتحركة بالذكاء الاصطناعي
- وجوه متحدثة متعددة اللغات
- نقل الأنماط للوجوه
- التعامل مع الصوت المشوش






