تخطَّ إلى المحتوى الرئيسي
ToolPotion

DreamTalk

DreamTalk هو إطار عمل قائم على الانتشار لتوليد مقاطع فيديو لوجوه متحدثة معبرة من الصوت. ينتج نتائج عالية الجودة عبر أنماط تحدث متنوعة، ويتعامل مع مدخلات صوتية مختلفة مثل الكلام والأغاني والصوت المشوش، مع أداء قوي على صور شخصية خارج النطاق. يوفر المشروع تطبيقات رسمية للأبحاث.

زيارة الرابط

الوصف

DreamTalk هو تطبيق رسمي لإطار عمل قائم على الانتشار لتوليد وجوه متحدثة معبرة مدفوعة بالصوت. تم تصميم هذه الأداة لإنتاج مقاطع فيديو عالية الجودة لوجوه متحدثة تعكس بدقة أنماط التحدث والعواطف المتنوعة. تكمن قدرته الأساسية في أدائه القوي عبر مجموعة واسعة من المدخلات، بما في ذلك الكلام القياسي والأغاني والصوت متعدد اللغات، وحتى الإشارات الصوتية المشوشة. علاوة على ذلك، يُظهر DreamTalk مرونة عند معالجة صور شخصية خارج النطاق، مما يجعله حلاً متعدد الاستخدامات لمختلف التطبيقات.

يستفيد الإطار من نماذج الانتشار الاحتمالية لتحقيق توليد الفيديو المعبر والواقعي الخاص به. يمكن للمستخدمين تثبيت المشروع باستخدام conda و pip، مع اتباع متطلبات إصدار محددة لـ PyTorch و torchvision و torchaudio والتبعيات الأخرى. تتضمن عملية التثبيت إنشاء بيئة conda مخصصة ثم تثبيت الحزم اللازمة من ملف المتطلبات.

بالنسبة للمستخدمين المهتمين بالحصول على نقاط التحقق المدربة مسبقًا، تم إيقاف الوصول إلى التنزيل العام بسبب اعتبارات التأثير الاجتماعي. يجب على الأطراف المهتمة طلب نقاط التحقق عبر البريد الإلكتروني، والموافقة صراحةً على استخدامها لأغراض البحث الأكاديمي فقط. بمجرد الحصول عليها، يجب وضع نقاط التحقق في مجلد "checkpoints" المخصص.

يتضمن الاستدلال باستخدام DreamTalk تشغيل برنامج نصي Python مع العديد من المعلمات الرئيسية. تشمل هذه المسارات لملف الصوت المدخل (يدعم تنسيقات مختلفة مثل wav و mp3 و m4a و mp4)، ومقطع نمط مرجعي، وتسلسل وضع الرأس، وصورة الملف الشخصي المدخلة. تتحكم المعلمات الإضافية مثل "cfg_scale" في شدة أنماط التحدث، بينما تحدد "max_gen_len" الحد الأقصى لمدة توليد الفيديو. يتم حفظ الفيديو الناتج في مجلد "output_video"، مع النتائج الوسيطة في مجلد مؤقت.

يقدم DreamTalk أيضًا حلولًا مخصصة لتحسين دقة الفيديو. يُقترح طريقتان: CodeFormer لدقة تصل إلى 1024x1024، على الرغم من أنها أبطأ وقد تواجه مشكلات في عدم الاتساق الزمني، ونموذج الدقة الفائقة الزمني من MetaPortrait لدقة 512x512 مع أداء أسرع واتساق زمني، على الرغم من أنه قد يقلل من شدة تعابير الوجه. يعترف المشروع بالأعمال السابقة في هذا المجال ويبني عليها، مع الاستشهاد بالأبحاث ذات الصلة وتوفير إدخال اقتباس للاستخدام الأكاديمي.

الميزات الأساسية لـ DreamTalk

  • توليد وجوه متحدثة مدفوعة بالصوت تعتمد على الانتشار

  • إخراج فيديو عالي الجودة بأنماط تحدث متنوعة

  • أداء قوي مع مدخلات صوتية مختلفة (كلام، أغاني، صوت مشوش)

  • يتعامل مع صور شخصية خارج النطاق

  • يدعم لغات متعددة

  • يوفر كود تطبيق رسمي

  • يتضمن برنامج نصي للاستدلال لتوليد الفيديو

  • يقدم حلولًا مخصصة لتحسين الدقة (CodeFormer، MetaPortrait)

  • معلمات قابلة للتعديل لشدة النمط وطول التوليد

  • يدعم الاستدلال على وحدة المعالجة المركزية (CPU)

البدء مع DreamTalk

  1. الاستنساخ: استنسخ مستودع DreamTalk من GitHub.

  2. تثبيت التبعيات: قم بإنشاء بيئة conda وقم بتثبيت الحزم المطلوبة باستخدام requirements.txt المقدم.

  3. تنزيل نقاط التحقق: اطلب نقاط التحقق عبر البريد الإلكتروني للبحث الأكاديمي وضعها في مجلد "checkpoints".

  4. إعداد المدخلات: اجمع الصوت المدخل، ومقاطع النمط المرجعي، وتسلسلات وضع الرأس، وصور الملف الشخصي.

  5. تكوين الاستدلال: حدد مسارات المدخلات والمعلمات مثل cfg_scale و max_gen_len في البرنامج النصي للاستدلال.

  6. تنفيذ الاستدلال: قم بتشغيل البرنامج النصي للاستدلال (على سبيل المثال، python inference_for_demo_video.py) لتوليد مقاطع فيديو لوجوه متحدثة.

  7. تحسين الدقة (اختياري): قم بتطبيق CodeFormer أو MetaPortrait لتحسين دقة الفيديو.

  8. الاستخدام للبحث: استخدم مقاطع الفيديو المولدة لأغراض البحث الأكاديمي.

حالات استخدام DreamTalk

  • توليد وجوه متحدثة معبرة
  • توليف الصوت والفيديو
  • البحث في الرسوم المتحركة بالذكاء الاصطناعي
  • وجوه متحدثة متعددة اللغات
  • نقل الأنماط للوجوه
  • التعامل مع الصوت المشوش

الأسئلة الشائعة من DreamTalk

تقييمات DreamTalk

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل DreamTalk

مستودعات GitHub للذكاء الاصطناعي

Hallo هو نموذج ذكاء اصطناعي لتحريك صور البورتريه باستخدام الصوت. يقوم بتوليف ميزات مرئية هرمية من الصوت، مما يتيح رسومًا متحركة واقعية ومعبرة للبورتريه. يوفر المشروع رمزًا…

مولّدات الفيديو بالذكاء الاصطناعي

تطبيقات الذكاء الاصطناعي

Seedance 2.0 هو مولد فيديو موحد متعدد الوسائط يعتمد على الذكاء الاصطناعي، يقوم بتحويل النصوص والصور والمراجع الصوتية أو الفيديو إلى مقاطع سينمائية بدقة 1080 بكسل مع مزامنة شفاه…

مولّدات الفيديو بالذكاء الاصطناعيالإعلام والترفيه

تطبيقات الذكاء الاصطناعي

شركة متخصصة في توليد الفيديو باستخدام الذكاء الاصطناعي، وراء عائلة نماذج Magi، بما في ذلك MAGI-2 Preview، وهو نموذج موحد للصوت والفيديو يولد حوارًا متزامنًا، وغناءً، وحركة كاميرا…

مولّدات الفيديو بالذكاء الاصطناعيالإعلام والترفيه

تطبيقات الذكاء الاصطناعي

Wav2Lip هو أداة مجانية على الإنترنت لمزامنة الشفاه، تقوم بإنشاء مقاطع فيديو واقعية لوجوه تتحدث من خلال مزامنة حركات الفم بدقة مع أي صوت، سواء من صورة ثابتة أو مقطع فيديو موجود.

مولّدات الفيديو بالذكاء الاصطناعيالإعلام والترفيه

تطبيقات الذكاء الاصطناعي

Monet AI هي منصة متكاملة لإنشاء المحتوى البصري تجمع بين أكثر من 20 نموذج رائد للفيديو والصورة والصوت في حساب واحد، مما يتيح للمبدعين إنشاء ومقارنة المحتوى الذكي دون الحاجة للتبديل…

مولّدات الفيديو بالذكاء الاصطناعيوكالات التسويق والإبداع

تطبيقات الذكاء الاصطناعي

VlogMe هي منصة لإنشاء الفيديوهات باستخدام الذكاء الاصطناعي مع سير عمل يقوده مخرج يخطط وينتج ويحرر ويجمع مقاطع فيديو متعددة المشاهد كاملة، تجمع بين نماذج الفيديو والصور المتميزة،…

مولّدات الفيديو بالذكاء الاصطناعي

تطبيقات الذكاء الاصطناعي

LipsyncX هو مولد فيديو للغناء بالشفاه يعتمد على الذكاء الاصطناعي، يقوم بتحويل الصور والفيديوهات والنصوص والأصوات إلى صور متحدثة، ومقاطع مدبلجة، وفيديوهات غنائية، وفيديوهات أفاتار…

مولّدات الفيديو بالذكاء الاصطناعيالإعلام والترفيه

تطبيقات الذكاء الاصطناعي

Seedance 2 Pro هي منصة لتوليد الفيديوهات باستخدام الذكاء الاصطناعي مبنية على نموذج Seedance 2، والتي تنتج فيديوهات بجودة سينمائية مع صوت متزامن من النصوص والصور والمراجع متعددة…

مولّدات الفيديو بالذكاء الاصطناعيوكالات التسويق والإبداع