الوصف
Hallo: توليف مرئي هرمي مدفوع بالصوت لرسوم صور البورتريه هو مشروع مفتوح المصدر مستضاف على GitHub، تم تطويره بواسطة باحثين من جامعة فودان، وشركة بايدو، وجامعة زيورخ الفيدرالية، وجامعة نانجينغ. يركز نموذج الذكاء الاصطناعي هذا على إنشاء رسوم متحركة ديناميكية لصور البورتريه مدفوعة بمدخلات صوتية. يحقق ذلك عن طريق توليف هرمي للميزات المرئية التي تتوافق مع الفروق الدقيقة للصوت، مما يسمح بحركات وتعبيرات وجه واقعية.
يقدم المشروع موارد شاملة لكل من المستخدمين والمطورين. للاستدلال، يمكن للمستخدمين تنزيل نماذج مدربة مسبقًا واستخدام برنامج نصي بسيط لتحريك صورة مصدر بملف صوتي توجيهي. يتطلب النظام تنسيقات إدخال محددة لكل من الصور والصوت، مع توفير إرشادات للحصول على أفضل النتائج. عادةً ما يتم حفظ مخرجات الرسوم المتحركة كملف فيديو.
بالنسبة للباحثين والمطورين المهتمين بالتخصيص أو التطوير الإضافي، يوفر Hallo الرمز اللازم لتدريب النموذج. يتضمن ذلك إعداد بنية مجموعة بيانات محددة، وتشغيل برامج نصية لمعالجة البيانات المسبقة، ثم بدء عملية التدريب باستخدام أطر الحوسبة الموزعة مثل Hugging Face Accelerate. يتم تضمين تعليمات مفصلة وأمثلة لملفات التكوين لتوجيه المستخدمين خلال خط أنابيب التدريب.
يسلط المشروع الضوء أيضًا على مجتمع متنامٍ ساهم في تحسينات وتكاملات مختلفة، مثل إصدارات WebUI، والتوافق مع Windows، وقوالب Docker. تهدف هذه الموارد التي يقودها المجتمع إلى جعل Hallo أكثر سهولة وتنوعًا لمجموعة واسعة من التطبيقات. يلتزم المطورون بالاعتبارات الأخلاقية، مع الاعتراف بإمكانية إساءة استخدام هذه التقنيات والتأكيد على أهمية التطوير المسؤول وضمانات الخصوصية.
تستفيد بنية Hallo من العديد من النماذج المدربة مسبقًا لمهام مثل تحليل الوجه، وفصل الصوت، ونماذج الانتشار، وكلها مفصلة في المستودع. يتم صيانة المشروع بنشاط، مع خارطة طريق تشير إلى التحسينات المستقبلية وإصلاحات الأخطاء. الهدف هو دفع أحدث ما توصلت إليه التكنولوجيا في التوليف المرئي المدفوع بالصوت لرسوم البورتريه، وتعزيز كل من البحث والتطبيقات الإبداعية.
الميزات الأساسية لـ Hallo: توليف مرئي هرمي مدفوع بالصوت
توليف مرئي هرمي مدفوع بالصوت لرسوم البورتريه
يولد حركات وتعبيرات وجه واقعية من الصوت
يوفر برامج نصية للاستدلال لتحريك الصور بالصوت
يتضمن رمزًا لتدريب النموذج على مجموعات بيانات مخصصة
يقدم نماذج مدربة مسبقًا للاستخدام الفوري
يدعم المعالجة المسبقة للبيانات للتدريب
يتكامل مع Hugging Face Accelerate للتدريب الموزع
موارد مساهمة من المجتمع مثل WebUI وصور Docker
وثائق مفصلة للإعداد والاستخدام والتدريب
يعالج المخاطر الاجتماعية والاعتبارات الأخلاقية
البدء مع Hallo: توليف مرئي هرمي مدفوع بالصوت
استنساخ: استنسخ مستودع Hallo من GitHub.
التثبيت: قم بإعداد بيئة conda وقم بتثبيت حزم Python المطلوبة.
تنزيل النماذج: احصل على جميع النماذج المدربة مسبقًا الضرورية من HuggingFace.
إعداد البيانات: قم بتنسيق الصور المصدر والصوت التوجيهي وفقًا للمواصفات.
تشغيل الاستدلال: قم بتشغيل برنامج نصي للاستدلال مع الصورة المصدر والصوت التوجيهي.
تدريب النموذج: قم بإعداد بيانات التدريب، وتشغيل برامج المعالجة المسبقة للبيانات، وبدء مهام التدريب.
حالات استخدام Hallo: توليف مرئي هرمي مدفوع بالصوت
- تحريك البورتريه
- الأفاتارات الافتراضية
- إنشاء المحتوى
- البحث في الذكاء الاصطناعي
- سرد القصص الرقمية








