الوصف
DragGAN هو التنفيذ الرسمي للبحث المقدم في SIGGRAPH 2023، مع التركيز على التلاعب التفاعلي المستند إلى النقاط ضمن تشعب الصور التوليدية. يقدم هذا المشروع للباحثين والمطورين الكود لاستكشاف واستخدام نهج جديد لتحرير وتوليد الصور.
تتمحور الوظيفة الأساسية لـ DragGAN حول قدرته على السماح للمستخدمين بالتأثير مباشرة على عملية توليد الصور عن طريق تحديد نقاط رئيسية. من خلال سحب هذه النقاط، يمكن للمستخدمين توجيه الشبكة التوليدية التنافسية (GAN) لتعديل الصورة وفقًا للتحويلات المطلوبة. هذه الطريقة التفاعلية تتجاوز تعديل المعلمات التقليدية، وتقدم تحكمًا أكثر بديهية ودقة على المخرجات.
يتم استضافة المشروع على GitHub، مما يوفر مستودعًا عامًا للكود الرسمي. يتضمن مكونات مختلفة ضرورية لتشغيل النظام، مثل نصوص الأدوات المساعدة لواجهة المستخدم الرسومية، ومعالجة البيانات، والتدريب. يوضح المستودع أيضًا متطلبات إعداد البيئة، بما في ذلك التبعيات المحددة لوحدات معالجة الرسومات التي تدعم CUDA وإعدادات بديلة لنظام MacOS مع Apple Silicon أو التنفيذ بوحدة المعالجة المركزية فقط.
يعتمد DragGAN على معماريات GAN الحالية، مع الإشارة تحديدًا إلى StyleGAN3 كعنصر أساسي. يوفر المشروع تعليمات لتنزيل الأوزان المدربة مسبقًا لنماذج مثل StyleGAN2 و StyleGAN-Human و Landscapes HQ (LHQ)، مما يتيح للمستخدمين تجربة نماذج توليدية مختلفة. تسمح واجهة المستخدم الرسومية بتحرير الصور التي تم إنشاؤها بواسطة GAN، وبالنسبة للصور الحقيقية، تقترح استخدام تقنيات عكس GAN مثل PTI قبل تحميلها في واجهة DragGAN.
يؤكد المشروع على مساهمة المجتمع والشفافية، حيث يتم ترخيص الكود بموجب CC-BY-NC لخوارزمية DragGAN نفسها، بينما يلتزم الكود المشتق من StyleGAN3 بترخيص Nvidia Source Code License. شرط أساسي عبر جميع الاستخدامات هو الحفاظ على العلامة المائية التي تشير إلى أن الصورة تم إنشاؤها بواسطة الذكاء الاصطناعي.
هذه الأداة قيمة بشكل خاص للباحثين في مجال رؤية الكمبيوتر والذكاء الاصطناعي، وكذلك للفنانين والمصممين الذين يبحثون عن قدرات متقدمة لمعالجة الصور. الطبيعة التفاعلية لـ DragGAN تضفي طابعًا ديمقراطيًا على تحرير الصور المعقد، مما يجعلها أكثر سهولة وكفاءة لمجموعة واسعة من التطبيقات الإبداعية والتقنية.
الميزات الأساسية لـ DragGAN Official Code
التلاعب التفاعلي بالصور المستند إلى النقاط على التشعبات التوليدية
إصدار الكود الرسمي لبحث SIGGRAPH 2023
تحكم مباشر في توليد صور GAN عبر نقاط محددة
دعم تحرير الصور التي تم إنشاؤها بواسطة GAN
تعليمات لعكس GAN لتحرير الصور الحقيقية
تنزيل الأوزان المدربة مسبقًا لنماذج GAN المختلفة
واجهة مستخدم رسومية لتحرير الصور البديهي
دعم Docker للنشر والتنفيذ السهل
تعليمات إعداد البيئة لـ CUDA و MPS (أجهزة Mac M1/M2) ووحدة المعالجة المركزية
كود يعتمد على معمارية StyleGAN3
وظيفة العلامة المائية لتحديد المحتوى الذي تم إنشاؤه بواسطة الذكاء الاصطناعي
البدء مع DragGAN Official Code
استنساخ المستودع: احصل على كود DragGAN الرسمي من مستودع GitHub.
تثبيت التبعيات: قم بإعداد حزم Python وإصدارات CUDA المطلوبة باستخدام ملفات البيئة المقدمة.
تنزيل النماذج: احصل على أوزان GAN المدربة مسبقًا للنماذج المطلوبة (مثل StyleGAN2 و StyleGAN-Human).
تشغيل واجهة المستخدم الرسومية: قم بتشغيل واجهة المستخدم الرسومية لـ DragGAN لتحرير الصور التفاعلي.
إجراء عكس GAN (للصور الحقيقية): استخدم أدوات مثل PTI لعكس الصور الحقيقية إلى مساحة كامنة لـ GAN.
التحميل والتحرير: قم بتحميل الصور المعكوسة أو الصور التي تم إنشاؤها بواسطة GAN في واجهة المستخدم الرسومية واستخدم التلاعب بالنقاط للتحرير.
استخدام Docker (اختياري): قم ببناء وتشغيل صورة Docker المقدمة لبيئة مستقلة.
حالات استخدام DragGAN Official Code
- تحرير الصور التفاعلي
- التحكم في النماذج التوليدية
- تنقيح توليد فن الذكاء الاصطناعي
- البحث في توليف الصور
- تطوير الأدوات الإبداعية
- تطبيق عكس GAN







