الوصف
V-JEPA، أو بنية التنبؤ المشترك للتضمين للفيديو، هي قاعدة كود رسمية لـ PyTorch تم تطويرها بواسطة Meta AI Research (FAIR) للتعلم ذاتي الإشراف للتمثيلات المرئية من الفيديو. تركز هذه الطريقة على تعلم تمثيلات مرئية قوية من خلال المراقبة السلبية لبكسلات الفيديو من مجموعات بيانات مثل VideoMix2M. على عكس النماذج التوليدية التي تعتمد على إعادة بناء البكسل، يستخدم V-JEPA هدف تنبؤ الميزات غير المراقب. لا يتطلب هذا النموذج مشفرات صور مدربة مسبقًا، أو نصًا، أو أمثلة سلبية، أو تعليقات بشرية، أو إعادة بناء على مستوى البكسل، مما يجعله نهجًا غير مراقب بالكامل.
يتضمن جوهر منهجية V-JEPA مُتنبئًا يعمل في مساحة كامنة، بدلاً من مُفكك تشفير البكسل. يقوم هذا المُتنبئ بعمل تنبؤات للمناطق المفقودة في الفيديو بناءً على الأجزاء المرصودة. لتصور هذه التنبؤات، يتم استخدام نموذج انتشار شرطي لفك تشفير تنبؤات المساحة الكامنة إلى بكسلات قابلة للتفسير. بشكل حاسم، أثناء عملية فك التشفير هذه، تظل شبكات التشفير والمُتنبئ المدربة مسبقًا لـ V-JEPA مجمدة، مما يضمن الحفاظ على التمثيلات المتعلمة.
تم تنظيم قاعدة الكود لتسهيل كل من التدريب المسبق والتقييم. تحدد ملفات التكوين في دليل `configs` معلمات التجربة، مما يسمح للمستخدمين بتخصيص المسارات للسجلات، ونقاط الفحص، وبيانات التدريب. يحتوي دليل `app` على حلقات التدريب، مع `main.py` لتصحيح الأخطاء المحلي و `main_distributed.py` لتشغيل التدريب الموزع على المجموعات باستخدام أدوات مثل submitit و SLURM. يضم دليل `evals` نصوص التقييم للمهام مثل تصنيف الصور والفيديو، ويدعم أيضًا التنفيذ المحلي والموزع.
يتضمن إعداد البيانات إنشاء ملفات CSV لمجموعات بيانات الفيديو، حيث تحدد كل سطر المسار المطلق لملف الفيديو وتسمية فئة عددية (يتم تجاهلها أثناء التدريب المسبق غير المراقب ولكن يتم استخدامها للتقييمات المراقب). يتم إعداد مجموعات بيانات الصور باستخدام فئة PyTorch ImageFolder القياسية، وتتطلب بنية دليل محددة. يوفر المشروع نماذج مدربة مسبقًا، بما في ذلك متغيرات ViT-L و ViT-H، جنبًا إلى جنب مع مجسات انتباهية لمهام لاحقة مختلفة مثل K400، SSv2، ImageNet1K، Places205، و iNat21، مما يوضح تنوع التمثيلات المتعلمة.
الميزات الأساسية لـ V-JEPA
التعلم ذاتي الإشراف من الفيديو باستخدام بنية التنبؤ المشترك للتضمين (JEPA)
هدف تنبؤ الميزات غير المراقب في المساحة الكامنة
لا يعتمد على إعادة بناء البكسل أو التعليقات البشرية
تمثيلات مرئية متعددة الاستخدامات لمهام الفيديو والصور اللاحقة
قاعدة كود PyTorch رسمية مع نماذج وتكوينات مقدمة
يدعم التدريب والتقييم المحلي والموزع
يشمل نماذج مدربة مسبقًا (ViT-L، ViT-H) ومجسات انتباهية
إعداد بيانات مرن لمجموعات بيانات الفيديو والصور
قاعدة الكود تتضمن نصوص للتدريب المسبق والتقييم
تصورات عبر نماذج انتشار شرطي في المساحة الكامنة
البدء مع V-JEPA
استنساخ المستودع: احصل على قاعدة كود V-JEPA من GitHub.
تثبيت التبعيات: قم بإعداد بيئة Python (على سبيل المثال، باستخدام conda) وقم بتثبيت الحزم المطلوبة.
تكوين التجارب: قم بتحديث المسارات في ملفات التكوين داخل دليل `configs` للبيانات والسجلات ونقاط الفحص.
إعداد البيانات: قم بتنسيق مجموعات بيانات الفيديو والصور وفقًا لهيكل CSV أو ImageFolder المحدد.
تشغيل التدريب المسبق: قم بتنفيذ التدريب المسبق المحلي أو الموزع باستخدام `app/main.py` أو `app/main_distributed.py`.
تشغيل التقييمات: قم بتشغيل التقييمات المحلية أو الموزعة للمهام اللاحقة باستخدام `evals/main.py` أو `evals/main_distributed.py`.
استخدام النماذج المدربة مسبقًا: قم بتنزيل ودمج نماذج V-JEPA المدربة مسبقًا المقدمة لتطبيقاتك.
حالات استخدام V-JEPA
- تعلم تمثيلات الفيديو
- تصنيف الصور
- تصنيف الفيديو
- التكيف مع المهام اللاحقة
- البحث والتطوير
- تنبؤ الميزات








