الوصف
يقدم مستودع GitHub هذا، `google-research/vision_transformer`، مجموعة شاملة من الموارد للعمل مع بنيات Vision Transformer (ViT) و MLP-Mixer في مجال رؤية الحاسوب. يعمل كمركز رئيسي للنماذج والأكواد المشتقة من عدة أوراق بحثية رئيسية، بما في ذلك "An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale" و "MLP-Mixer: An all-MLP Architecture for Vision."
يوفر المستودع نماذج مدربة مسبقًا تم تدريبها على مجموعات بيانات واسعة النطاق مثل ImageNet و ImageNet-21k. هذه النماذج متاحة للتنزيل ويمكن ضبطها بدقة لمهام محددة لاحقة. الكود مكتوب بشكل أساسي بلغة JAX و Flax، مما يوفر مرونة للباحثين والمطورين الذين يعملون ضمن هذا النظام البيئي.
تشمل القدرات الرئيسية القدرة على ضبط النماذج بدقة على مجموعات بيانات مخصصة، مع أمثلة مقدمة لمجموعات بيانات شائعة مثل CIFAR-10 و CIFAR-100. يفصل المستودع أيضًا كيفية إعداد أجهزة افتراضية مع وحدات معالجة الرسومات (GPUs) أو وحدات معالجة الموتر (TPUs) على Google Cloud للتدريب والتجريب على نطاق أوسع. علاوة على ذلك، يتضمن موارد لاستكشاف أكثر من 50,000 نقطة تحقق من ورقة "How to train your ViT? Data, Augmentation, and Regularization in Vision Transformers"، مما يمكّن المستخدمين من اختيار النماذج وضبطها بدقة بناءً على مقاييس أداء محددة.
يشمل الجمهور المستهدف لهذا المستودع باحثي الذكاء الاصطناعي، ومهندسي التعلم الآلي، وممارسي رؤية الحاسوب المهتمين بالاستفادة من أحدث النماذج القائمة على المحولات للتعرف على الصور والتصنيف والمهام المرئية الأخرى. تكمن القيمة المقترحة في توفير أكواد ونماذج مدربة مسبقًا سهلة الوصول وموثقة جيدًا والتي تسرع البحث والتطوير في مجال محولات الرؤية.
بالإضافة إلى ViT و MLP-Mixer، يتميز المستودع أيضًا بموارد لنماذج LiT (Locked-image text Tuning)، مما يتيح قدرات النقل بدون أمثلة (zero-shot transfer). هذا يوسع فائدة المستودع للتطبيقات متعددة الوسائط التي تتضمن الصور والنصوص. يؤكد المشروع على قابلية التكرار ويوفر تعليمات مفصلة للتثبيت والضبط الدقيق والنشر السحابي.
أبرز ملامح Vision Transformer
تطبيقات نماذج Vision Transformer (ViT)
تطبيقات بنية MLP-Mixer
نماذج مدربة مسبقًا على ImageNet و ImageNet-21k
أكواد الضبط الدقيق في JAX/Flax
دعم نماذج LiT (Locked-image text Tuning)
دفاتر Colab للاستكشاف التفاعلي والضبط الدقيق
تعليمات مفصلة لإعداد الأجهزة الافتراضية السحابية (GPU/TPU)
الوصول إلى أكثر من 50,000 نقطة تحقق لنماذج ViT
اقتباسات BibTeX للأوراق البحثية ذات الصلة
سجل التغييرات الذي يفصل تحديثات المستودع وإضافات النماذج
أكواد لاستراتيجيات زيادة البيانات والتنظيم
البدء مع Vision Transformer
الوصول إلى النموذج: استنساخ مستودع GitHub أو الوصول إلى النماذج المدربة مسبقًا من GCS buckets المقدمة.
إعداد البيئة: تثبيت JAX، تبعيات Python، و Flaxformer بناءً على جهازك (GPU/TPU).
تكوين التدريب: تحديد أو إنشاء ملفات تكوين لبنية النموذج، مجموعة البيانات، ومعلمات التدريب.
ضبط النموذج بدقة: تنفيذ نصوص الضبط الدقيق باستخدام قاعدة أكواد JAX/Flax مع مجموعة البيانات والتكوينات التي اخترتها.
استكشاف نقاط التحقق: استخدام دفاتر Colab المقدمة لاستكشاف والاختيار من بين مجموعة كبيرة من نقاط التحقق المدربة مسبقًا.
النشر على السحابة: إعداد أجهزة افتراضية على Google Cloud مع مسرعات مناسبة (GPU/TPU) للتدريب على نطاق أوسع.
حالات استخدام Vision Transformer
- تصنيف الصور
- ضبط النماذج بدقة
- النقل بدون أمثلة (Zero-Shot Transfer)
- أبحاث رؤية الحاسوب
- الذكاء الاصطناعي متعدد الوسائط
- التدريب على نطاق واسع







