تخطَّ إلى المحتوى الرئيسي
ToolPotion

Vision Transformer

يوفر مستودع Vision Transformer (ViT) نماذج وأكواد لمهام التعرف على الصور. يتضمن تطبيقات لبنيات Vision Transformer و MLP-Mixer، مدربة مسبقًا على مجموعات بيانات ImageNet و ImageNet-21k، مع أكواد للضبط الدقيق في JAX/Flax.

زيارة الرابط

الوصف

يقدم مستودع GitHub هذا، `google-research/vision_transformer`، مجموعة شاملة من الموارد للعمل مع بنيات Vision Transformer (ViT) و MLP-Mixer في مجال رؤية الحاسوب. يعمل كمركز رئيسي للنماذج والأكواد المشتقة من عدة أوراق بحثية رئيسية، بما في ذلك "An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale" و "MLP-Mixer: An all-MLP Architecture for Vision."

يوفر المستودع نماذج مدربة مسبقًا تم تدريبها على مجموعات بيانات واسعة النطاق مثل ImageNet و ImageNet-21k. هذه النماذج متاحة للتنزيل ويمكن ضبطها بدقة لمهام محددة لاحقة. الكود مكتوب بشكل أساسي بلغة JAX و Flax، مما يوفر مرونة للباحثين والمطورين الذين يعملون ضمن هذا النظام البيئي.

تشمل القدرات الرئيسية القدرة على ضبط النماذج بدقة على مجموعات بيانات مخصصة، مع أمثلة مقدمة لمجموعات بيانات شائعة مثل CIFAR-10 و CIFAR-100. يفصل المستودع أيضًا كيفية إعداد أجهزة افتراضية مع وحدات معالجة الرسومات (GPUs) أو وحدات معالجة الموتر (TPUs) على Google Cloud للتدريب والتجريب على نطاق أوسع. علاوة على ذلك، يتضمن موارد لاستكشاف أكثر من 50,000 نقطة تحقق من ورقة "How to train your ViT? Data, Augmentation, and Regularization in Vision Transformers"، مما يمكّن المستخدمين من اختيار النماذج وضبطها بدقة بناءً على مقاييس أداء محددة.

يشمل الجمهور المستهدف لهذا المستودع باحثي الذكاء الاصطناعي، ومهندسي التعلم الآلي، وممارسي رؤية الحاسوب المهتمين بالاستفادة من أحدث النماذج القائمة على المحولات للتعرف على الصور والتصنيف والمهام المرئية الأخرى. تكمن القيمة المقترحة في توفير أكواد ونماذج مدربة مسبقًا سهلة الوصول وموثقة جيدًا والتي تسرع البحث والتطوير في مجال محولات الرؤية.

بالإضافة إلى ViT و MLP-Mixer، يتميز المستودع أيضًا بموارد لنماذج LiT (Locked-image text Tuning)، مما يتيح قدرات النقل بدون أمثلة (zero-shot transfer). هذا يوسع فائدة المستودع للتطبيقات متعددة الوسائط التي تتضمن الصور والنصوص. يؤكد المشروع على قابلية التكرار ويوفر تعليمات مفصلة للتثبيت والضبط الدقيق والنشر السحابي.

أبرز ملامح Vision Transformer

  • تطبيقات نماذج Vision Transformer (ViT)

  • تطبيقات بنية MLP-Mixer

  • نماذج مدربة مسبقًا على ImageNet و ImageNet-21k

  • أكواد الضبط الدقيق في JAX/Flax

  • دعم نماذج LiT (Locked-image text Tuning)

  • دفاتر Colab للاستكشاف التفاعلي والضبط الدقيق

  • تعليمات مفصلة لإعداد الأجهزة الافتراضية السحابية (GPU/TPU)

  • الوصول إلى أكثر من 50,000 نقطة تحقق لنماذج ViT

  • اقتباسات BibTeX للأوراق البحثية ذات الصلة

  • سجل التغييرات الذي يفصل تحديثات المستودع وإضافات النماذج

  • أكواد لاستراتيجيات زيادة البيانات والتنظيم

البدء مع Vision Transformer

  1. الوصول إلى النموذج: استنساخ مستودع GitHub أو الوصول إلى النماذج المدربة مسبقًا من GCS buckets المقدمة.

  2. إعداد البيئة: تثبيت JAX، تبعيات Python، و Flaxformer بناءً على جهازك (GPU/TPU).

  3. تكوين التدريب: تحديد أو إنشاء ملفات تكوين لبنية النموذج، مجموعة البيانات، ومعلمات التدريب.

  4. ضبط النموذج بدقة: تنفيذ نصوص الضبط الدقيق باستخدام قاعدة أكواد JAX/Flax مع مجموعة البيانات والتكوينات التي اخترتها.

  5. استكشاف نقاط التحقق: استخدام دفاتر Colab المقدمة لاستكشاف والاختيار من بين مجموعة كبيرة من نقاط التحقق المدربة مسبقًا.

  6. النشر على السحابة: إعداد أجهزة افتراضية على Google Cloud مع مسرعات مناسبة (GPU/TPU) للتدريب على نطاق أوسع.

حالات استخدام Vision Transformer

  • تصنيف الصور
  • ضبط النماذج بدقة
  • النقل بدون أمثلة (Zero-Shot Transfer)
  • أبحاث رؤية الحاسوب
  • الذكاء الاصطناعي متعدد الوسائط
  • التدريب على نطاق واسع

الأسئلة الشائعة من Vision Transformer

تقييمات Vision Transformer

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل Vision Transformer

نماذج الذكاء الاصطناعي

FNet هو بنية مشفرة فعالة تشبه Transformer تستبدل الانتباه الذاتي بتحويلات فورييه. تم تطويره بواسطة Google Research، وهو يوفر بديلاً عالي الأداء لمهام معالجة اللغة الطبيعية. تم…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

يوفر مستودع GitHub هذا تنفيذًا لـ ConvMixer، وهو بنية شبكة عصبية التفافية لمهام التعرف على الصور. يعتمد على الورقة البحثية "Patches Are All You Need? 🤷" ويوفر أوزان نماذج مدربة…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

BEiT هو نموذج تمثيل رؤية ذاتي الإشراف يستخدم نمذجة الصور المقنعة للتدريب المسبق لمُحولات الرؤية. يقوم بترميز الصور إلى رموز مرئية ويستعيد الرقع المقنعة، محققًا نتائج تنافسية في…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

ViT-Adapter هو نموذج ذكاء اصطناعي يعزز أداء Vision Transformer (ViT) لمهام التنبؤ الكثيف مثل اكتشاف الكائنات والتجزئة. يقدم تحيزات استقرائية خاصة بالصور دون الحاجة إلى تدريب مسبق،…

أدوات الرؤية الحاسوبية

أطر عمل الذكاء الاصطناعي

تطبيق سطح مكتب مجاني ومفتوح المصدر لتشغيل وتدريب نماذج الذكاء الاصطناعي محليًا على أنظمة ماك وويندوز ولينكس، مع واجهة مستخدم بدون كود، واتصال بالوكلاء، وواجهة برمجة تطبيقات…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

UniLM هو إطار عمل تدريب مسبق ذاتي الإشراف واسع النطاق طورته Microsoft. يمكّن النماذج من التعلم عبر مهام ولغات وأنماط متنوعة، بما في ذلك النص والصورة والصوت. يوفر هذا المشروع نماذج…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

Phi-4-reasoning-vision-15B هو نموذج ذكاء اصطناعي متعدد الوسائط تم تطويره بواسطة مايكروسوفت، مصمم للمهام التي تتطلب فهم اللغة البصرية وقدرات التفكير. يتفوق في التفكير العلمي ومهام…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

RepVGG هو بنية شبكة عصبية التفافية (ConvNet) قوية وبسيطة تحقق دقة عالية على ImageNet. يستخدم تصميمًا بأسلوب VGG مع تقنيات إعادة المعلمات، مما يسمح باستدلال فعال. يوفر المشروع…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة