الوصف
Llama-3.2-11B-Vision-Instruct هو نموذج ذكاء اصطناعي متطور تم تطويره بواسطة ميتا، مصمم لتعزيز مهام التعرف البصري واستنتاج الصور. هذا النموذج هو جزء من مجموعة Llama 3.2-Vision، والتي تشمل نماذج لغوية كبيرة متعددة الوسائط (LLMs) مُحسّنة لمهام مثل التعرف البصري، واستنتاج الصور، والتعليق. تم بناء النموذج على نموذج Llama 3.1 النصي فقط ويحتوي على محول بصري لمعالجة مدخلات الصور بشكل فعال.
تم تدريب نموذج Llama-3.2-11B-Vision-Instruct على مجموعة بيانات ضخمة تضم 6 مليارات زوج من الصور والنصوص، مما يضمن فهمًا شاملاً للمحتوى البصري. يدعم النموذج اللغة الإنجليزية لتطبيقات النص والصورة، بينما يمكن تنفيذ المهام النصية فقط بعدة لغات، بما في ذلك الألمانية، والفرنسية، والإسبانية. تستخدم بنية النموذج محولًا مُحسّنًا مع طبقات انتباه متقاطع، مما يمكّنه من دمج تمثيلات مشفر الصورة في النموذج اللغوي الأساسي.
هذا النموذج مخصص للاستخدام التجاري والبحثي، حيث يقدم قدرات في الإجابة على الأسئلة البصرية، والإجابة على الأسئلة البصرية المتعلقة بالمستندات، والتعليق على الصور، واسترجاع النصوص والصور. إنه مناسب بشكل خاص للتطبيقات التي تتطلب فهمًا عميقًا لكل من المعلومات البصرية والنصية، مما يجعله أداة قيمة للمطورين والباحثين في مجال الذكاء الاصطناعي.
يخضع Llama-3.2-11B-Vision-Instruct لرخصة مجتمع Llama 3.2، التي تحدد شروط الاستخدام، والتكاثر، والتوزيع. يتم تقديم النموذج على أساس 'كما هو'، مع إخلاء مسؤولية ميتا عن جميع الضمانات. يُشجع المطورون على نشر النموذج بشكل مسؤول، مع الالتزام بسياسة الاستخدام المقبول وضمان الامتثال للقوانين واللوائح المعمول بها.
أبرز ملامح Llama-3.2-11B-Vision-Instruct
دعم المدخلات متعددة الوسائط: نص وصورة
محسّن للتعرف البصري والاستنتاج
مبني على نموذج Llama 3.1 النصي فقط
محول بصري مع طبقات انتباه متقاطع
مدرب على 6 مليارات زوج من الصور والنصوص
يدعم اللغة الإنجليزية لمهام النص والصورة
رخصة مجتمع للاستخدام والتوزيع
مصمم للاستخدام التجاري والبحثي
قدرات متقدمة في التعليق على الصور
دعم الإجابة على الأسئلة البصرية
البدء مع Llama-3.2-11B-Vision-Instruct
الوصول إلى الصفحة: زيارة صفحة النموذج على Hugging Face
تحميل النموذج: استخدام المحولات أو قاعدة الشيفرة الأصلية لـ Llama
تكوين البيئة: إعداد مع المحولات >= 4.45.0
التكامل: دمجه في التطبيقات لاستنتاج الصور
التخصيص: ضبط النموذج لمهام ولغات محددة
حالات استخدام Llama-3.2-11B-Vision-Instruct
- التعرف البصري
- استنتاج الصور
- التعليق على الصور
- الإجابة على الأسئلة البصرية
- تحليل المستندات












