تخطَّ إلى المحتوى الرئيسي
ToolPotion

Llama-3.2-11B-Vision-Instruct

Llama-3.2-11B-Vision-Instruct هو نموذج ذكاء اصطناعي متعدد الوسائط مصمم للتعرف البصري، واستنتاج الصور، والتعليق. تم تطويره بواسطة ميتا، ويجمع بين مدخلات النص والصورة لتقديم قدرات متقدمة لفهم الصور.

عرض النموذج
مشاركة

الوصف

Llama-3.2-11B-Vision-Instruct هو نموذج ذكاء اصطناعي متطور تم تطويره بواسطة ميتا، مصمم لتعزيز مهام التعرف البصري واستنتاج الصور. هذا النموذج هو جزء من مجموعة Llama 3.2-Vision، والتي تشمل نماذج لغوية كبيرة متعددة الوسائط (LLMs) مُحسّنة لمهام مثل التعرف البصري، واستنتاج الصور، والتعليق. تم بناء النموذج على نموذج Llama 3.1 النصي فقط ويحتوي على محول بصري لمعالجة مدخلات الصور بشكل فعال.

تم تدريب نموذج Llama-3.2-11B-Vision-Instruct على مجموعة بيانات ضخمة تضم 6 مليارات زوج من الصور والنصوص، مما يضمن فهمًا شاملاً للمحتوى البصري. يدعم النموذج اللغة الإنجليزية لتطبيقات النص والصورة، بينما يمكن تنفيذ المهام النصية فقط بعدة لغات، بما في ذلك الألمانية، والفرنسية، والإسبانية. تستخدم بنية النموذج محولًا مُحسّنًا مع طبقات انتباه متقاطع، مما يمكّنه من دمج تمثيلات مشفر الصورة في النموذج اللغوي الأساسي.

هذا النموذج مخصص للاستخدام التجاري والبحثي، حيث يقدم قدرات في الإجابة على الأسئلة البصرية، والإجابة على الأسئلة البصرية المتعلقة بالمستندات، والتعليق على الصور، واسترجاع النصوص والصور. إنه مناسب بشكل خاص للتطبيقات التي تتطلب فهمًا عميقًا لكل من المعلومات البصرية والنصية، مما يجعله أداة قيمة للمطورين والباحثين في مجال الذكاء الاصطناعي.

يخضع Llama-3.2-11B-Vision-Instruct لرخصة مجتمع Llama 3.2، التي تحدد شروط الاستخدام، والتكاثر، والتوزيع. يتم تقديم النموذج على أساس 'كما هو'، مع إخلاء مسؤولية ميتا عن جميع الضمانات. يُشجع المطورون على نشر النموذج بشكل مسؤول، مع الالتزام بسياسة الاستخدام المقبول وضمان الامتثال للقوانين واللوائح المعمول بها.

أبرز ملامح Llama-3.2-11B-Vision-Instruct

  • دعم المدخلات متعددة الوسائط: نص وصورة

  • محسّن للتعرف البصري والاستنتاج

  • مبني على نموذج Llama 3.1 النصي فقط

  • محول بصري مع طبقات انتباه متقاطع

  • مدرب على 6 مليارات زوج من الصور والنصوص

  • يدعم اللغة الإنجليزية لمهام النص والصورة

  • رخصة مجتمع للاستخدام والتوزيع

  • مصمم للاستخدام التجاري والبحثي

  • قدرات متقدمة في التعليق على الصور

  • دعم الإجابة على الأسئلة البصرية

البدء مع Llama-3.2-11B-Vision-Instruct

  1. الوصول إلى الصفحة: زيارة صفحة النموذج على Hugging Face

  2. تحميل النموذج: استخدام المحولات أو قاعدة الشيفرة الأصلية لـ Llama

  3. تكوين البيئة: إعداد مع المحولات >= 4.45.0

  4. التكامل: دمجه في التطبيقات لاستنتاج الصور

  5. التخصيص: ضبط النموذج لمهام ولغات محددة

حالات استخدام Llama-3.2-11B-Vision-Instruct

  • التعرف البصري
  • استنتاج الصور
  • التعليق على الصور
  • الإجابة على الأسئلة البصرية
  • تحليل المستندات

الأسئلة الشائعة من Llama-3.2-11B-Vision-Instruct

أدوات ذكاء اصطناعي شائعة مثل Llama-3.2-11B-Vision-Instruct

نماذج الذكاء الاصطناعي

Llama-4 Maverick 17B-128E Instruct هو نموذج ذكاء اصطناعي متعدد الوسائط تم تطويره بواسطة ميتا، مصمم لفهم النصوص والصور بشكل متقدم. يستفيد من بنية مزيج من الخبراء لتقديم أداء عالٍ…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Llama-4-Scout-17B-16E-Instruct هو نموذج ذكاء اصطناعي متعدد الوسائط مصمم بواسطة ميتا. يستفيد من بنية مزيج من الخبراء لتوفير قدرات متقدمة في فهم النصوص والصور، ويدعم المخرجات متعددة…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Qwen3 VL 8B Instruct من Alibaba هو نموذج قوي للرؤية واللغة يقدم فهمًا متفوقًا للنصوص، وإدراكًا بصريًا، واستدلالًا متعدد الوسائط. يدعم نشرًا مرنًا مع هياكل Dense وMoE، مما يعزز…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

فلورنس-2 هو نموذج متقدم للرؤية من مايكروسوفت، مصمم للتعامل مع مجموعة متنوعة من مهام الرؤية والرؤية-اللغة. يستخدم نهجًا قائمًا على المطالبات لمهام مثل التسمية واكتشاف الكائنات،…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

LLaVA هو نموذج متعدد الوسائط كبير يجمع بين مشفر الرؤية ونموذج لغوي للفهم البصري واللغوي للأغراض العامة. يتفوق في قدرات الدردشة متعددة الوسائط، محاكياً GPT-4، ويحقق دقة متطورة في…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

Phi-4-reasoning-vision-15B هو نموذج ذكاء اصطناعي متعدد الوسائط تم تطويره بواسطة مايكروسوفت، مصمم للمهام التي تتطلب فهم اللغة البصرية وقدرات التفكير. يتفوق في التفكير العلمي ومهام…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

جمني 3.1 برو هو نموذج متقدم للذكاء الاصطناعي مصمم للمهام المعقدة والتفكير العميق. يتفوق في الفهم متعدد الوسائط، مما يوفر استجابات ذكية وموجزة، مما يجعله مثالياً للتعلم والتخطيط…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Llama-3.1-8B-Instruct هو نموذج لغوي كبير متعدد اللغات تم تطويره بواسطة Meta، مُحسّن للمهام المعتمدة على التعليمات. تم تصميمه للتطبيقات التجارية والبحثية، حيث يوفر قدرات متقدمة في…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة