الوصف
Qwen3-VL-235B-A22B-Instruct هو نموذج متقدم للرؤية واللغة في سلسلة Qwen، مصمم لتقديم ترقيات شاملة في فهم النصوص وتوليدها، والإدراك البصري، وقدرات التفكير. يقدم فهمًا معززًا للديناميات المكانية والفيديو، وطول سياق ممتد، وقدرات تفاعل أقوى مع الوكلاء. النموذج متاح في بنى Dense وMoE، مما يسمح بنشر قابل للتوسع من الحافة إلى السحابة. يتضمن إصدارات Instruct وThinking المعززة بالتفكير لنشر مرن عند الطلب.
تشمل التحسينات الرئيسية في Qwen3-VL-235B-A22B-Instruct قدرته على تشغيل واجهات المستخدم الرسومية على الكمبيوتر/الهاتف المحمول، والتعرف على العناصر، وفهم الوظائف، واستدعاء الأدوات، وإكمال المهام. يتميز بزيادة في الترميز البصري التي تولد Draw.io/HTML/CSS/JS من الصور ومقاطع الفيديو. يسمح إدراكه المكاني المتقدم له بتقدير مواقع الكائنات، ووجهات النظر، والاعتراضات، مما يوفر أساسًا أقوى في 2D ويمكّن من الأساس في 3D للتفكير المكاني والذكاء الاصطناعي المجسد.
يدعم النموذج سياقًا أصليًا يبلغ 256K، قابلًا للتوسع إلى 1M، مما يمكّنه من التعامل مع الكتب ومقاطع الفيديو الطويلة مع استرجاع كامل وفهرسة من المستوى الثاني. يتفوق تفكيره متعدد الوسائط في STEM/الرياضيات، حيث يقدم تحليلًا سببيًا وإجابات منطقية قائمة على الأدلة. التعرف البصري المحسن قادر على التعرف على مجموعة واسعة من الكيانات، بما في ذلك المشاهير، والأنمي، والمنتجات، والمعالم، والنباتات، والحيوانات.
يتميز Qwen3-VL-235B-A22B-Instruct أيضًا بقدرات OCR موسعة، تدعم 32 لغة وتحسن الأداء في ظروف الإضاءة المنخفضة، والضباب، والميول. يقدم معالجة أفضل للشخصيات النادرة والقديمة والمصطلحات، بالإضافة إلى تحسين تحليل هيكل الوثائق الطويلة. فهم النصوص في النموذج يعادل نماذج LLM النقية، مما يوفر دمجًا سلسًا بين النص والرؤية لفهم موحد بدون فقدان.
أبرز ملامح Qwen3-VL-235B-A22B-Instruct
فهم وتوليد نصوص متفوق
إدراك بصري وتفكير معزز
طول سياق ممتد يصل إلى 1M
نشر مرن في بنى Dense وMoE
زيادة في الترميز البصري لتوليد HTML/CSS/JS
إدراك مكاني متقدم لتأسيس 2D و3D
تفكير متعدد الوسائط يتفوق في STEM/الرياضيات
تحسين التعرف البصري عبر كيانات متنوعة
OCR موسع يدعم 32 لغة
دمج سلس بين النص والرؤية
البدء مع Qwen3-VL-235B-A22B-Instruct
الوصول إلى الصفحة: زيارة مستودع نموذج Hugging Face
تحميل النموذج: تنزيل Qwen3-VL-235B-A22B-Instruct
تكوين البيئة: إعداد الاعتماديات اللازمة
التكامل: استخدامه مع 🤗 Transformers أو ModelScope
التخصيص: تخصيص النموذج لمهام محددة
حالات استخدام Qwen3-VL-235B-A22B-Instruct
- الترميز البصري
- التفكير المكاني
- تحليل STEM متعدد الوسائط
- معالجة السياق الممتد
- OCR في ظروف صعبة










