الوصف
LLaVA، والذي يرمز إلى مساعد اللغة والرؤية الكبير (Large Language-and-Vision Assistant)، هو نموذج متعدد الوسائط كبير مدرب من طرف إلى طرف ومصمم للفهم البصري واللغوي الشامل. يدمج مشفر رؤية مع نموذج لغوي قوي، Vicuna، من خلال مصفوفة إسقاط بسيطة. تسمح هذه البنية لـ LLaVA بمعالجة وتفسير المعلومات المرئية والنصية، مما يتيح قدرات دردشة رائعة تهدف إلى محاكاة قدرات GPT-4 متعدد الوسائط.
تضمن تطوير LLaVA إجراء ضبط تعليمي من مرحلتين. تركز المرحلة الأولى على التدريب المسبق لمحاذاة الميزات، حيث يتم تحديث مصفوفة الإسقاط فقط باستخدام مجموعة فرعية من بيانات CC3M. تتضمن المرحلة الثانية الضبط الدقيق من طرف إلى طرف، وتحديث كل من مصفوفة الإسقاط ونموذج اللغة الكبير (LLM). تم تخصيص هذا الضبط الدقيق لحالتي استخدام مميزتين: الدردشة المرئية، للتطبيقات العامة الموجهة للمستخدم، و Science QA، وهي مجموعة بيانات استدلال متعددة الوسائط لمجال العلوم.
أحد الابتكارات الرئيسية لـ LLaVA هو إنشاء بيانات تعليمات متعددة الوسائط. تم إنشاء هذه البيانات باستخدام GPT-4 الذي يعتمد على اللغة فقط، مما أدى إلى حوالي 158 ألف عينة فريدة لاتباع التعليمات باللغة والصورة. تغطي هذه العينات المحادثات والأوصاف التفصيلية ومهام الاستدلال المعقدة. أظهر LLaVA أداءً ملحوظًا، حيث حقق درجة نسبية تبلغ 85.1٪ مقارنة بـ GPT-4 على مجموعة بيانات اصطناعية لاتباع التعليمات متعددة الوسائط، وحقق دقة متطورة جديدة تبلغ 92.53٪ على Science QA عند التآزر مع GPT-4.
يؤكد المشروع على إمكانية الوصول مفتوح المصدر، مما يجعل بيانات الضبط التعليمي البصري التي تم إنشاؤها بواسطة GPT-4، والنموذج، وقاعدة التعليمات متاحة للجمهور لأغراض البحث. يحقق LLaVA-1.5، وهو إصدار محسّن، نتائج متطورة على 11 معيارًا مع تعديلات طفيفة، باستخدام بيانات عامة وإكمال التدريب بكفاءة. إن قدرة النموذج على فهم التعليمات بناءً على الصور والاستجابة لها تضعه كتقدم كبير في أبحاث الذكاء الاصطناعي متعدد الوسائط.
أبرز ملامح LLaVA
نموذج متعدد الوسائط كبير مدرب من طرف إلى طرف
يجمع بين مشفر الرؤية ونموذج اللغة الكبير (Vicuna)
فهم بصري ولغوي للأغراض العامة
قدرات دردشة متعددة الوسائط رائعة
يحاكي سلوكيات GPT-4 متعدد الوسائط
يحقق دقة متطورة على Science QA
يستخدم الضبط التعليمي البصري
ينشئ بيانات لاتباع التعليمات متعددة الوسائط باستخدام GPT-4
بيانات ونموذج وقاعدة تعليمات مفتوحة المصدر
LLaVA-1.5 يحقق نتائج متطورة على 11 معيارًا
تدريب فعال على عقدة واحدة 8-A100
يدعم الضبط الدقيق للدردشة المرئية و Science QA
البدء مع LLaVA
الوصول إلى النموذج: الحصول على نقطة فحص نموذج LLaVA والتعليمات البرمجية.
إعداد البيئة: تكوين المكتبات والتبعيات اللازمة.
التكامل عبر API: تحميل النموذج ومكوناته.
تقديم المدخلات: تغذية النموذج بمطالبات الصور والنصوص.
معالجة المخرجات: تفسير استجابات النص التي يولدها النموذج.
ضبط النموذج: تكييف LLaVA لمهام محددة مثل الدردشة المرئية أو Science QA.
حالات استخدام LLaVA
- روبوت محادثة مرئي
- الاستدلال متعدد الوسائط
- وصف الصور
- الإجابة على الأسئلة المرئية
- التعليم العلمي
- تحليل المحتوى







