تخطَّ إلى المحتوى الرئيسي
ToolPotion

ALIGN: توسيع نطاق تعلم التمثيلات المرئية ولغة-الرؤية

ALIGN هو نموذج ذكاء اصطناعي يوسع نطاق تعلم التمثيلات المرئية ولغة-الرؤية باستخدام إشراف نصي صاخب من أكثر من مليار زوج من الصور والنصوص البديلة. يحقق نتائج متطورة في الاسترجاع عبر الوسائط والمهام المرئية فقط، مما يتيح التصنيف بدون أمثلة والبحث متعدد الوسائط.

زيارة الرابط

الوصف

يمثل ALIGN تقدمًا كبيرًا في تعلم تمثيلات مرئية ولغة-رؤية قوية من خلال الاستفادة من مجموعة بيانات ضخمة تضم أكثر من مليار زوج من الصور والنصوص البديلة. على عكس النماذج المتطورة السابقة التي اعتمدت على مجموعات بيانات مُنسقة ومُصنفة بدقة، يستخدم ALIGN بيانات نصية بديلة متاحة للجمهور، وإن كانت صاخبة. يتجاوز هذا النهج خطوات جمع البيانات وتنظيفها المكثفة، مما يسمح بتدريب نماذج أكبر وأكثر قوة.

يكمن الابتكار الأساسي لـ ALIGN في قدرته على توسيع نطاق تعلم التمثيلات من خلال تبني الإشراف النصي الصاخب. يستخدم النموذج بنية بسيطة ذات مُشفر مزدوج، تتكون من مُشفر صور ومُشفر نصوص، يتم تدريبها باستخدام خسارة تباينية. تقوم دالة الخسارة هذه بمحاذاة تضمينات أزواج الصور والنصوص المتطابقة مع دفع تضمينات الأزواج غير المتطابقة بعيدًا داخل نفس الدفعة. يعوض الحجم الهائل لمجموعة البيانات، البالغ 1.8 مليار زوج من الصور والنصوص، عن الضوضاء المتأصلة، مما يؤدي إلى تمثيلات فائقة.

يُظهر ALIGN أداءً متطورًا عبر معايير مختلفة. في مهام الاسترجاع عبر الوسائط، مثل Flickr30K و MS-COCO، يتفوق ALIGN على الطرق الحالية، بما في ذلك نماذج الانتباه المتقاطع الأكثر تعقيدًا، في كل من الإعدادات بدون أمثلة والإعدادات المُعدلة. بالنسبة للمهام المرئية فقط، يحقق ALIGN نتائج تنافسية أو متفوقة على تصنيف ImageNet مقارنة بالنماذج المدربة ببيانات مُصنفة واسعة النطاق. إحدى القدرات الرئيسية التي يتيحها ALIGN هي التصنيف المرئي بدون أمثلة، حيث يمكن تصنيف الصور إلى فئات دون أي بيانات تدريب لتلك الفئات المحددة، وذلك بالاستفادة من مساحة التضمين المحاذية.

تُسهل التمثيلات التي تعلمها النموذج أيضًا وظائف بحث صور قوية. يتيح ALIGN البحث عبر الوسائط، مما يسمح للمستخدمين باسترجاع الصور باستخدام أوصاف نصية، واسترجاع النصوص للصور، وحتى إجراء عمليات بحث باستخدام استعلامات مدمجة للصور والنصوص. تُعد قدرة الاستعلام متعدد الوسائط هذه ميزة جديدة، مما يسمح بعمليات معقدة مثل العثور على تشابهات مرئية أو إزالة/تعديل سمات داخل الصور من خلال حساب المتجهات في مساحة التضمين.

بينما يقدم ALIGN فوائد كبيرة، يقر المؤلفون بالحاجة إلى النشر المسؤول. تُعد الاعتبارات المتعلقة بإمكانية وجود بيانات نصية ضارة ضمن النصوص البديلة، والإنصاف، وتوازن البيانات، وتخفيف التحيزات المتعلقة بالتوزيعات الديموغرافية والعناصر الثقافية أمرًا بالغ الأهمية لتطبيقه العملي. يسلط البحث الضوء على طريقة قابلة للتطوير وفعالة لتعلم تمثيلات مرئية ولغة-رؤية قوية من بيانات الويب المتاحة بسهولة، وإن كانت صاخبة.

أبرز ملامح ALIGN: توسيع نطاق تعلم التمثيلات المرئية ولغة-الرؤية

  • يتعلم التمثيلات المرئية ولغة-الرؤية من أزواج الصور والنصوص البديلة الصاخبة.

  • يستخدم مجموعة بيانات تضم أكثر من 1.8 مليار زوج من الصور والنصوص.

  • يستخدم بنية مُشفر مزدوج مع خسارة تباينية.

  • يحقق أداءً متطورًا في الاسترجاع بين الصور والنصوص.

  • يتيح التصنيف المرئي بدون أمثلة دون الحاجة إلى بيانات تدريب خاصة بالمهمة.

  • يدعم البحث عبر الوسائط (من صورة إلى نص، ومن نص إلى صورة).

  • يسهل البحث المرئي متعدد الوسائط باستخدام استعلامات مدمجة للصور والنصوص.

  • يُظهر أداءً قويًا في المهام النهائية المرئية فقط مثل تصنيف ImageNet.

  • يوسع حجم النموذج حتى EfficientNet-L2 لتشفير الصور و BERT-large لتشفير النصوص.

  • يمثل التضمينات في مساحة مرئية ولغوية محاذية.

  • يُظهر قوة في التصنيف بدون أمثلة عبر متغيرات ImageNet.

  • يتيح البحث الدلالي للمفاهيم الدقيقة والمعقدة.

البدء مع ALIGN: توسيع نطاق تعلم التمثيلات المرئية ولغة-الرؤية

  1. الوصول إلى النموذج: الحصول على الوصول إلى نموذج ALIGN أو أوزانه المدربة مسبقًا.

  2. إعداد البيئة: تكوين إطار التعلم العميق والمكتبات اللازمة.

  3. التكامل عبر API: استخدام نقاط نهاية API المقدمة للاستدلال على النموذج.

  4. تحميل المُشفرات: إنشاء مُشفرات الصور والنصوص.

  5. إنشاء التضمينات: تمرير الصور والنصوص عبر مُشفراتها الخاصة.

  6. إجراء الاسترجاع: استخدام تشابه جيب التمام على التضمينات لمطابقة الصور والنصوص.

  7. تصنيف الصور: تعيين أسماء الفئات إلى التضمينات للتصنيف بدون أمثلة.

حالات استخدام ALIGN: توسيع نطاق تعلم التمثيلات المرئية ولغة-الرؤية

  • استرجاع الصور والنصوص
  • التصنيف بدون أمثلة
  • البحث متعدد الوسائط
  • محركات البحث المرئية
  • فهم المحتوى
  • توجيه توليد الصور
  • تطبيقات عبر الوسائط

الأسئلة الشائعة من ALIGN: توسيع نطاق تعلم التمثيلات المرئية ولغة-الرؤية

تقييمات ALIGN: توسيع نطاق تعلم التمثيلات المرئية ولغة-الرؤية

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل ALIGN: توسيع نطاق تعلم التمثيلات المرئية ولغة-الرؤية

نماذج الذكاء الاصطناعي

MiniGPT-4 هو نموذج ذكاء اصطناعي يعزز فهم الرؤية واللغة من خلال مواءمة مشفر مرئي مجمد مع نموذج لغوي كبير. يمكنه إنشاء أوصاف تفصيلية للصور، وإنشاء مواقع ويب من مسودات، وكتابة قصص…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

Oscar و VinVL هما نموذجان متقدمان للذكاء الاصطناعي لمهام الرؤية واللغة. يستخدم Oscar محاذاة الدلالات الكائنية للتدريب المسبق، محققًا أحدث النتائج. يعزز VinVL التمثيلات المرئية،…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

Phi-4-reasoning-vision-15B هو نموذج ذكاء اصطناعي متعدد الوسائط تم تطويره بواسطة مايكروسوفت، مصمم للمهام التي تتطلب فهم اللغة البصرية وقدرات التفكير. يتفوق في التفكير العلمي ومهام…

مميزةنماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

ImageBind هو نموذج ذكاء اصطناعي متعدد الوسائط من Meta AI يربط البيانات من ست وسائط: الصور، الفيديو، الصوت، النص، العمق، والحراري. يتعلم مساحة تضمين واحدة بدون إشراف صريح، مما يتيح…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

UNITER هو مستودع أكواد بحثي لورقة ECCV 2020 بعنوان 'UNITER: UNiversal Image-TExt Representation Learning'. يوفر أكوادًا للضبط الدقيق والاستدلال عبر مهام متنوعة تجمع بين الرؤية…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

فلامنجو هو نموذج لغة مرئي (VLM) واحد من Google DeepMind يتفوق في التعلم بالقليل من الأمثلة عبر مهام متعددة الوسائط متنوعة. يقوم بمعالجة الصور ومقاطع الفيديو والنصوص المتداخلة…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

SimCLR هو إطار عمل للتعلم الذاتي والتعلم شبه الذاتي للتمثيلات المرئية. يبسط الأساليب السابقة باستخدام التعلم التبايني لزيادة الاتفاق بين طرق عرض مختلفة لنفس الصورة، مما يؤدي إلى…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

LLaVA هو نموذج متعدد الوسائط كبير يجمع بين مشفر الرؤية ونموذج لغوي للفهم البصري واللغوي للأغراض العامة. يتفوق في قدرات الدردشة متعددة الوسائط، محاكياً GPT-4، ويحقق دقة متطورة في…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة