الوصف
يمثل ALIGN تقدمًا كبيرًا في تعلم تمثيلات مرئية ولغة-رؤية قوية من خلال الاستفادة من مجموعة بيانات ضخمة تضم أكثر من مليار زوج من الصور والنصوص البديلة. على عكس النماذج المتطورة السابقة التي اعتمدت على مجموعات بيانات مُنسقة ومُصنفة بدقة، يستخدم ALIGN بيانات نصية بديلة متاحة للجمهور، وإن كانت صاخبة. يتجاوز هذا النهج خطوات جمع البيانات وتنظيفها المكثفة، مما يسمح بتدريب نماذج أكبر وأكثر قوة.
يكمن الابتكار الأساسي لـ ALIGN في قدرته على توسيع نطاق تعلم التمثيلات من خلال تبني الإشراف النصي الصاخب. يستخدم النموذج بنية بسيطة ذات مُشفر مزدوج، تتكون من مُشفر صور ومُشفر نصوص، يتم تدريبها باستخدام خسارة تباينية. تقوم دالة الخسارة هذه بمحاذاة تضمينات أزواج الصور والنصوص المتطابقة مع دفع تضمينات الأزواج غير المتطابقة بعيدًا داخل نفس الدفعة. يعوض الحجم الهائل لمجموعة البيانات، البالغ 1.8 مليار زوج من الصور والنصوص، عن الضوضاء المتأصلة، مما يؤدي إلى تمثيلات فائقة.
يُظهر ALIGN أداءً متطورًا عبر معايير مختلفة. في مهام الاسترجاع عبر الوسائط، مثل Flickr30K و MS-COCO، يتفوق ALIGN على الطرق الحالية، بما في ذلك نماذج الانتباه المتقاطع الأكثر تعقيدًا، في كل من الإعدادات بدون أمثلة والإعدادات المُعدلة. بالنسبة للمهام المرئية فقط، يحقق ALIGN نتائج تنافسية أو متفوقة على تصنيف ImageNet مقارنة بالنماذج المدربة ببيانات مُصنفة واسعة النطاق. إحدى القدرات الرئيسية التي يتيحها ALIGN هي التصنيف المرئي بدون أمثلة، حيث يمكن تصنيف الصور إلى فئات دون أي بيانات تدريب لتلك الفئات المحددة، وذلك بالاستفادة من مساحة التضمين المحاذية.
تُسهل التمثيلات التي تعلمها النموذج أيضًا وظائف بحث صور قوية. يتيح ALIGN البحث عبر الوسائط، مما يسمح للمستخدمين باسترجاع الصور باستخدام أوصاف نصية، واسترجاع النصوص للصور، وحتى إجراء عمليات بحث باستخدام استعلامات مدمجة للصور والنصوص. تُعد قدرة الاستعلام متعدد الوسائط هذه ميزة جديدة، مما يسمح بعمليات معقدة مثل العثور على تشابهات مرئية أو إزالة/تعديل سمات داخل الصور من خلال حساب المتجهات في مساحة التضمين.
بينما يقدم ALIGN فوائد كبيرة، يقر المؤلفون بالحاجة إلى النشر المسؤول. تُعد الاعتبارات المتعلقة بإمكانية وجود بيانات نصية ضارة ضمن النصوص البديلة، والإنصاف، وتوازن البيانات، وتخفيف التحيزات المتعلقة بالتوزيعات الديموغرافية والعناصر الثقافية أمرًا بالغ الأهمية لتطبيقه العملي. يسلط البحث الضوء على طريقة قابلة للتطوير وفعالة لتعلم تمثيلات مرئية ولغة-رؤية قوية من بيانات الويب المتاحة بسهولة، وإن كانت صاخبة.
أبرز ملامح ALIGN: توسيع نطاق تعلم التمثيلات المرئية ولغة-الرؤية
يتعلم التمثيلات المرئية ولغة-الرؤية من أزواج الصور والنصوص البديلة الصاخبة.
يستخدم مجموعة بيانات تضم أكثر من 1.8 مليار زوج من الصور والنصوص.
يستخدم بنية مُشفر مزدوج مع خسارة تباينية.
يحقق أداءً متطورًا في الاسترجاع بين الصور والنصوص.
يتيح التصنيف المرئي بدون أمثلة دون الحاجة إلى بيانات تدريب خاصة بالمهمة.
يدعم البحث عبر الوسائط (من صورة إلى نص، ومن نص إلى صورة).
يسهل البحث المرئي متعدد الوسائط باستخدام استعلامات مدمجة للصور والنصوص.
يُظهر أداءً قويًا في المهام النهائية المرئية فقط مثل تصنيف ImageNet.
يوسع حجم النموذج حتى EfficientNet-L2 لتشفير الصور و BERT-large لتشفير النصوص.
يمثل التضمينات في مساحة مرئية ولغوية محاذية.
يُظهر قوة في التصنيف بدون أمثلة عبر متغيرات ImageNet.
يتيح البحث الدلالي للمفاهيم الدقيقة والمعقدة.
البدء مع ALIGN: توسيع نطاق تعلم التمثيلات المرئية ولغة-الرؤية
الوصول إلى النموذج: الحصول على الوصول إلى نموذج ALIGN أو أوزانه المدربة مسبقًا.
إعداد البيئة: تكوين إطار التعلم العميق والمكتبات اللازمة.
التكامل عبر API: استخدام نقاط نهاية API المقدمة للاستدلال على النموذج.
تحميل المُشفرات: إنشاء مُشفرات الصور والنصوص.
إنشاء التضمينات: تمرير الصور والنصوص عبر مُشفراتها الخاصة.
إجراء الاسترجاع: استخدام تشابه جيب التمام على التضمينات لمطابقة الصور والنصوص.
تصنيف الصور: تعيين أسماء الفئات إلى التضمينات للتصنيف بدون أمثلة.
حالات استخدام ALIGN: توسيع نطاق تعلم التمثيلات المرئية ولغة-الرؤية
- استرجاع الصور والنصوص
- التصنيف بدون أمثلة
- البحث متعدد الوسائط
- محركات البحث المرئية
- فهم المحتوى
- توجيه توليد الصور
- تطبيقات عبر الوسائط







