الوصف
Imagen هو نموذج انتشار نص إلى صورة متطور من Google Research يضع معايير جديدة للواقعية الفوتوغرافية وفهم اللغة في الصور التي تم إنشاؤها بواسطة الذكاء الاصطناعي. يستفيد من قوة نماذج لغة المحولات الكبيرة، وتحديداً مشفر T5-XXL المجمد، لتفسير المطالبات النصية بعمق وترجمتها إلى مخرجات مرئية عالية الدقة. ثم يستخدم النموذج عملية انتشار متتالية، بدءًا من إنشاء صورة بدقة 64x64 وزيادة الدقة تدريجيًا إلى 1024x1024 من خلال نماذج انتشار فائقة الدقة.
يكمن الابتكار الأساسي في Imagen في اكتشاف أن توسيع نطاق مكون نموذج اللغة يعزز بشكل كبير جودة الصورة والمحاذاة مع المطالبة النصية، أكثر من زيادة حجم نموذج الانتشار. يسمح هذا النهج لـ Imagen بتحقيق درجة غير مسبوقة من الواقعية الفوتوغرافية وفهم دقيق للأوصاف النصية المعقدة. أظهر النموذج أداءً حديثًا، حيث حقق درجة FID تبلغ 7.27 على مجموعة بيانات COCO دون تدريب مباشر عليها، ووجد المقيمون البشريون أن صوره التي تم إنشاؤها تضاهي البيانات الحقيقية من حيث محاذاة الصورة والنص.
لتقييم نماذج النص إلى الصورة بشكل صارم، قدم مبتكرو Imagen DrawBench، وهو معيار شامل ومليء بالتحديات. في المقارنات جنبًا إلى جنب على DrawBench، فضل المقيمون البشريون باستمرار Imagen على النماذج الرائدة الأخرى، بما في ذلك DALL-E 2 و VQ-GAN+CLIP و Latent Diffusion Models، مشيرين إلى جودة عينة فائقة ومحاذاة صورة ونص. تتضمن بنية Imagen عينة انتشار جديدة للتصفية لتعزيز التوجيه وبنية U-Net فعالة لتحسين الكفاءة الحسابية والذاكرة.
بينما يمثل Imagen تقدمًا كبيرًا، يعترف مطوروه بالقيود والتأثيرات المجتمعية. أدت المخاوف بشأن إساءة الاستخدام المحتملة، والتحيزات المتأصلة الموجودة في مجموعات البيانات الكبيرة غير المنسقة التي تم كشطها من الويب، والتحديات المحددة في إنشاء صور دقيقة وغير متحيزة للأشخاص إلى قرار عدم الإصدار العام الفوري. تهدف الأعمال المستقبلية إلى معالجة هذه الاعتبارات الأخلاقية وتحسين عدالة النموذج وقوته، لا سيما في إنشاء تمثيلات متنوعة ومنصفة.
أبرز ملامح Imagen Text-to-Image
ينشئ صورًا واقعية للغاية من مطالبات نصية
مستوى عميق من فهم اللغة
يستفيد من نماذج لغة المحولات الكبيرة (مشفر T5-XXL)
يستخدم نماذج انتشار متتالية للحصول على مخرجات عالية الدقة
يحقق درجة FID حديثة في COCO
يظهر محاذاة فائقة للصورة والنص
قدم معيار DrawBench لتقييم النص إلى الصورة
يفضل المقيمون البشريون Imagen على النماذج الأخرى
عينة انتشار جديدة للتصفية للتوجيه
بنية U-Net فعالة للأداء
يزيد دقة الصور إلى 1024x1024
البدء مع Imagen Text-to-Image
الوصول إلى النموذج: فهم قدرات النموذج وقيوده.
التكامل عبر API: استخدم نقاط نهاية API الخاصة بالنموذج لتوليد النص إلى الصورة.
تقديم مطالبة نصية: أدخل مطالبة نصية وصفية لإنشاء الصورة.
استلام مخرجات الصورة: احصل على الصورة الواقعية التي تم إنشاؤها.
تقييم النتائج: قم بتقييم دقة الصورة ومحاذاتها مع المطالبة.
التكرار والتحسين: اضبط المطالبات للحصول على النتائج المرئية المطلوبة.
حالات استخدام Imagen Text-to-Image
- الإبداع الفني
- توليد المحتوى
- نماذج أولية مرئية
- أدوات سرد القصص
- أدوات تعليمية
- استكشاف المفاهيم



