تخطَّ إلى المحتوى الرئيسي
ToolPotion

Imagen Text-to-Image

Imagen هو نموذج انتشار نص إلى صورة طورته Google Research. يقوم بإنشاء صور واقعية للغاية مع فهم عميق للغة. يتفوق Imagen في محاذاة الصورة والنص ودقة العينات، متفوقًا على النماذج الأخرى في التقييمات البشرية وتحقيق درجات FID حديثة في معايير مثل COCO.

زيارة الرابط

الوصف

Imagen هو نموذج انتشار نص إلى صورة متطور من Google Research يضع معايير جديدة للواقعية الفوتوغرافية وفهم اللغة في الصور التي تم إنشاؤها بواسطة الذكاء الاصطناعي. يستفيد من قوة نماذج لغة المحولات الكبيرة، وتحديداً مشفر T5-XXL المجمد، لتفسير المطالبات النصية بعمق وترجمتها إلى مخرجات مرئية عالية الدقة. ثم يستخدم النموذج عملية انتشار متتالية، بدءًا من إنشاء صورة بدقة 64x64 وزيادة الدقة تدريجيًا إلى 1024x1024 من خلال نماذج انتشار فائقة الدقة.

يكمن الابتكار الأساسي في Imagen في اكتشاف أن توسيع نطاق مكون نموذج اللغة يعزز بشكل كبير جودة الصورة والمحاذاة مع المطالبة النصية، أكثر من زيادة حجم نموذج الانتشار. يسمح هذا النهج لـ Imagen بتحقيق درجة غير مسبوقة من الواقعية الفوتوغرافية وفهم دقيق للأوصاف النصية المعقدة. أظهر النموذج أداءً حديثًا، حيث حقق درجة FID تبلغ 7.27 على مجموعة بيانات COCO دون تدريب مباشر عليها، ووجد المقيمون البشريون أن صوره التي تم إنشاؤها تضاهي البيانات الحقيقية من حيث محاذاة الصورة والنص.

لتقييم نماذج النص إلى الصورة بشكل صارم، قدم مبتكرو Imagen DrawBench، وهو معيار شامل ومليء بالتحديات. في المقارنات جنبًا إلى جنب على DrawBench، فضل المقيمون البشريون باستمرار Imagen على النماذج الرائدة الأخرى، بما في ذلك DALL-E 2 و VQ-GAN+CLIP و Latent Diffusion Models، مشيرين إلى جودة عينة فائقة ومحاذاة صورة ونص. تتضمن بنية Imagen عينة انتشار جديدة للتصفية لتعزيز التوجيه وبنية U-Net فعالة لتحسين الكفاءة الحسابية والذاكرة.

بينما يمثل Imagen تقدمًا كبيرًا، يعترف مطوروه بالقيود والتأثيرات المجتمعية. أدت المخاوف بشأن إساءة الاستخدام المحتملة، والتحيزات المتأصلة الموجودة في مجموعات البيانات الكبيرة غير المنسقة التي تم كشطها من الويب، والتحديات المحددة في إنشاء صور دقيقة وغير متحيزة للأشخاص إلى قرار عدم الإصدار العام الفوري. تهدف الأعمال المستقبلية إلى معالجة هذه الاعتبارات الأخلاقية وتحسين عدالة النموذج وقوته، لا سيما في إنشاء تمثيلات متنوعة ومنصفة.

أبرز ملامح Imagen Text-to-Image

  • ينشئ صورًا واقعية للغاية من مطالبات نصية

  • مستوى عميق من فهم اللغة

  • يستفيد من نماذج لغة المحولات الكبيرة (مشفر T5-XXL)

  • يستخدم نماذج انتشار متتالية للحصول على مخرجات عالية الدقة

  • يحقق درجة FID حديثة في COCO

  • يظهر محاذاة فائقة للصورة والنص

  • قدم معيار DrawBench لتقييم النص إلى الصورة

  • يفضل المقيمون البشريون Imagen على النماذج الأخرى

  • عينة انتشار جديدة للتصفية للتوجيه

  • بنية U-Net فعالة للأداء

  • يزيد دقة الصور إلى 1024x1024

البدء مع Imagen Text-to-Image

  1. الوصول إلى النموذج: فهم قدرات النموذج وقيوده.

  2. التكامل عبر API: استخدم نقاط نهاية API الخاصة بالنموذج لتوليد النص إلى الصورة.

  3. تقديم مطالبة نصية: أدخل مطالبة نصية وصفية لإنشاء الصورة.

  4. استلام مخرجات الصورة: احصل على الصورة الواقعية التي تم إنشاؤها.

  5. تقييم النتائج: قم بتقييم دقة الصورة ومحاذاتها مع المطالبة.

  6. التكرار والتحسين: اضبط المطالبات للحصول على النتائج المرئية المطلوبة.

حالات استخدام Imagen Text-to-Image

  • الإبداع الفني
  • توليد المحتوى
  • نماذج أولية مرئية
  • أدوات سرد القصص
  • أدوات تعليمية
  • استكشاف المفاهيم

الأسئلة الشائعة من Imagen Text-to-Image

تقييمات Imagen Text-to-Image

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل Imagen Text-to-Image

نماذج الذكاء الاصطناعي

Imagen Video هو نظام لتوليد الفيديو المشروط بالنص طورته Google Research. يستفيد من سلسلة من نماذج الانتشار للفيديو لإنشاء مقاطع فيديو عالية الدقة من مطالبات نصية، مما يوفر دقة…

مولّدات الفيديو بالذكاء الاصطناعي

نماذج الذكاء الاصطناعي

MiniGPT-4 هو نموذج ذكاء اصطناعي يعزز فهم الرؤية واللغة من خلال مواءمة مشفر مرئي مجمد مع نموذج لغوي كبير. يمكنه إنشاء أوصاف تفصيلية للصور، وإنشاء مواقع ويب من مسودات، وكتابة قصص…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

Parti هو نموذج توليد صور من النصوص بالمسارات التلقائية الانحدارية ينشئ صورًا واقعية عالية الدقة. يعامل توليد الصور كمشكلة تسلسل إلى تسلسل، مستفيدًا من التطورات في نماذج اللغة…

مولّدات الصور بالذكاء الاصطناعي

نماذج الذكاء الاصطناعي

إيماجن هو نموذج متقدم لتحويل النص إلى صورة تم تطويره بواسطة جوجل ديب مايند. يقوم بإنشاء صور فوتوغرافية واقعية بدقة وسرعة استثنائية، مما يسمح للمستخدمين بتحويل رؤاهم الإبداعية إلى…

مميزةمولّدات الصور بالذكاء الاصطناعي

نماذج الذكاء الاصطناعي

StyleSwin هو شبكة توليدية تنافسية (GAN) تعتمد على المحولات (transformers) مصممة لتوليد الصور عالية الدقة. يستفيد من محولات Swin وآلية انتباه مزدوجة مبتكرة لتحقيق التوازن بين…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

تطبيقات الذكاء الاصطناعي

Stable Diffusion Online هو واجهة ويب مجانية وسهلة الاستخدام لنموذج Stable Diffusion XL لتحويل النص إلى صورة، حيث يتم إنشاء صور عالية الجودة وفوتوغرافية من نصوص في ثوانٍ دون الحاجة…

مولّدات الصور بالذكاء الاصطناعي

ALIGN هو نموذج ذكاء اصطناعي يوسع نطاق تعلم التمثيلات المرئية ولغة-الرؤية باستخدام إشراف نصي صاخب من أكثر من مليار زوج من الصور والنصوص البديلة. يحقق نتائج متطورة في الاسترجاع عبر…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة

نماذج الذكاء الاصطناعي

BEiT هو نموذج تمثيل رؤية ذاتي الإشراف يستخدم نمذجة الصور المقنعة للتدريب المسبق لمُحولات الرؤية. يقوم بترميز الصور إلى رموز مرئية ويستعيد الرقع المقنعة، محققًا نتائج تنافسية في…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة