Aller au contenu principal
ToolPotion

Parti : Modèle Autoregressif de Texte à Image Pathways

Parti est un modèle autoregressif de génération de texte à image qui crée des images photoréalistes de haute fidélité. Il traite la génération d'images comme un problème de séquence à séquence, en tirant parti des avancées des grands modèles linguistiques pour des compositions complexes et la synthèse de connaissances mondiales. Parti prend en charge la synthèse riche en contenu avec des détails et des interactions complexes.

Visiter l'URL

Description

Parti, le modèle Pathways Autoregressive Text-to-Image, est une approche novatrice pour générer des images photoréalistes à partir de descriptions textuelles. Il aborde la génération de texte à image comme un problème de modélisation séquence à séquence, établissant des parallèles avec la traduction automatique et bénéficiant des avancées des grands modèles linguistiques, en particulier celles rendues possibles par la mise à l'échelle des données et des tailles de modèles. Parti utilise le tokenizer d'images ViT-VQGAN pour convertir les images en séquences de jetons discrets, ce qui lui permet de reconstruire ces séquences en images de haute qualité et visuellement diverses.

Ce modèle démontre des améliorations constantes de la qualité à mesure que son encodeur-décodeur passe à 20 milliards de paramètres. Parti a atteint des scores FID de pointe en zéro coup (zero-shot) de 7,23 et des scores FID affinés (finetuned) de 3,22 sur le benchmark MS-COCO. Son efficacité couvre une grande variété de catégories et de défis, comme analysé sur le nouveau benchmark PartiPrompts, une collection holistique de plus de 1600 invites en anglais conçues pour mesurer les capacités du modèle dans divers aspects.

Parti excelle dans le traitement d'invites longues et complexes qui nécessitent une réflexion précise des connaissances mondiales, la composition de nombreux participants et objets avec des détails et des interactions fins, et le respect de formats et de styles d'image spécifiques. Les capacités du modèle sont évidentes dans son aptitude à générer des images basées sur des concepts abstraits, à incorporer des connaissances mondiales, à rendre des perspectives spécifiques et même à produire du texte et des symboles dans les images. La recherche met également en évidence les limites et les domaines d'amélioration future, tels que la gestion de la négation et des indications d'absence.

Développé à l'aide de Lingvo et mis à l'échelle avec GSPMD sur du matériel TPU v4, l'architecture de Parti permet une mise à l'échelle significative. Les comparaisons entre des modèles allant de 350 millions à 20 milliards de paramètres montrent des améliorations substantielles dans les capacités du modèle et la qualité des images de sortie. Les évaluateurs humains ont systématiquement préféré les modèles plus grands, en particulier pour le réalisme des images, la qualité et l'alignement texte-image. Le modèle de 20 milliards de paramètres montre une force particulière dans les invites nécessitant un raisonnement abstrait, des connaissances mondiales, des points de vue spécifiques et le rendu de texte et de symboles.

Bien que Parti offre des possibilités passionnantes pour la créativité et la communication visuelle, la recherche reconnaît des risques importants, notamment le potentiel d'encodage de stéréotypes et de représentations nuisibles en raison de biais dans les données d'entraînement. Similaire à d'autres modèles de texte à image, Parti peut refléter des biais occidentaux et sous-représenter certains milieux. Le potentiel de création de deepfakes et de propagation de désinformation est également une préoccupation. En raison de ces risques, Google Research a décidé de ne pas publier les modèles, le code ou les données de Parti publiquement sans garanties supplémentaires. Au lieu de cela, ils fournissent un filigrane Parti sur les images publiées et prévoient de se concentrer sur la mesure des biais, les stratégies d'atténuation et la coordination avec les artistes pour explorer des applications responsables.

Points forts de Parti : Modèle Autoregressif de Texte à Image Pathways

  • Génération autoregressive de texte à image

  • Génération d'images photoréalistes de haute fidélité

  • Prend en charge la synthèse riche en contenu avec des compositions complexes

  • Tire parti des avancées des grands modèles linguistiques

  • Approche de modélisation séquence à séquence

  • Utilise ViT-VQGAN pour la tokenisation d'images

  • Architecture évolutive jusqu'à 20 milliards de paramètres

  • Atteint des scores FID de pointe sur MS-COCO

  • Efficace dans diverses catégories d'invites et aspects de difficulté

  • Gère les invites abstraites et les connaissances mondiales

  • Rend des perspectives spécifiques et du texte/symboles

  • Implémenté dans Lingvo et mis à l'échelle avec GSPMD sur TPU v4

Premiers pas avec Parti : Modèle Autoregressif de Texte à Image Pathways

  1. Accéder au modèle : Comprendre le document de recherche et ses conclusions sur Parti.

  2. Explorer les capacités : Examiner les exemples d'invites et les images générées pour évaluer les performances du modèle.

  3. Analyser les résultats des benchmarks : Examiner les scores FID et les performances sur le benchmark PartiPrompts.

  4. Comprendre les limites : Se familiariser avec les modes d'échec identifiés et les domaines d'amélioration.

  5. Considérer une utilisation responsable : Être conscient des considérations éthiques et des risques associés aux modèles de texte à image.

  6. Consulter la fiche de données : Accéder aux informations sur la collecte de données et les pratiques de développement du modèle.

Cas d'utilisation de Parti : Modèle Autoregressif de Texte à Image Pathways

  • Génération d'images photoréalistes
  • Synthèse de scènes complexes
  • Intégration des connaissances mondiales
  • Visualisation de concepts abstraits
  • Émulation de styles artistiques
  • Rendu de texte et de symboles
  • Création de contenu créatif

FAQ de Parti : Modèle Autoregressif de Texte à Image Pathways

Avis sur Parti : Modèle Autoregressif de Texte à Image Pathways

Chargement...

Outils IA populaires comme Parti : Modèle Autoregressif de Texte à Image Pathways

Modèles IA

DM-GAN est une implémentation PyTorch des réseaux antagonistes génératifs à mémoire dynamique (Dynamic Memory Generative Adversarial Networks) pour la synthèse texte-image. Ce…

Générateurs d'images IA

Imagen est un modèle d'IA de pointe de conversion de texte en image développé par Google DeepMind. Il génère des images photoréalistes avec une clarté et une rapidité…

En vedetteGénérateurs d'images IA

Modèles IA

DALL·E est un modèle d'IA qui génère des images à partir de descriptions textuelles. Il peut créer une large gamme de concepts visuels, combiner des idées non liées, rendre du…

Générateurs d'images IA

Qwen-Image est un modèle de génération d'images avancé qui excelle dans le rendu de texte complexe et l'édition d'images précise. Il prend en charge une variété de styles…

En vedetteGénérateurs d'images IA

Modèles IA

StyleGAN-XL est un modèle d'IA pour la génération d'images haute résolution à partir de jeux de données volumineux et diversifiés. Il adapte l'architecture StyleGAN pour améliorer…

Générateurs d'images IA

Imagen est un modèle de diffusion texte-vers-image développé par Google Research. Il génère des images photoréalistes avec une compréhension approfondie du langage. Imagen excelle…

Modèles d'IA et LLM

Modèles IA

VideoPoet est un grand modèle linguistique de Google Research capable de génération vidéo en mode zero-shot. Il transforme les modèles de langage autorégressifs en générateurs…

Générateurs de vidéos IA