Description
Parti, le modèle Pathways Autoregressive Text-to-Image, est une approche novatrice pour générer des images photoréalistes à partir de descriptions textuelles. Il aborde la génération de texte à image comme un problème de modélisation séquence à séquence, établissant des parallèles avec la traduction automatique et bénéficiant des avancées des grands modèles linguistiques, en particulier celles rendues possibles par la mise à l'échelle des données et des tailles de modèles. Parti utilise le tokenizer d'images ViT-VQGAN pour convertir les images en séquences de jetons discrets, ce qui lui permet de reconstruire ces séquences en images de haute qualité et visuellement diverses.
Ce modèle démontre des améliorations constantes de la qualité à mesure que son encodeur-décodeur passe à 20 milliards de paramètres. Parti a atteint des scores FID de pointe en zéro coup (zero-shot) de 7,23 et des scores FID affinés (finetuned) de 3,22 sur le benchmark MS-COCO. Son efficacité couvre une grande variété de catégories et de défis, comme analysé sur le nouveau benchmark PartiPrompts, une collection holistique de plus de 1600 invites en anglais conçues pour mesurer les capacités du modèle dans divers aspects.
Parti excelle dans le traitement d'invites longues et complexes qui nécessitent une réflexion précise des connaissances mondiales, la composition de nombreux participants et objets avec des détails et des interactions fins, et le respect de formats et de styles d'image spécifiques. Les capacités du modèle sont évidentes dans son aptitude à générer des images basées sur des concepts abstraits, à incorporer des connaissances mondiales, à rendre des perspectives spécifiques et même à produire du texte et des symboles dans les images. La recherche met également en évidence les limites et les domaines d'amélioration future, tels que la gestion de la négation et des indications d'absence.
Développé à l'aide de Lingvo et mis à l'échelle avec GSPMD sur du matériel TPU v4, l'architecture de Parti permet une mise à l'échelle significative. Les comparaisons entre des modèles allant de 350 millions à 20 milliards de paramètres montrent des améliorations substantielles dans les capacités du modèle et la qualité des images de sortie. Les évaluateurs humains ont systématiquement préféré les modèles plus grands, en particulier pour le réalisme des images, la qualité et l'alignement texte-image. Le modèle de 20 milliards de paramètres montre une force particulière dans les invites nécessitant un raisonnement abstrait, des connaissances mondiales, des points de vue spécifiques et le rendu de texte et de symboles.
Bien que Parti offre des possibilités passionnantes pour la créativité et la communication visuelle, la recherche reconnaît des risques importants, notamment le potentiel d'encodage de stéréotypes et de représentations nuisibles en raison de biais dans les données d'entraînement. Similaire à d'autres modèles de texte à image, Parti peut refléter des biais occidentaux et sous-représenter certains milieux. Le potentiel de création de deepfakes et de propagation de désinformation est également une préoccupation. En raison de ces risques, Google Research a décidé de ne pas publier les modèles, le code ou les données de Parti publiquement sans garanties supplémentaires. Au lieu de cela, ils fournissent un filigrane Parti sur les images publiées et prévoient de se concentrer sur la mesure des biais, les stratégies d'atténuation et la coordination avec les artistes pour explorer des applications responsables.
Points forts de Parti : Modèle Autoregressif de Texte à Image Pathways
Génération autoregressive de texte à image
Génération d'images photoréalistes de haute fidélité
Prend en charge la synthèse riche en contenu avec des compositions complexes
Tire parti des avancées des grands modèles linguistiques
Approche de modélisation séquence à séquence
Utilise ViT-VQGAN pour la tokenisation d'images
Architecture évolutive jusqu'à 20 milliards de paramètres
Atteint des scores FID de pointe sur MS-COCO
Efficace dans diverses catégories d'invites et aspects de difficulté
Gère les invites abstraites et les connaissances mondiales
Rend des perspectives spécifiques et du texte/symboles
Implémenté dans Lingvo et mis à l'échelle avec GSPMD sur TPU v4
Premiers pas avec Parti : Modèle Autoregressif de Texte à Image Pathways
Accéder au modèle : Comprendre le document de recherche et ses conclusions sur Parti.
Explorer les capacités : Examiner les exemples d'invites et les images générées pour évaluer les performances du modèle.
Analyser les résultats des benchmarks : Examiner les scores FID et les performances sur le benchmark PartiPrompts.
Comprendre les limites : Se familiariser avec les modes d'échec identifiés et les domaines d'amélioration.
Considérer une utilisation responsable : Être conscient des considérations éthiques et des risques associés aux modèles de texte à image.
Consulter la fiche de données : Accéder aux informations sur la collecte de données et les pratiques de développement du modèle.
Cas d'utilisation de Parti : Modèle Autoregressif de Texte à Image Pathways
- Génération d'images photoréalistes
- Synthèse de scènes complexes
- Intégration des connaissances mondiales
- Visualisation de concepts abstraits
- Émulation de styles artistiques
- Rendu de texte et de symboles
- Création de contenu créatif






