Beschreibung
Parti, das Pathways Autoregressive Text-to-Image-Modell, ist ein neuartiger Ansatz zur Generierung fotorealistischer Bilder aus Textbeschreibungen. Es formuliert die Text-zu-Bild-Generierung als Sequenz-zu-Sequenz-Modellierungsproblem, zieht Parallelen zur maschinellen Übersetzung und profitiert von Fortschritten bei großen Sprachmodellen, insbesondere denen, die durch Skalierung von Daten und Modellgrößen erzielt werden. Parti verwendet den ViT-VQGAN-Bild-Tokenizer, um Bilder in Sequenzen diskreter Tokens umzuwandeln, was es ihm ermöglicht, diese Sequenzen zu qualitativ hochwertigen, visuell vielfältigen Bildern zu rekonstruieren.
Dieses Modell zeigt konsistente Qualitätsverbesserungen, wenn seine Encoder-Decoder-Architektur auf bis zu 20 Milliarden Parameter skaliert wird. Parti hat auf dem MS-COCO-Benchmark branchenführende Zero-Shot-FID-Werte von 7,23 und Finetuned-FID-Werte von 3,22 erzielt. Seine Effektivität erstreckt sich über eine breite Palette von Kategorien und Herausforderungen, wie auf dem neu veröffentlichten PartiPrompts-Benchmark analysiert, einer umfassenden Sammlung von über 1600 englischen Prompts, die entwickelt wurden, um die Fähigkeiten des Modells in verschiedenen Aspekten zu messen.
Parti zeichnet sich durch die Verarbeitung langer, komplexer Prompts aus, die eine genaue Wiedergabe von Weltwissen, die Komposition zahlreicher Teilnehmer und Objekte mit feingranularen Details und Interaktionen sowie die Einhaltung spezifischer Bildformate und Stile erfordern. Die Fähigkeiten des Modells zeigen sich in seiner Fähigkeit, Bilder basierend auf abstrakten Konzepten zu generieren, Weltwissen zu integrieren, spezifische Perspektiven darzustellen und sogar Text und Symbole innerhalb von Bildern zu produzieren. Die Forschung hebt auch Einschränkungen und Bereiche für zukünftige Verbesserungen hervor, wie z. B. die Handhabung von Negation und die Angabe von Abwesenheit.
Entwickelt mit Lingvo und skaliert mit GSPMD auf TPU v4-Hardware, ermöglicht die Architektur von Parti eine signifikante Skalierung. Vergleiche zwischen Modellen im Bereich von 350 Millionen bis 20 Milliarden Parametern zeigen erhebliche Verbesserungen der Modellfähigkeiten und der Ausgabebildqualität. Menschliche Bewerter bevorzugten durchweg größere Modelle, insbesondere in Bezug auf Bildrealismus, Qualität und Text-Bild-Abgleich. Das Modell mit 20 Milliarden Parametern zeigt besondere Stärken bei Prompts, die abstraktes Denken, Weltwissen, spezifische Blickwinkel sowie die Darstellung von Text und Symbolen erfordern.
Während Parti spannende Möglichkeiten für Kreativität und visuelle Kommunikation bietet, erkennt die Forschung erhebliche Risiken an, darunter das Potenzial zur Kodierung schädlicher Stereotypen und Darstellungen aufgrund von Verzerrungen in den Trainingsdaten. Ähnlich wie andere Text-zu-Bild-Modelle kann Parti westliche Verzerrungen widerspiegeln und bestimmte Hintergründe unterrepräsentieren. Das Potenzial zur Erstellung von Deepfakes und zur Verbreitung von Fehlinformationen ist ebenfalls ein Problem. Aufgrund dieser Risiken hat Google Research beschlossen, die Parti-Modelle, den Code oder die Daten ohne weitere Sicherheitsvorkehrungen nicht öffentlich freizugeben. Stattdessen stellen sie ein Parti-Wasserzeichen auf veröffentlichten Bildern bereit und planen, sich auf die Messung von Verzerrungen, Minderungsstrategien und die Koordinierung mit Künstlern zur Erforschung verantwortungsvoller Anwendungen zu konzentrieren.
Parti: Pathways Autoregressive Text-to-Image Model im Überblick
Autoregressive Text-zu-Bild-Generierung
Hochauflösende fotorealistische Bilderzeugung
Unterstützt inhaltsreiche Synthesen mit komplexen Kompositionen
Nutzt Fortschritte bei großen Sprachmodellen
Sequenz-zu-Sequenz-Modellierungsansatz
Verwendet ViT-VQGAN zur Bildtokenisierung
Skalierbare Architektur bis zu 20 Milliarden Parameter
Erreicht branchenführende FID-Werte auf MS-COCO
Effektiv über verschiedene Prompt-Kategorien und Schwierigkeitsgrade hinweg
Verarbeitet abstrakte Prompts und Weltwissen
Stellt spezifische Perspektiven und Text/Symbole dar
Implementiert in Lingvo und skaliert mit GSPMD auf TPU v4
Erste Schritte mit Parti: Pathways Autoregressive Text-to-Image Model
Modellzugriff: Verstehen Sie das Forschungs paper und seine Ergebnisse zu Parti.
Fähigkeiten erkunden: Überprüfen Sie Beispiel-Prompts und generierte Bilder, um die Modellleistung einzuschätzen.
Benchmark-Ergebnisse analysieren: Untersuchen Sie FID-Werte und die Leistung auf dem PartiPrompts-Benchmark.
Einschränkungen verstehen: Machen Sie sich mit identifizierten Fehlermodi und Verbesserungsmöglichkeiten vertraut.
Verantwortungsvolle Nutzung erwägen: Beachten Sie die ethischen Überlegungen und Risiken im Zusammenhang mit Text-zu-Bild-Modellen.
Datenkarte prüfen: Greifen Sie auf Informationen zu Datenerfassung und Modellentwicklungspraktiken zu.
Parti: Pathways Autoregressive Text-to-Image Model's Anwendungsfälle
- Fotorealistische Bilderzeugung
- Komplexe Szenensynthese
- Integration von Weltwissen
- Visualisierung abstrakter Konzepte
- Emulation künstlerischer Stile
- Text- und Symbolrendering
- Erstellung kreativer Inhalte






