描述
Parti,即 Pathways 自回归文本到图像模型,是一种从文本描述生成照片级真实感图像的新颖方法。它将文本到图像生成视为一个序列到序列建模问题,与机器翻译类似,并受益于大型语言模型的进步,特别是通过扩展数据和模型规模所实现的进步。Parti 利用 ViT-VQGAN 图像分词器将图像转换为离散标记序列,使其能够将这些序列重建为高质量、视觉上多样化的图像。
随着其编码器-解码器规模扩展到 200 亿参数,该模型展示了一致的质量改进。在 MS-COCO 基准测试上,Parti 实现了最先进的零样本 FID 分数 7.23 和微调 FID 分数 3.22。其有效性涵盖了各种类别和挑战,这在最新发布的 PartiPrompts 基准测试上得到了分析,该基准测试是一个包含 1600 多个英文提示的整体集合,旨在衡量模型在不同方面的能力。
Parti 在处理长而复杂的提示方面表现出色,这些提示需要准确反映世界知识、具有精细细节和交互的多个参与者和对象的构图,以及遵循特定的图像格式和风格。该模型的能力体现在其根据抽象概念生成图像、整合世界知识、渲染特定视角,甚至在图像中生成文本和符号的能力。
Parti 使用 Lingvo 实现,并利用 GSPMD 在 TPU v4 硬件上进行扩展,其架构允许显著的扩展。对从 3.5 亿到 200 亿参数的模型进行的比较显示,模型能力和输出图像质量有了显著提高。人工评估者一致偏好更大的模型,尤其是在图像真实感、质量和文本-图像对齐方面。200 亿参数模型在需要抽象推理、世界知识、特定视角以及渲染文本和符号的提示方面表现出特别的优势。
虽然 Parti 为创造力和视觉传达提供了令人兴奋的可能性,但研究也承认存在重大风险,包括由于训练数据中的偏差而可能编码有害的刻板印象和表征。与其他文本到图像模型类似,Parti 可能反映西方偏见,并且对某些背景的代表性不足。创建深度伪造和传播错误信息的可能性也是一个令人担忧的问题。由于这些风险,Google Research 决定在没有进一步保障措施的情况下不公开发布 Parti 模型、代码或数据。取而代之的是,他们在发布的图像上提供 Parti 水印,并计划专注于偏差测量、缓解策略以及与艺术家协调以探索负责任的应用。
Parti:Pathways 自回归文本到图像模型亮点
自回归文本到图像生成
高保真度照片级真实感图像生成
支持具有复杂构图的内容丰富合成
利用大型语言模型进步
序列到序列建模方法
利用 ViT-VQGAN 进行图像分词
可扩展架构,高达 200 亿参数
在 MS-COCO 上实现最先进的 FID 分数
在各种提示类别和难度方面均有效
处理抽象提示和世界知识
渲染特定视角和文本/符号
在 Lingvo 中实现,并使用 GSPMD 在 TPU v4 上进行扩展
Parti:Pathways 自回归文本到图像模型入门
访问模型:了解研究论文及其关于 Parti 的发现。
探索能力:查看示例提示和生成的图像以评估模型性能。
分析基准测试结果:检查 FID 分数和在 PartiPrompts 基准测试上的性能。
理解局限性:熟悉已识别的故障模式和改进领域。
考虑负责任的使用:注意与文本到图像模型相关的伦理考量和风险。
查阅数据卡:访问有关数据收集和模型开发实践的信息。
Parti:Pathways 自回归文本到图像模型的使用案例
- 照片级真实感图像生成
- 复杂场景合成
- 世界知识整合
- 抽象概念可视化
- 艺术风格模仿
- 文本和符号渲染
- 创意内容创作






