描述
稳定扩散 3.5 大型是由 Stability AI 开发的前沿多模态扩散变换器 (MMDiT) 模型,专门设计用于文本到图像的生成。该模型在基于文本提示生成高质量图像方面表现出色,在图像质量、排版和复杂提示理解等领域展示了改进的性能。该模型由三个固定的预训练文本编码器构建,并利用 QK 归一化来增强训练稳定性。
该模型根据 Stability Community License 发布,允许在研究和非商业目的下免费使用,以及适用于年收入低于 100 万美元的组织或个人。对于年收入更高的用户,提供企业许可证。用户必须同意许可证协议并承认 Stability AI 的隐私政策,以访问模型的文件和内容。
稳定扩散 3.5 旨在用于多种应用,包括艺术作品生成、教育工具和生成模型的研究。然而,重要的是要注意,该模型并不旨在创建对人或事件的事实表示,所有使用必须遵守 Stability AI 制定的可接受使用政策。
对于本地或自托管使用,鼓励开发者利用 ComfyUI 进行基于节点的 UI 推理或使用 diffusers 库进行编程访问。该模型已在多样化的数据集上进行训练,包括合成数据和公开可用数据,确保对提示和上下文的广泛理解。作为对安全性的承诺,Stability AI 实施了各种保障措施,以减轻与有害内容和误用相关的风险,强调负责任的 AI 部署的重要性。
稳定扩散 3.5亮点
模型类型:MMDiT 文本到图像
API 可用:是
许可证:社区许可证
微调支持:是
多模态:是
性能提升:是
训练稳定性:QK 归一化
预期用途:艺术生成,教育工具
稳定扩散 3.5入门
访问模型:访问稳定扩散 3.5 的 Hugging Face 页面。
身份验证:同意许可证协议以访问模型。
设置环境:选择 ComfyUI 或 diffusers 进行实现。
通过 API 集成:使用提供的 API 端点进行集成。
优化:根据特定应用需求微调模型。
稳定扩散 3.5的使用案例
- 艺术生成
- 教育工具
- 创意设计
- 研究应用
- 提示工程








