描述
BLOOM 是由 BigScience 开发的自回归大型语言模型(LLM),旨在通过开源和开放科学推动和普及人工智能。该模型于 2022 年 7 月 11 日发布,能够在 46 种自然语言和 13 种编程语言中生成连贯文本,使其成为自然语言处理领域多种应用的多功能工具。
BLOOM 的架构基于变换器模型,经过 Megatron-LM GPT2 的修改。它具有 1760 亿个参数,70 层和 112 个注意力头,使其能够有效地处理和生成文本。该模型在一个包含 1.6TB 预处理文本的大型数据集上进行训练,其中包括 3500 亿个独特的标记。这种广泛的训练使 BLOOM 能够执行文本生成任务,包括信息提取、问答和摘要,即使对于未明确训练的任务也能表现良好。
BLOOM 旨在为大型语言模型的公共研究提供便利,使研究人员、教育工作者和开发者都能轻松访问。它可以通过 Hugging Face 的生态系统轻松集成到应用程序中,需安装 transformers 和 accelerate。该模型的目标用户包括公众、研究人员、学生和工程师等。然而,重要的是要注意,该模型不应在高风险环境或关键决策中使用,因为它可能生成看似真实但实际上不正确的输出。
BLOOM 的训练是在 Jean Zay 公共超级计算机上进行的,使用了 384 个 A100 80GB GPU,并由法国政府资助。通过使用核能来减轻训练过程的环境影响,产生的热量被重新用于校园住房。总体而言,BLOOM 代表了人工智能领域的一次重大进步,为语言生成和研究提供了强大的工具。
bigscience/bloom亮点
模型类型:基于变换器的语言模型
参数:176B
支持的语言:46 种自然语言,13 种编程语言
许可证:RAIL 许可证 v1.0
发布日期:2022 年 7 月 11 日
训练数据大小:1.6TB
训练标记:350B 个独特标记
计算基础设施:Jean Zay 公共超级计算机
bigscience/bloom入门
访问页面:访问 Hugging Face 网站以获取 BLOOM。
加载模型:使用 Hugging Face 的 transformers 库下载 BLOOM 模型。
配置环境:确保在您的环境中安装了 transformers 和 accelerate。
集成:根据需要使用该模型进行文本生成任务。
微调:可选地对模型进行特定应用的微调。
bigscience/bloom的使用案例
- 文本生成
- 信息提取
- 问答
- 摘要
- 语言研究








