跳转到主要内容
ToolPotion

bigscience/bloom

精选

BLOOM 是由 BigScience 开发的多语言自回归大型语言模型。它能够生成 46 种语言和 13 种编程语言的连贯文本,支持自然语言处理和研究的多种应用。

查看模型
分享

描述

BLOOM 是由 BigScience 开发的自回归大型语言模型(LLM),旨在通过开源和开放科学推动和普及人工智能。该模型于 2022 年 7 月 11 日发布,能够在 46 种自然语言和 13 种编程语言中生成连贯文本,使其成为自然语言处理领域多种应用的多功能工具。

BLOOM 的架构基于变换器模型,经过 Megatron-LM GPT2 的修改。它具有 1760 亿个参数,70 层和 112 个注意力头,使其能够有效地处理和生成文本。该模型在一个包含 1.6TB 预处理文本的大型数据集上进行训练,其中包括 3500 亿个独特的标记。这种广泛的训练使 BLOOM 能够执行文本生成任务,包括信息提取、问答和摘要,即使对于未明确训练的任务也能表现良好。

BLOOM 旨在为大型语言模型的公共研究提供便利,使研究人员、教育工作者和开发者都能轻松访问。它可以通过 Hugging Face 的生态系统轻松集成到应用程序中,需安装 transformers 和 accelerate。该模型的目标用户包括公众、研究人员、学生和工程师等。然而,重要的是要注意,该模型不应在高风险环境或关键决策中使用,因为它可能生成看似真实但实际上不正确的输出。

BLOOM 的训练是在 Jean Zay 公共超级计算机上进行的,使用了 384 个 A100 80GB GPU,并由法国政府资助。通过使用核能来减轻训练过程的环境影响,产生的热量被重新用于校园住房。总体而言,BLOOM 代表了人工智能领域的一次重大进步,为语言生成和研究提供了强大的工具。

bigscience/bloom亮点

  • 模型类型:基于变换器的语言模型

  • 参数:176B

  • 支持的语言:46 种自然语言,13 种编程语言

  • 许可证:RAIL 许可证 v1.0

  • 发布日期:2022 年 7 月 11 日

  • 训练数据大小:1.6TB

  • 训练标记:350B 个独特标记

  • 计算基础设施:Jean Zay 公共超级计算机

bigscience/bloom入门

  1. 访问页面:访问 Hugging Face 网站以获取 BLOOM。

  2. 加载模型:使用 Hugging Face 的 transformers 库下载 BLOOM 模型。

  3. 配置环境:确保在您的环境中安装了 transformers 和 accelerate。

  4. 集成:根据需要使用该模型进行文本生成任务。

  5. 微调:可选地对模型进行特定应用的微调。

bigscience/bloom的使用案例

  • 文本生成
  • 信息提取
  • 问答
  • 摘要
  • 语言研究

bigscience/bloom的常见问题

bigscience/bloom 评价

加载中...

与 bigscience/bloom 类似的热门AI工具

BigBird基础模型是一个Transformer模型,它通过块稀疏注意力机制扩展了BERT,能够处理更长的序列。该模型已针对英文文本进行掩码语言模型任务的预训练,可以高效处理长达4096个token的序列,并在长文档任务上取得了最先进的成果。

AI 模型与大语言模型

Mistral-7B-v0.1 是一个具有 70 亿参数的预训练生成文本模型,旨在通过开源推动人工智能的发展。它在各种基准测试中超越了 Llama 2 13B,使其成为自然语言处理任务的强大工具。

精选AI 模型与大语言模型

AI 模型

DistilGPT2 是一个经过蒸馏的、以英语为基础的文本生成模型,源自 GPT-2。它提供了比其前代产品更快、更轻量级的替代方案,适用于各种创意和辅助写作任务。该模型经过预训练,可通过 Hugging Face 进行集成。

精选AI 模型与大语言模型

Whisper 是 OpenAI 开发的一个强大、通用的语音识别模型。它在多语言语音识别、语音翻译和语言识别方面表现出色。通过在多样化的音频数据上进行训练,它提供了一个单一模型来处理各种语音处理任务,用统一的序列到序列方法取代了传统的多阶段流水线。

精选AI 转录工具

本研究实证分析了在固定计算预算下,大型语言模型模型大小与训练数据之间的最优权衡。研究表明,当前的大型模型通常过大且训练不足,并提出了一种更高效的方法以获得更好的性能和降低推理成本。

AI 模型与大语言模型

DeepSeek V4 Flash 是一个为高级文本生成任务设计的 AI 模型集合。它利用开源和开放科学原则来实现人工智能的民主化,提供一系列具有不同参数的模型,以满足多样化的应用需求。

AI 模型与大语言模型

Gemma 3-27B IT 是谷歌推出的最先进的多模态 AI 模型,能够处理文本和图像输入以生成文本输出。它支持超过 140 种语言,并设计用于在资源有限的环境中高效部署。

AI 模型与大语言模型

Google Gemma 2 9B Instruct 是一个轻量级、先进的开放模型,专为文本生成任务而设计。它是 Gemma 家族的一部分,提供问答、摘要和推理的能力,适合在资源有限的环境中部署。

AI 模型与大语言模型