跳转到主要内容
ToolPotion

OpenLLaMA

OpenLLaMA 是 Meta AI 的 LLaMA 7B 模型的一个允许自由许可的开源复现版本。它在 RedPajama 数据集上进行训练,提供 3B、7B 和 13B 参数版本,并提供 PyTorch 和 JAX 权重,可无缝集成到现有的 LLaMA 实现中。

访问URL

描述

OpenLLaMA 代表了开源大型语言模型的一项重大进展,它提供了 Meta AI 的 LLaMA 模型的一个允许自由许可的开源复现版本。该项目由 openlm-research 开发,旨在通过提供易于获取的权重和训练方法来普及强大的语言模型。

该项目发布了一系列模型,包括 3B、7B 和 13B 参数版本,所有模型均在万亿(one trillion)个 token 上进行训练。这些模型被设计为现有 LLaMA 模型实现中的即插即用替代品。该项目提供 PyTorch 格式的权重(与 Hugging Face transformers 库兼容)和 JAX 格式的权重(用于 EasyLM 框架)。

OpenLLaMA 的训练方法严格遵循原始 LLaMA 论文,使用了相同的模型架构、上下文长度、训练步数、学习率调度和优化器。关键区别在于使用的数据集:v1 模型在 RedPajama 数据集上训练,而 v2 模型则结合了 Falcon refined-web 数据集、StarCoder 数据集以及 RedPajama 数据集的部分内容(Wikipedia、ArXiv、Books、StackExchange)。这种对开放数据集的承诺确保了透明度和可复现性。

该项目强调评估和比较,使用 lm-evaluation-harness 在广泛的任务上展示了与 LLaMA 和 GPT-J 的对比结果。OpenLLaMA 模型在大多数任务上表现出与同类模型相当,甚至在某些情况下更优的性能。开发团队还解决了潜在问题,例如影响代码生成任务的 tokenizer 配置,并建议将 v2 模型用于此类应用。

OpenLLaMA 在 Apache 2.0 许可下发布,鼓励广泛采用和修改。该项目是一项协作成果,得到了 Berkeley AI Research 的贡献以及 Google TPU Research Cloud 项目的支持。这项举措赋能研究人员和开发人员在最先进的语言模型基础上进行构建和创新。

OpenLLaMA亮点

  • Meta AI LLaMA 的允许自由许可的开源复现版本

  • 提供 3B、7B 和 13B 参数尺寸

  • 在 1T token 上训练

  • 提供 PyTorch 和 JAX 格式的权重

  • 兼容 Hugging Face transformers 和 EasyLM 框架

  • 遵循原始 LLaMA 架构和训练超参数

  • 使用 RedPajama、Falcon refined-web 和 StarCoder 等开放数据集

  • 与原始 LLaMA 和 GPT-J 性能相当

  • Apache 2.0 许可,允许广泛使用

  • 包含评估结果和比较

  • Tokenizer 设计用于合并多个空空格,类似于 T5

OpenLLaMA入门

  1. 访问模型权重:从 Hugging Face Hub 或 EasyLM 存储库下载 PyTorch 或 JAX 权重。

  2. 设置环境:安装必要的库,如 transformers、PyTorch 或 JAX。

  3. 加载 Tokenizer:使用 LlamaTokenizer 或 AutoTokenizer,并设置 `use_fast=False` 以避免潜在的 tokenization 问题。

  4. 加载模型:从 Hugging Face transformers 中实例化 LlamaForCausalLM,或在 EasyLM 中使用等效方法。

  5. 通过 API 集成:利用加载的模型进行文本生成、推理或微调任务。

  6. 评估性能:使用 lm-evaluation-harness 进行基准测试,确保正确使用 tokenizer。

OpenLLaMA的使用案例

  • 文本生成
  • 语言理解
  • 模型复现
  • 研究与开发
  • 聊天机器人开发
  • 代码生成

OpenLLaMA的常见问题

OpenLLaMA 评价

加载中...

与 OpenLLaMA 类似的热门AI工具

OpenELM 是来自 Apple Machine Learning Research 的最先进的开放语言模型系列。它采用逐层缩放策略以提高准确性,并提供了一个完整的框架,用于在包括日志和检查点在内的公共数据集上进行训练和评估。该发布还包括在 Apple 设备上集成 MLX 的代码。

AI 模型与大语言模型

Mistral-7B-v0.1 是一个具有 70 亿参数的预训练生成文本模型,旨在通过开源推动人工智能的发展。它在各种基准测试中超越了 Llama 2 13B,使其成为自然语言处理任务的强大工具。

精选AI 模型与大语言模型

AI 智能体

OpenRouter 提供统一的 API 接口,可访问来自多个提供商的海量大型语言模型 (LLM)。它提供有竞争力的价格、通过分布式基础设施实现的高可用性以及自定义数据策略,使开发人员能够高效地集成各种 AI 模型,而不会被供应商锁定。

精选AI 模型与大语言模型

RWKV 是一个强大的语言模型,提供高效的推理和灵活的微调能力。它支持各种应用,包括桌面 GUI、基于 Web 的推理和移动应用,使先进的 AI 能够跨多个平台和设备用于各种任务。

AI 模型与大语言模型

大语言模型

这是 Llama 2 13b 的一个微调版本,通过 Llama 33b 的额外注意力头进行了增强。它在约 1000 万个 RedPajama token 上进行了训练,以更好地集成这些新组件。该模型旨在作为进一步开发的基石,目标是提高学习能力,优于标准的 13b 模型。

AI 模型与大语言模型

AI 应用

一个开源模型社区和平台,用于探索、运行、微调和部署AI模型和数据集,提供Python库和托管工作室以构建AI应用程序。

AI 模型与大语言模型

AI 框架

一款免费的开源桌面应用程序,可在Mac、Windows和Linux上本地运行和训练AI模型,具有无代码用户界面、代理连接和与OpenAI兼容的API。

精选AI 模型与大语言模型

本研究实证分析了在固定计算预算下,大型语言模型模型大小与训练数据之间的最优权衡。研究表明,当前的大型模型通常过大且训练不足,并提出了一种更高效的方法以获得更好的性能和降低推理成本。

AI 模型与大语言模型