跳转到主要内容
ToolPotion

BigDL LLM

BigDL-LLM 是一个开源库,用于在 Intel XPU 硬件上运行大型语言模型 (LLM),涵盖从笔记本电脑到云端 GPU 的各种设备。它支持 INT4/FP4/INT8/FP8 量化以实现低延迟推理,并为 PyTorch 模型提供全面的微调功能。

访问URL

描述

BigDL 项目,特别是其 BigDL-LLM 组件(现正过渡到 IPEX-LLM),是一个强大的库,旨在优化各种 Intel 硬件(包括 CPU 和 GPU)上的大型语言模型 (LLM) 性能。它通过利用 INT4、FP4、INT8 和 FP8 等先进的量化技术,使用户能够以显著降低的延迟运行 LLM。这种优化对于在多样化的硬件配置上高效部署复杂的 AI 模型至关重要。

BigDL-LLM 基于 llama.cpp、gptq、bitsandbytes 和 qlora 等库的基础工作构建,为基于 PyTorch 的 LLM 的推理和微调提供了一个强大的框架。最近的更新亮点包括直接从 ModelScope 加载模型、支持初始 INT2 以在 VRAM 有限的 GPU 上运行大型模型,以及与 Text-Generation-WebUI 集成以提供图形用户体验。该库还引入了自适应推断解码 (Self-Speculative Decoding),可在 Intel GPU 和 CPU 上实现实际的推理延迟加速。

对于专注于模型定制的开发人员和研究人员,BigDL-LLM 在 Intel GPU 上为各种微调方法提供了全面的支持,包括 LoRA、QLoRA、DPO、QA-LoRA 和 ReLoRA。这使得能够有效地将预训练模型适配到特定的任务和数据集。该项目展示了令人印象深刻的微调速度,例如在多个 Intel GPU 上不到 30 分钟即可训练 LLaMA2-7B。此外,它还支持直接加载 GGUF、AWQ 和 GPTQ 等流行模型格式,并与 vLLM 集成以实现连续批处理,与 FastChat 集成以进行服务。

BigDL 生态系统超越了 LLM,还包括用于分布式数据分析和 AI (Orca)、TensorFlow 和 PyTorch 的透明加速 (Nano)、Spark 上的深度学习 (DLlib)、时间序列分析 (Chronos)、推荐系统 (Friesian) 和安全 AI (PPML) 的库。BigDL-LLM 是那些希望在 Intel 硬件上利用 LLM 功能的人的关键组件,为广泛的 AI 应用提供了灵活且高性能的解决方案。

BigDL LLM的核心功能

  • 在 Intel XPU(CPU、GPU)上优化 LLM 推理

  • 支持 INT4、FP4、INT8、FP8 量化

  • PyTorch 模型低延迟推理

  • 基于 llama.cpp、gptq、bitsandbytes、qlora 构建

  • 直接加载 GGUF、AWQ、GPTQ 模型

  • 在 Intel GPU 上进行全面的 LLM 微调(LoRA、QLoRA、DPO、QA-LoRA、ReLoRA)

  • 自适应推断解码,速度提升约 30%

  • 支持 vLLM 连续批处理

  • 在 Intel CPU 和 GPU 上进行 FastChat 服务

  • 直接从 ModelScope 加载

  • 支持初始 INT2 以在 16GB VRAM GPU 上运行大型 LLM

  • 与 Text-Generation-WebUI 集成

BigDL LLM入门

  1. 通过 pip 安装 BigDL-LLM:CPU 请使用 `pip install --pre --upgrade bigdl-llm[all]`,GPU 请使用 `bigdl-llm[xpu]`。

  2. 使用 `AutoModelForCausalLM.from_pretrained` 加载经过 INT4 优化的 Hugging Face Transformers 模型。

  3. 通过指定模型路径在 Intel CPU 上运行优化后的模型。

  4. 通过将模型和输入张量移动到 'xpu' 设备,在 Intel GPU 上运行优化后的模型。

  5. 为 LoRA、QLoRA、DPO、QA-LoRA 或 ReLoRA 配置微调参数。

  6. 利用 FastChat 或 vLLM 为优化的 LLM 提供服务。

  7. 与 LangChain 集成以进行 LLM 应用开发。

BigDL LLM的使用案例

  • 低延迟 LLM 推理
  • LLM 微调
  • 高效模型部署
  • AI 应用开发
  • 有限 VRAM 上的大型模型训练
  • 加速文本生成

BigDL LLM的常见问题

BigDL LLM 评价

加载中...

与 BigDL LLM 类似的热门AI工具

LiteRT 是 Google 的高性能设备端机器学习框架,用于在边缘平台部署 GenAI 和 ML 模型。它在 TensorFlow Lite 的基础上,提供高效的模型转换、运行时和优化,以实现跨越数十亿设备的低延迟和高隐私性。

MLOps 与模型部署

Intel® Neural Compressor 是一个开源 Python 库,提供适用于 PyTorch、TensorFlow 和 JAX 的流行模型压缩技术。它支持 LLM 和 VLM 的高级量化,可在各种 Intel 硬件和其他平台上通过广泛的测试进行性能优化。

机器学习平台

AI 应用

vLLM 是一个高吞吐量和内存高效的推理和服务引擎,专为大型语言模型(LLMs)设计。它使得 AI 模型的快速部署成为可能,提供先进的性能,使得 LLM 服务对各行业的用户而言变得简单、快速且具有成本效益。

MLOps 与模型部署

OpenVINO 是一个开源工具包,用于在各种硬件上部署高性能 AI 解决方案。它使开发人员能够转换、优化和运行来自流行框架的生成式和传统 AI 模型进行推理,支持云、AI PC 和边缘设备的高效部署。

MLOps 与模型部署

AI 平台

一个为开发者提供的AI基础设施平台,通过一个与OpenAI兼容的API,以按需付费的方式部署、微调和运行200多个优化的LLM和多模态模型。

精选MLOps 与模型部署

vllm-project/vllm 是一个高吞吐量和内存高效的推理和服务引擎,专为大型语言模型(LLMs)设计。它在优化性能的同时最小化资源使用,使其适用于人工智能和机器学习的各种应用。

精选MLOps 与模型部署

Bento 是一个为速度和控制而设计的推理平台,使您能够将任何 AI 模型部署到任何地方。它提供定制优化、高效扩展和简化的操作,以满足 AI 团队的需求。在保持对部署的完全控制的同时,简化推理基础设施。

精选MLOps 与模型部署

AI 框架

ONNX Runtime 是一个跨平台的加速机器学习框架,优化训练和推理。它支持多种编程语言和平台,使得将先进的 AI 能力集成到应用程序中变得简单。

精选机器学习平台