描述
BigDL 项目,特别是其 BigDL-LLM 组件(现正过渡到 IPEX-LLM),是一个强大的库,旨在优化各种 Intel 硬件(包括 CPU 和 GPU)上的大型语言模型 (LLM) 性能。它通过利用 INT4、FP4、INT8 和 FP8 等先进的量化技术,使用户能够以显著降低的延迟运行 LLM。这种优化对于在多样化的硬件配置上高效部署复杂的 AI 模型至关重要。
BigDL-LLM 基于 llama.cpp、gptq、bitsandbytes 和 qlora 等库的基础工作构建,为基于 PyTorch 的 LLM 的推理和微调提供了一个强大的框架。最近的更新亮点包括直接从 ModelScope 加载模型、支持初始 INT2 以在 VRAM 有限的 GPU 上运行大型模型,以及与 Text-Generation-WebUI 集成以提供图形用户体验。该库还引入了自适应推断解码 (Self-Speculative Decoding),可在 Intel GPU 和 CPU 上实现实际的推理延迟加速。
对于专注于模型定制的开发人员和研究人员,BigDL-LLM 在 Intel GPU 上为各种微调方法提供了全面的支持,包括 LoRA、QLoRA、DPO、QA-LoRA 和 ReLoRA。这使得能够有效地将预训练模型适配到特定的任务和数据集。该项目展示了令人印象深刻的微调速度,例如在多个 Intel GPU 上不到 30 分钟即可训练 LLaMA2-7B。此外,它还支持直接加载 GGUF、AWQ 和 GPTQ 等流行模型格式,并与 vLLM 集成以实现连续批处理,与 FastChat 集成以进行服务。
BigDL 生态系统超越了 LLM,还包括用于分布式数据分析和 AI (Orca)、TensorFlow 和 PyTorch 的透明加速 (Nano)、Spark 上的深度学习 (DLlib)、时间序列分析 (Chronos)、推荐系统 (Friesian) 和安全 AI (PPML) 的库。BigDL-LLM 是那些希望在 Intel 硬件上利用 LLM 功能的人的关键组件,为广泛的 AI 应用提供了灵活且高性能的解决方案。
BigDL LLM的核心功能
在 Intel XPU(CPU、GPU)上优化 LLM 推理
支持 INT4、FP4、INT8、FP8 量化
PyTorch 模型低延迟推理
基于 llama.cpp、gptq、bitsandbytes、qlora 构建
直接加载 GGUF、AWQ、GPTQ 模型
在 Intel GPU 上进行全面的 LLM 微调(LoRA、QLoRA、DPO、QA-LoRA、ReLoRA)
自适应推断解码,速度提升约 30%
支持 vLLM 连续批处理
在 Intel CPU 和 GPU 上进行 FastChat 服务
直接从 ModelScope 加载
支持初始 INT2 以在 16GB VRAM GPU 上运行大型 LLM
与 Text-Generation-WebUI 集成
BigDL LLM入门
通过 pip 安装 BigDL-LLM:CPU 请使用 `pip install --pre --upgrade bigdl-llm[all]`,GPU 请使用 `bigdl-llm[xpu]`。
使用 `AutoModelForCausalLM.from_pretrained` 加载经过 INT4 优化的 Hugging Face Transformers 模型。
通过指定模型路径在 Intel CPU 上运行优化后的模型。
通过将模型和输入张量移动到 'xpu' 设备,在 Intel GPU 上运行优化后的模型。
为 LoRA、QLoRA、DPO、QA-LoRA 或 ReLoRA 配置微调参数。
利用 FastChat 或 vLLM 为优化的 LLM 提供服务。
与 LangChain 集成以进行 LLM 应用开发。
BigDL LLM的使用案例
- 低延迟 LLM 推理
- LLM 微调
- 高效模型部署
- AI 应用开发
- 有限 VRAM 上的大型模型训练
- 加速文本生成





