설명
BigDL 프로젝트, 특히 BigDL-LLM 구성 요소(현재 IPEX-LLM으로 전환 중)는 CPU 및 GPU를 포함한 다양한 Intel 하드웨어에서 대규모 언어 모델(LLM)의 성능을 최적화하도록 설계된 강력한 라이브러리입니다. INT4, FP4, INT8, FP8과 같은 고급 양자화 기술을 활용하여 사용자가 훨씬 낮은 지연 시간으로 LLM을 실행할 수 있도록 합니다. 이러한 최적화는 다양한 하드웨어 구성에서 복잡한 AI 모델을 효율적으로 배포하는 데 중요합니다.
lama.cpp, gptq, bitsandbytes, qlora와 같은 라이브러리의 기반 작업 위에 구축된 BigDL-LLM은 PyTorch 기반 LLM의 추론 및 파인튜닝 모두에 대한 강력한 프레임워크를 제공합니다. 최근 업데이트는 ModelScope에서 직접 모델 로딩, 제한된 VRAM으로 GPU에서 대규모 모델을 실행하기 위한 초기 INT2 지원, 그래픽 사용자 경험을 위한 Text-Generation-WebUI와의 통합을 포함한 확장된 기능을 강조합니다. 이 라이브러리는 또한 Intel GPU 및 CPU에서 추론 지연 시간을 실질적으로 가속화하는 Self-Speculative Decoding을 도입합니다.
모델 사용자 정의에 중점을 둔 개발자 및 연구원을 위해 BigDL-LLM은 LoRA, QLoRA, DPO, QA-LoRA, ReLoRA를 포함한 Intel GPU에서 다양한 파인튜닝 방법에 대한 포괄적인 지원을 제공합니다. 이를 통해 사전 학습된 모델을 특정 작업 및 데이터셋에 효율적으로 적용할 수 있습니다. 이 프로젝트는 여러 Intel GPU에서 LLaMA2-7B를 30분 이내에 학습하는 것과 같은 인상적인 파인튜닝 속도를 시연했습니다. 또한 GGUF, AWQ, GPTQ와 같은 인기 있는 모델 형식을 직접 로딩하고 연속 배치 처리를 위해 vLLM과 통합하며 서빙을 위해 FastChat과 통합합니다.
BigDL 생태계는 LLM을 넘어 분산 데이터 분석 및 AI(Orca), TensorFlow 및 PyTorch(Nano)의 투명한 가속, Spark에서의 딥러닝(DLlib), 시계열 분석(Chronos), 추천 시스템(Friesian), 보안 AI(PPML)를 위한 라이브러리를 포함합니다. BigDL-LLM은 다양한 AI 애플리케이션을 위한 유연하고 성능이 뛰어난 솔루션을 제공하며 Intel 하드웨어에서 LLM의 힘을 활용하려는 사람들에게 핵심 구성 요소입니다.
BigDL LLM의 핵심 기능
Intel XPU(CPU, GPU)에서 최적화된 LLM 추론
INT4, FP4, INT8, FP8 양자화 지원
PyTorch 모델을 위한 낮은 지연 시간 추론
llama.cpp, gptq, bitsandbytes, qlora 기반
GGUF, AWQ, GPTQ 모델 직접 로딩
Intel GPU에서 포괄적인 LLM 파인튜닝(LoRA, QLoRA, DPO, QA-LoRA, ReLoRA)
약 30% 속도 향상을 위한 Self-Speculative Decoding
vLLM 연속 배치 처리 지원
Intel CPU 및 GPU에서 FastChat 서빙
ModelScope에서 직접 로딩
16GB VRAM GPU에서 대규모 LLM을 위한 초기 INT2 지원
Text-Generation-WebUI 통합
BigDL LLM 시작하기
pip를 통해 BigDL-LLM 설치: CPU의 경우 `pip install --pre --upgrade bigdl-llm[all]` 또는 GPU의 경우 `bigdl-llm[xpu]`.
`AutoModelForCausalLM.from_pretrained`를 사용하여 INT4 최적화로 Hugging Face Transformers 모델 로드.
모델 경로를 지정하여 Intel CPU에서 최적화된 모델 실행.
모델 및 입력 텐서를 'xpu' 장치로 이동하여 Intel GPU에서 최적화된 모델 실행.
LoRA, QLoRA, DPO, QA-LoRA 또는 ReLoRA에 대한 파인튜닝 매개변수 구성.
최적화된 LLM 서빙을 위해 FastChat 또는 vLLM 활용.
LLM 애플리케이션 개발을 위해 LangChain과 통합.
BigDL LLM의 사용 사례
- 낮은 지연 시간 LLM 추론
- LLM 파인튜닝
- 효율적인 모델 배포
- AI 애플리케이션 개발
- 제한된 VRAM에서의 대규모 모델 학습
- 가속화된 텍스트 생성





