본문으로 건너뛰기
ToolPotion

BigDL LLM

BigDL-LLM은 노트북부터 클라우드 GPU까지 Intel XPU 하드웨어에서 대규모 언어 모델(LLM)을 실행하기 위한 오픈 소스 라이브러리입니다. 낮은 지연 시간 추론을 위한 INT4/FP4/INT8/FP8 양자화를 지원하며 PyTorch 모델에 대한 포괄적인 파인튜닝 기능을 제공합니다.

URL 방문

설명

BigDL 프로젝트, 특히 BigDL-LLM 구성 요소(현재 IPEX-LLM으로 전환 중)는 CPU 및 GPU를 포함한 다양한 Intel 하드웨어에서 대규모 언어 모델(LLM)의 성능을 최적화하도록 설계된 강력한 라이브러리입니다. INT4, FP4, INT8, FP8과 같은 고급 양자화 기술을 활용하여 사용자가 훨씬 낮은 지연 시간으로 LLM을 실행할 수 있도록 합니다. 이러한 최적화는 다양한 하드웨어 구성에서 복잡한 AI 모델을 효율적으로 배포하는 데 중요합니다.

lama.cpp, gptq, bitsandbytes, qlora와 같은 라이브러리의 기반 작업 위에 구축된 BigDL-LLM은 PyTorch 기반 LLM의 추론 및 파인튜닝 모두에 대한 강력한 프레임워크를 제공합니다. 최근 업데이트는 ModelScope에서 직접 모델 로딩, 제한된 VRAM으로 GPU에서 대규모 모델을 실행하기 위한 초기 INT2 지원, 그래픽 사용자 경험을 위한 Text-Generation-WebUI와의 통합을 포함한 확장된 기능을 강조합니다. 이 라이브러리는 또한 Intel GPU 및 CPU에서 추론 지연 시간을 실질적으로 가속화하는 Self-Speculative Decoding을 도입합니다.

모델 사용자 정의에 중점을 둔 개발자 및 연구원을 위해 BigDL-LLM은 LoRA, QLoRA, DPO, QA-LoRA, ReLoRA를 포함한 Intel GPU에서 다양한 파인튜닝 방법에 대한 포괄적인 지원을 제공합니다. 이를 통해 사전 학습된 모델을 특정 작업 및 데이터셋에 효율적으로 적용할 수 있습니다. 이 프로젝트는 여러 Intel GPU에서 LLaMA2-7B를 30분 이내에 학습하는 것과 같은 인상적인 파인튜닝 속도를 시연했습니다. 또한 GGUF, AWQ, GPTQ와 같은 인기 있는 모델 형식을 직접 로딩하고 연속 배치 처리를 위해 vLLM과 통합하며 서빙을 위해 FastChat과 통합합니다.

BigDL 생태계는 LLM을 넘어 분산 데이터 분석 및 AI(Orca), TensorFlow 및 PyTorch(Nano)의 투명한 가속, Spark에서의 딥러닝(DLlib), 시계열 분석(Chronos), 추천 시스템(Friesian), 보안 AI(PPML)를 위한 라이브러리를 포함합니다. BigDL-LLM은 다양한 AI 애플리케이션을 위한 유연하고 성능이 뛰어난 솔루션을 제공하며 Intel 하드웨어에서 LLM의 힘을 활용하려는 사람들에게 핵심 구성 요소입니다.

BigDL LLM의 핵심 기능

  • Intel XPU(CPU, GPU)에서 최적화된 LLM 추론

  • INT4, FP4, INT8, FP8 양자화 지원

  • PyTorch 모델을 위한 낮은 지연 시간 추론

  • llama.cpp, gptq, bitsandbytes, qlora 기반

  • GGUF, AWQ, GPTQ 모델 직접 로딩

  • Intel GPU에서 포괄적인 LLM 파인튜닝(LoRA, QLoRA, DPO, QA-LoRA, ReLoRA)

  • 약 30% 속도 향상을 위한 Self-Speculative Decoding

  • vLLM 연속 배치 처리 지원

  • Intel CPU 및 GPU에서 FastChat 서빙

  • ModelScope에서 직접 로딩

  • 16GB VRAM GPU에서 대규모 LLM을 위한 초기 INT2 지원

  • Text-Generation-WebUI 통합

BigDL LLM 시작하기

  1. pip를 통해 BigDL-LLM 설치: CPU의 경우 `pip install --pre --upgrade bigdl-llm[all]` 또는 GPU의 경우 `bigdl-llm[xpu]`.

  2. `AutoModelForCausalLM.from_pretrained`를 사용하여 INT4 최적화로 Hugging Face Transformers 모델 로드.

  3. 모델 경로를 지정하여 Intel CPU에서 최적화된 모델 실행.

  4. 모델 및 입력 텐서를 'xpu' 장치로 이동하여 Intel GPU에서 최적화된 모델 실행.

  5. LoRA, QLoRA, DPO, QA-LoRA 또는 ReLoRA에 대한 파인튜닝 매개변수 구성.

  6. 최적화된 LLM 서빙을 위해 FastChat 또는 vLLM 활용.

  7. LLM 애플리케이션 개발을 위해 LangChain과 통합.

BigDL LLM의 사용 사례

  • 낮은 지연 시간 LLM 추론
  • LLM 파인튜닝
  • 효율적인 모델 배포
  • AI 애플리케이션 개발
  • 제한된 VRAM에서의 대규모 모델 학습
  • 가속화된 텍스트 생성

BigDL LLM의 FAQ

BigDL LLM 리뷰

로딩 중...

BigDL LLM와(과) 비슷한 인기 AI 도구

LiteRT는 Google의 고성능 온디바이스 머신러닝 프레임워크로, GenAI 및 ML 모델을 엣지 플랫폼에 배포할 수 있습니다. TensorFlow Lite를 기반으로 효율적인 변환, 런타임 및 최적화를 제공하며, 수십억 개의 디바이스에서 낮은 지연 시간과 높은 개인 정보 보호를 지원합니다.

MLOps 및 모델 배포

AI 프레임워크

Intel® Neural Compressor는 PyTorch, TensorFlow 및 JAX를 위한 인기 있는 모델 압축 기법을 제공하는 오픈 소스 Python 라이브러리입니다. LLM 및 VLM에 대한 고급 양자화를 지원하며, 광범위한 테스트를 통해 다양한 Intel 하드웨어 및 기타 플랫폼에서 성능을 최적화합니다.

머신러닝 플랫폼

AI 앱

vLLM은 대형 언어 모델(LLM)을 위한 고처리량 및 메모리 효율적인 추론 및 서비스 엔진입니다. 이는 최첨단 성능을 통해 AI 모델의 빠른 배포를 가능하게 하여 다양한 산업의 사용자에게 LLM 서비스를 쉽고 빠르며 비용 효율적으로 제공합니다.

MLOps 및 모델 배포

AI 프레임워크

OpenVINO는 다양한 하드웨어에서 고성능 AI 솔루션을 배포하기 위한 오픈 소스 툴킷입니다. 개발자는 클라우드, AI PC 및 엣지 디바이스에서 효율적인 배포를 지원하며, 인기 있는 프레임워크의 생성형 및 기존 AI 모델 모두에 대한 추론을 변환, 최적화 및 실행할 수 있습니다.

MLOps 및 모델 배포

AI 플랫폼

개발자가 200개 이상의 최적화된 LLM 및 다중 모달 모델을 배포, 미세 조정 및 실행할 수 있는 AI 인프라 플랫폼으로, 하나의 OpenAI 호환 API를 통해 사용한 만큼만 지불하는 가격 모델을 제공합니다.

추천MLOps 및 모델 배포

vllm-project/vllm은 대형 언어 모델(LLM)을 위해 설계된 고속 및 메모리 효율적인 추론 및 서비스 엔진입니다. 성능을 최적화하면서 자원 사용을 최소화하여 AI 및 머신 러닝의 다양한 응용 프로그램에 적합합니다.

추천MLOps 및 모델 배포

Bento는 속도와 제어를 위해 설계된 추론 플랫폼으로, 모든 AI 모델을 어디든 배포할 수 있도록 지원합니다. 맞춤형 최적화, 효율적인 확장, 간소화된 운영을 AI 팀에 제공합니다. 배포에 대한 완전한 제어를 유지하면서 추론 인프라를 단순화하십시오.

추천MLOps 및 모델 배포

AI 프레임워크

ONNX Runtime는 훈련 및 추론을 최적화하는 크로스 플랫폼 가속화된 머신 러닝 프레임워크입니다. 다양한 프로그래밍 언어와 플랫폼을 지원하여 고급 AI 기능을 애플리케이션에 쉽게 통합할 수 있습니다.

추천머신러닝 플랫폼