Zum Hauptinhalt springen
ToolPotion

Intel® Neural Compressor

Intel® Neural Compressor ist eine Open-Source-Python-Bibliothek, die beliebte Techniken zur Modellkomprimierung für PyTorch, TensorFlow und JAX bietet. Sie unterstützt fortschrittliche Quantisierung für LLMs und VLMs und optimiert die Leistung auf verschiedenen Intel-Hardwareplattformen und anderen Plattformen mit umfangreichen Tests.

URL besuchen

Beschreibung

Intel® Neural Compressor ist eine leistungsstarke Open-Source-Python-Bibliothek, die darauf ausgelegt ist, die Leistung von Deep-Learning-Modellen durch verschiedene Komprimierungstechniken zu verbessern. Sie lässt sich nahtlos in Mainstream-Frameworks wie PyTorch, TensorFlow und JAX integrieren und ist somit ein vielseitiges Werkzeug für Entwickler und Forscher.

Die Bibliothek bietet eine umfassende Suite von Methoden zur Modellkomprimierung, darunter statische Quantisierung, dynamische Quantisierung, SmoothQuant, Weight-Only-Quantisierung, Quantization-Aware Training und Mixed Precision. Eine Kernfunktion ist die Unterstützung für fortschrittliche Quantisierung von Large Language Models (LLMs) und Vision-Language Models (VLMs) wie LLaMA, Qwen und DeepSeek, die sich die Integration mit AutoRound für optimierte Low-Precision-Datentypen zunutze macht.

Intel® Neural Compressor ist für breite Hardwarekompatibilität konzipiert. Es bietet umfangreiche Tests und Unterstützung für eine Vielzahl von Intel-Hardware, darunter Intel Gaudi AI Accelerators, Intel Core Ultra Prozessoren, Intel Xeon Scalable Prozessoren, Intel Xeon CPU Max Series, Intel Data Center GPU Flex Series und Intel Data Center GPU Max Series. Darüber hinaus bietet es eingeschränkte Testunterstützung für AMD CPUs, ARM CPUs und NVIDIA GPUs.

Die Dokumentation der Bibliothek beschreibt Installationsverfahren für verschiedene Frameworks und Hardware. Benutzer können den Neural Compressor mit spezifischen Framework-Abhängigkeiten über pip installieren, z. B. `neural-compressor-pt` für PyTorch oder `neural-compressor-tf` für TensorFlow. Für JAX ist eine Installation durch Kompilierung aus dem Quellcode verfügbar. Die Dokumentation enthält auch Anleitungen für den Einstieg mit Beispielcode für Techniken wie FP8-Quantisierung auf Intel Gaudi2 AI Accelerators und das Laden von LLMs nur mit Gewichten.

Aktuelle Updates heben experimentelle Unterstützung für FP8-Quantisierung in Keras/JAX, FP8 KV-Cache/Attention-statische Quantisierung mit AutoRound sowie NVFP4/MXFP4-Quantisierung hervor. Das Projekt fördert aktiv Beiträge und Kooperationen mit klaren Richtlinien für Fehlerberichte, Funktionsanfragen und Forschungsinitiativen über GitHub Issues und E-Mail.

Intel® Neural Compressor's Kernfunktionen

  • Unterstützt PyTorch, TensorFlow und JAX Frameworks

  • Bietet statische Quantisierung, dynamische Quantisierung, SmoothQuant, Weight-Only-Quantisierung

  • Ermöglicht Quantization-Aware Training und Mixed Precision

  • Fortschrittliche Quantisierung für LLMs und VLMs (z. B. LLaMA, Qwen)

  • Integration mit AutoRound für optimierte Low-Precision-Datentypen

  • Umfangreiche Unterstützung für Intel-Hardware (Gaudi, Xeon, Core Ultra, Data Center GPUs)

  • Eingeschränkte Unterstützung für AMD CPU, ARM CPU und NVIDIA GPU

  • Experimentelle FP8-Quantisierungsunterstützung für Keras/JAX

  • Experimentelle FP8 KV-Cache/Attention-statische Quantisierung

  • Experimentelle NVFP4- und MXFP4-Quantisierungsunterstützung

  • Laden von Large Language Models nur mit Gewichten

Erste Schritte mit Intel® Neural Compressor

  1. Framework-Abhängigkeiten installieren: Wählen und installieren Sie die erforderlichen Pakete basierend auf Ihrer Bereitstellungsumgebung (z. B. `pip install neural-compressor-pt`).

  2. Quantisierung konfigurieren: Definieren Sie Quantisierungskonfigurationen, wie z. B. FP8Config, für Ihr Modell.

  3. Modell vorbereiten: Verwenden Sie die Funktion `prepare`, um Quantisierungskonfigurationen in Ihr Modell zu integrieren.

  4. Modell konvertieren: Wenden Sie die Funktion `convert` an, um die Modellkomprimierung abzuschließen.

  5. Bereitstellen und optimieren: Integrieren Sie das komprimierte Modell in Ihre Anwendung, um die Inferenzleistung zu verbessern.

Intel® Neural Compressor's Anwendungsfälle

  • LLM-Quantisierung
  • VLM-Optimierung
  • Hardwarebeschleunigung
  • Framework-Integration
  • Leistungsoptimierung
  • Mixed-Precision-Training

FAQ von Intel® Neural Compressor

Intel® Neural Compressor Bewertungen

Wird geladen...

Beliebte KI-Tools wie Intel® Neural Compressor

KI-Frameworks

Ludwig ist ein Open-Source-Deep-Learning-Framework mit geringem Codeaufwand. Es ermöglicht Benutzern, KI-Modelle für verschiedene Datentypen, einschließlich Text, Bilder und LLMs,…

Machine-Learning-Plattformen

KI-Frameworks

fastai ist eine Deep-Learning-Bibliothek, die für Praktiker und Forscher entwickelt wurde. Sie bietet High-Level-Komponenten für die schnelle Entwicklung von…

EmpfohlenMachine-Learning-Plattformen

KI-Frameworks

DeepSpeed ist eine Optimierungsbibliothek für Deep Learning, die entwickelt wurde, um das verteilte Training von KI-Modellen zu vereinfachen und dessen Effizienz zu steigern. Sie…

Machine-Learning-Plattformen

KI-Frameworks

BigDL-LLM ist eine Open-Source-Bibliothek zum Ausführen großer Sprachmodelle (LLMs) auf Intel XPU-Hardware, von Laptops bis hin zu Cloud-GPUs. Sie unterstützt…

MLOps & Modell-Deployment

Eclipse Deeplearning4j ist ein Open-Source, verteiltes Deep-Learning-Framework für die JVM. Es bietet ein umfassendes Ökosystem zum Erstellen, Trainieren und Bereitstellen von…

Machine-Learning-Plattformen

DeepSpeed ist eine Optimierungsbibliothek für Deep Learning, die entwickelt wurde, um das verteilte Training zu vereinfachen. Sie verbessert die Effizienz und Effektivität und…

EmpfohlenMachine-Learning-Plattformen

TensorFlow ist ein Open-Source-Framework für maschinelles Lernen, das es Anfängern und Experten ermöglicht, Modelle auf verschiedenen Plattformen wie Desktop, Mobilgeräten, Web…

Machine-Learning-Plattformen