Beschreibung
Intel® Neural Compressor ist eine leistungsstarke Open-Source-Python-Bibliothek, die darauf ausgelegt ist, die Leistung von Deep-Learning-Modellen durch verschiedene Komprimierungstechniken zu verbessern. Sie lässt sich nahtlos in Mainstream-Frameworks wie PyTorch, TensorFlow und JAX integrieren und ist somit ein vielseitiges Werkzeug für Entwickler und Forscher.
Die Bibliothek bietet eine umfassende Suite von Methoden zur Modellkomprimierung, darunter statische Quantisierung, dynamische Quantisierung, SmoothQuant, Weight-Only-Quantisierung, Quantization-Aware Training und Mixed Precision. Eine Kernfunktion ist die Unterstützung für fortschrittliche Quantisierung von Large Language Models (LLMs) und Vision-Language Models (VLMs) wie LLaMA, Qwen und DeepSeek, die sich die Integration mit AutoRound für optimierte Low-Precision-Datentypen zunutze macht.
Intel® Neural Compressor ist für breite Hardwarekompatibilität konzipiert. Es bietet umfangreiche Tests und Unterstützung für eine Vielzahl von Intel-Hardware, darunter Intel Gaudi AI Accelerators, Intel Core Ultra Prozessoren, Intel Xeon Scalable Prozessoren, Intel Xeon CPU Max Series, Intel Data Center GPU Flex Series und Intel Data Center GPU Max Series. Darüber hinaus bietet es eingeschränkte Testunterstützung für AMD CPUs, ARM CPUs und NVIDIA GPUs.
Die Dokumentation der Bibliothek beschreibt Installationsverfahren für verschiedene Frameworks und Hardware. Benutzer können den Neural Compressor mit spezifischen Framework-Abhängigkeiten über pip installieren, z. B. `neural-compressor-pt` für PyTorch oder `neural-compressor-tf` für TensorFlow. Für JAX ist eine Installation durch Kompilierung aus dem Quellcode verfügbar. Die Dokumentation enthält auch Anleitungen für den Einstieg mit Beispielcode für Techniken wie FP8-Quantisierung auf Intel Gaudi2 AI Accelerators und das Laden von LLMs nur mit Gewichten.
Aktuelle Updates heben experimentelle Unterstützung für FP8-Quantisierung in Keras/JAX, FP8 KV-Cache/Attention-statische Quantisierung mit AutoRound sowie NVFP4/MXFP4-Quantisierung hervor. Das Projekt fördert aktiv Beiträge und Kooperationen mit klaren Richtlinien für Fehlerberichte, Funktionsanfragen und Forschungsinitiativen über GitHub Issues und E-Mail.
Intel® Neural Compressor's Kernfunktionen
Unterstützt PyTorch, TensorFlow und JAX Frameworks
Bietet statische Quantisierung, dynamische Quantisierung, SmoothQuant, Weight-Only-Quantisierung
Ermöglicht Quantization-Aware Training und Mixed Precision
Fortschrittliche Quantisierung für LLMs und VLMs (z. B. LLaMA, Qwen)
Integration mit AutoRound für optimierte Low-Precision-Datentypen
Umfangreiche Unterstützung für Intel-Hardware (Gaudi, Xeon, Core Ultra, Data Center GPUs)
Eingeschränkte Unterstützung für AMD CPU, ARM CPU und NVIDIA GPU
Experimentelle FP8-Quantisierungsunterstützung für Keras/JAX
Experimentelle FP8 KV-Cache/Attention-statische Quantisierung
Experimentelle NVFP4- und MXFP4-Quantisierungsunterstützung
Laden von Large Language Models nur mit Gewichten
Erste Schritte mit Intel® Neural Compressor
Framework-Abhängigkeiten installieren: Wählen und installieren Sie die erforderlichen Pakete basierend auf Ihrer Bereitstellungsumgebung (z. B. `pip install neural-compressor-pt`).
Quantisierung konfigurieren: Definieren Sie Quantisierungskonfigurationen, wie z. B. FP8Config, für Ihr Modell.
Modell vorbereiten: Verwenden Sie die Funktion `prepare`, um Quantisierungskonfigurationen in Ihr Modell zu integrieren.
Modell konvertieren: Wenden Sie die Funktion `convert` an, um die Modellkomprimierung abzuschließen.
Bereitstellen und optimieren: Integrieren Sie das komprimierte Modell in Ihre Anwendung, um die Inferenzleistung zu verbessern.
Intel® Neural Compressor's Anwendungsfälle
- LLM-Quantisierung
- VLM-Optimierung
- Hardwarebeschleunigung
- Framework-Integration
- Leistungsoptimierung
- Mixed-Precision-Training



