Descripción
Intel® Neural Compressor es una potente biblioteca Python de código abierto diseñada para mejorar el rendimiento de los modelos de aprendizaje profundo a través de diversas técnicas de compresión. Se integra perfectamente con frameworks populares como PyTorch, TensorFlow y JAX, lo que la convierte en una herramienta versátil para desarrolladores e investigadores.
La biblioteca proporciona un conjunto completo de métodos de compresión de modelos, que incluyen Cuantización Estática, Cuantización Dinámica, SmoothQuant, Cuantización Solo de Pesos, Entrenamiento Consciente de Cuantización y Precisión Mixta. Una capacidad clave es su soporte para la cuantización avanzada de Modelos de Lenguaje Grandes (LLMs) y Modelos de Visión-Lenguaje (VLMs) como LLaMA, Qwen y DeepSeek, aprovechando la integración con AutoRound para tipos de datos de baja precisión optimizados.
Intel® Neural Compressor está diseñado para una amplia compatibilidad de hardware. Ofrece pruebas y soporte extensos para una amplia gama de hardware de Intel, incluidos los aceleradores de IA Intel Gaudi, los procesadores Intel Core Ultra, los procesadores escalables Intel Xeon, la serie Intel Xeon CPU Max y las GPU Intel Data Center GPU Flex Series y la serie Intel Data Center GPU Max. Además, proporciona soporte de pruebas limitado para CPUs AMD, CPUs ARM y GPUs NVIDIA.
La documentación de la biblioteca detalla los procedimientos de instalación para diferentes frameworks y hardware. Los usuarios pueden instalar Neural Compressor con dependencias de framework específicas a través de pip, como `neural-compressor-pt` para PyTorch o `neural-compressor-tf` para TensorFlow. Para JAX, está disponible un método de instalación de compilación desde el código fuente. La documentación también incluye guías de inicio rápido con código de ejemplo para técnicas como la cuantización FP8 en aceleradores de IA Intel Gaudi2 y la carga de LLMs solo con pesos.
Las actualizaciones recientes destacan el soporte experimental para la cuantización FP8 en Keras/JAX, la cuantización estática de caché KV/Atención FP8 con AutoRound, y la cuantización NVFP4/MXFP4. El proyecto fomenta activamente las contribuciones y colaboraciones, con directrices claras para informes de errores, solicitudes de características e ideas de investigación a través de GitHub Issues y correo electrónico.
Características principales de Intel® Neural Compressor
Soporta los frameworks PyTorch, TensorFlow y JAX
Ofrece Cuantización Estática, Cuantización Dinámica, SmoothQuant, Cuantización Solo de Pesos
Permite Entrenamiento Consciente de Cuantización y Precisión Mixta
Cuantización avanzada para LLMs y VLMs (ej. LLaMA, Qwen)
Integración con AutoRound para tipos de datos de baja precisión optimizados
Soporte extenso para hardware Intel (Gaudi, Xeon, Core Ultra, GPUs de centro de datos)
Soporte limitado para CPU AMD, CPU ARM y GPU NVIDIA
Soporte experimental de cuantización FP8 para Keras/JAX
Soporte experimental de cuantización estática de caché KV/Atención FP8
Soporte experimental de cuantización NVFP4 y MXFP4
Carga de modelos de lenguaje grandes solo con pesos
Primeros pasos con Intel® Neural Compressor
Instalar dependencias del framework: Elija e instale los paquetes necesarios según su entorno de implementación (ej. `pip install neural-compressor-pt`).
Configurar la cuantización: Defina las configuraciones de cuantización, como FP8Config, para su modelo.
Preparar el modelo: Utilice la función `prepare` para integrar las configuraciones de cuantización en su modelo.
Convertir el modelo: Aplique la función `convert` para finalizar la compresión del modelo.
Desplegar y optimizar: Integre el modelo comprimido en su aplicación para mejorar el rendimiento de inferencia.
Casos de uso de Intel® Neural Compressor
- Cuantización de LLM
- Optimización de VLM
- Aceleración de Hardware
- Integración de Frameworks
- Ajuste de Rendimiento
- Entrenamiento de Precisión Mixta



