Saltar al contenido principal
ToolPotion

Intel® Neural Compressor

Intel® Neural Compressor es una biblioteca Python de código abierto que ofrece técnicas populares de compresión de modelos para PyTorch, TensorFlow y JAX. Admite cuantización avanzada para LLMs y VLMs, optimizando el rendimiento en varios hardwares de Intel y otras plataformas con pruebas exhaustivas.

Visitar URL

Descripción

Intel® Neural Compressor es una potente biblioteca Python de código abierto diseñada para mejorar el rendimiento de los modelos de aprendizaje profundo a través de diversas técnicas de compresión. Se integra perfectamente con frameworks populares como PyTorch, TensorFlow y JAX, lo que la convierte en una herramienta versátil para desarrolladores e investigadores.

La biblioteca proporciona un conjunto completo de métodos de compresión de modelos, que incluyen Cuantización Estática, Cuantización Dinámica, SmoothQuant, Cuantización Solo de Pesos, Entrenamiento Consciente de Cuantización y Precisión Mixta. Una capacidad clave es su soporte para la cuantización avanzada de Modelos de Lenguaje Grandes (LLMs) y Modelos de Visión-Lenguaje (VLMs) como LLaMA, Qwen y DeepSeek, aprovechando la integración con AutoRound para tipos de datos de baja precisión optimizados.

Intel® Neural Compressor está diseñado para una amplia compatibilidad de hardware. Ofrece pruebas y soporte extensos para una amplia gama de hardware de Intel, incluidos los aceleradores de IA Intel Gaudi, los procesadores Intel Core Ultra, los procesadores escalables Intel Xeon, la serie Intel Xeon CPU Max y las GPU Intel Data Center GPU Flex Series y la serie Intel Data Center GPU Max. Además, proporciona soporte de pruebas limitado para CPUs AMD, CPUs ARM y GPUs NVIDIA.

La documentación de la biblioteca detalla los procedimientos de instalación para diferentes frameworks y hardware. Los usuarios pueden instalar Neural Compressor con dependencias de framework específicas a través de pip, como `neural-compressor-pt` para PyTorch o `neural-compressor-tf` para TensorFlow. Para JAX, está disponible un método de instalación de compilación desde el código fuente. La documentación también incluye guías de inicio rápido con código de ejemplo para técnicas como la cuantización FP8 en aceleradores de IA Intel Gaudi2 y la carga de LLMs solo con pesos.

Las actualizaciones recientes destacan el soporte experimental para la cuantización FP8 en Keras/JAX, la cuantización estática de caché KV/Atención FP8 con AutoRound, y la cuantización NVFP4/MXFP4. El proyecto fomenta activamente las contribuciones y colaboraciones, con directrices claras para informes de errores, solicitudes de características e ideas de investigación a través de GitHub Issues y correo electrónico.

Características principales de Intel® Neural Compressor

  • Soporta los frameworks PyTorch, TensorFlow y JAX

  • Ofrece Cuantización Estática, Cuantización Dinámica, SmoothQuant, Cuantización Solo de Pesos

  • Permite Entrenamiento Consciente de Cuantización y Precisión Mixta

  • Cuantización avanzada para LLMs y VLMs (ej. LLaMA, Qwen)

  • Integración con AutoRound para tipos de datos de baja precisión optimizados

  • Soporte extenso para hardware Intel (Gaudi, Xeon, Core Ultra, GPUs de centro de datos)

  • Soporte limitado para CPU AMD, CPU ARM y GPU NVIDIA

  • Soporte experimental de cuantización FP8 para Keras/JAX

  • Soporte experimental de cuantización estática de caché KV/Atención FP8

  • Soporte experimental de cuantización NVFP4 y MXFP4

  • Carga de modelos de lenguaje grandes solo con pesos

Primeros pasos con Intel® Neural Compressor

  1. Instalar dependencias del framework: Elija e instale los paquetes necesarios según su entorno de implementación (ej. `pip install neural-compressor-pt`).

  2. Configurar la cuantización: Defina las configuraciones de cuantización, como FP8Config, para su modelo.

  3. Preparar el modelo: Utilice la función `prepare` para integrar las configuraciones de cuantización en su modelo.

  4. Convertir el modelo: Aplique la función `convert` para finalizar la compresión del modelo.

  5. Desplegar y optimizar: Integre el modelo comprimido en su aplicación para mejorar el rendimiento de inferencia.

Casos de uso de Intel® Neural Compressor

  • Cuantización de LLM
  • Optimización de VLM
  • Aceleración de Hardware
  • Integración de Frameworks
  • Ajuste de Rendimiento
  • Entrenamiento de Precisión Mixta

Preguntas frecuentes de Intel® Neural Compressor

Reseñas de Intel® Neural Compressor

Cargando...

Herramientas de IA populares como Intel® Neural Compressor

Frameworks de IA

Ludwig es un framework de deep learning open-source y low-code. Permite a los usuarios construir, ajustar y desplegar modelos de IA para diversos tipos de datos, incluyendo texto,…

Plataformas de aprendizaje automático

Frameworks de IA

fastai es una biblioteca de aprendizaje profundo diseñada para profesionales e investigadores. Ofrece componentes de alto nivel para el desarrollo rápido de resultados de…

DestacadaPlataformas de aprendizaje automático

Frameworks de IA

DeepSpeed es una biblioteca de optimización de aprendizaje profundo diseñada para simplificar y mejorar la eficiencia del entrenamiento distribuido para modelos de IA. Se enfoca…

Plataformas de aprendizaje automático

Frameworks de IA

BigDL-LLM es una biblioteca de código abierto para ejecutar modelos de lenguaje grandes (LLM) en hardware Intel XPU, desde portátiles hasta GPUs en la nube. Soporta cuantización…

MLOps y despliegue de modelos

Frameworks de IA

Eclipse Deeplearning4j es un framework de deep learning distribuido y de código abierto para la JVM. Ofrece un ecosistema completo para construir, entrenar y desplegar redes…

Plataformas de aprendizaje automático

Frameworks de IA

DeepSpeed es una biblioteca de optimización de aprendizaje profundo diseñada para simplificar el entrenamiento distribuido. Mejora la eficiencia y efectividad, permitiendo el…

DestacadaPlataformas de aprendizaje automático

tinygrad es un marco de red neuronal sencillo diseñado para el aprendizaje profundo. Simplifica redes complejas en tres tipos de operaciones, haciéndolo accesible para…

DestacadaPlataformas de aprendizaje automático

TensorFlow es un framework de código abierto diseñado para el aprendizaje automático, que permite a principiantes y expertos crear y desplegar modelos en diversas plataformas,…

Plataformas de aprendizaje automático