Descrição
Intel® Neural Compressor é uma poderosa biblioteca Python de código aberto projetada para aprimorar o desempenho de modelos de deep learning através de várias técnicas de compressão. Ela se integra perfeitamente com frameworks populares como PyTorch, TensorFlow e JAX, tornando-a uma ferramenta versátil para desenvolvedores e pesquisadores.
A biblioteca oferece um conjunto abrangente de métodos de compressão de modelos, incluindo Quantização Estática, Quantização Dinâmica, SmoothQuant, Quantização Apenas de Pesos, Treinamento Ciente de Quantização e Precisão Mista. Uma capacidade chave é o seu suporte para quantização avançada de Modelos de Linguagem Grandes (LLMs) e Modelos Visão-Linguagem (VLMs) como LLaMA, Qwen e DeepSeek, aproveitando a integração com AutoRound para tipos de dados de baixa precisão otimizados.
Intel® Neural Compressor é projetado para ampla compatibilidade de hardware. Ele oferece testes extensivos e suporte para uma vasta gama de hardwares Intel, incluindo Aceleradores de IA Intel Gaudi, Processadores Intel Core Ultra, Processadores Escaláveis Intel Xeon, Série Máxima de CPUs Intel Xeon, Série Flex de GPUs de Data Center Intel e Série Máxima de GPUs de Data Center Intel. Adicionalmente, fornece suporte de teste limitado para CPUs AMD, CPUs ARM e GPUs NVIDIA.
A documentação da biblioteca detalha os procedimentos de instalação para diferentes frameworks e hardwares. Os usuários podem instalar o Neural Compressor com dependências de framework específicas via pip, como `neural-compressor-pt` para PyTorch ou `neural-compressor-tf` para TensorFlow. Para JAX, um método de instalação de compilação a partir do código-fonte está disponível. A documentação também inclui guias de início rápido com exemplos de código para técnicas como Quantização FP8 em Aceleradores de IA Intel Gaudi2 e carregamento de LLM apenas com pesos.
Atualizações recentes destacam o suporte experimental para quantização FP8 em Keras/JAX, quantização estática de cache KV/Atenção FP8 com AutoRound, e quantização NVFP4/MXFP4. O projeto incentiva ativamente contribuições e colaborações, com diretrizes claras para relatórios de bugs, solicitações de recursos e ideias de pesquisa via GitHub Issues e e-mail.
Recursos principais de Intel® Neural Compressor
Suporta frameworks PyTorch, TensorFlow e JAX
Oferece Quantização Estática, Quantização Dinâmica, SmoothQuant, Quantização Apenas de Pesos
Permite Treinamento Ciente de Quantização e Precisão Mista
Quantização avançada para LLMs e VLMs (ex: LLaMA, Qwen)
Integração com AutoRound para tipos de dados de baixa precisão otimizados
Suporte extensivo para hardware Intel (Gaudi, Xeon, Core Ultra, GPUs de Data Center)
Suporte limitado para CPU AMD, CPU ARM e GPU NVIDIA
Suporte experimental para quantização FP8 para Keras/JAX
Suporte experimental para quantização estática de cache KV/Atenção FP8
Suporte experimental para quantização NVFP4 e MXFP4
Carregamento de modelo de linguagem grande apenas com pesos
Primeiros passos com Intel® Neural Compressor
Instalar dependências do framework: Escolha e instale os pacotes necessários com base no seu ambiente de implantação (ex: `pip install neural-compressor-pt`).
Configurar quantização: Defina configurações de quantização, como FP8Config, para o seu modelo.
Preparar modelo: Use a função `prepare` para integrar as configurações de quantização ao seu modelo.
Converter modelo: Aplique a função `convert` para finalizar a compressão do modelo.
Implantar e otimizar: Integre o modelo comprimido à sua aplicação para melhorar o desempenho de inferência.
Casos de uso de Intel® Neural Compressor
- Quantização de LLM
- Otimização de VLM
- Aceleração de Hardware
- Integração de Framework
- Ajuste de Desempenho
- Treinamento de Precisão Mista



