Pular para o conteúdo principal
ToolPotion

Intel® Neural Compressor

Intel® Neural Compressor é uma biblioteca Python de código aberto que oferece técnicas populares de compressão de modelos para PyTorch, TensorFlow e JAX. Ela suporta quantização avançada para LLMs e VLMs, otimizando o desempenho em diversos hardwares Intel e outras plataformas com testes extensivos.

Visitar URL

Descrição

Intel® Neural Compressor é uma poderosa biblioteca Python de código aberto projetada para aprimorar o desempenho de modelos de deep learning através de várias técnicas de compressão. Ela se integra perfeitamente com frameworks populares como PyTorch, TensorFlow e JAX, tornando-a uma ferramenta versátil para desenvolvedores e pesquisadores.

A biblioteca oferece um conjunto abrangente de métodos de compressão de modelos, incluindo Quantização Estática, Quantização Dinâmica, SmoothQuant, Quantização Apenas de Pesos, Treinamento Ciente de Quantização e Precisão Mista. Uma capacidade chave é o seu suporte para quantização avançada de Modelos de Linguagem Grandes (LLMs) e Modelos Visão-Linguagem (VLMs) como LLaMA, Qwen e DeepSeek, aproveitando a integração com AutoRound para tipos de dados de baixa precisão otimizados.

Intel® Neural Compressor é projetado para ampla compatibilidade de hardware. Ele oferece testes extensivos e suporte para uma vasta gama de hardwares Intel, incluindo Aceleradores de IA Intel Gaudi, Processadores Intel Core Ultra, Processadores Escaláveis Intel Xeon, Série Máxima de CPUs Intel Xeon, Série Flex de GPUs de Data Center Intel e Série Máxima de GPUs de Data Center Intel. Adicionalmente, fornece suporte de teste limitado para CPUs AMD, CPUs ARM e GPUs NVIDIA.

A documentação da biblioteca detalha os procedimentos de instalação para diferentes frameworks e hardwares. Os usuários podem instalar o Neural Compressor com dependências de framework específicas via pip, como `neural-compressor-pt` para PyTorch ou `neural-compressor-tf` para TensorFlow. Para JAX, um método de instalação de compilação a partir do código-fonte está disponível. A documentação também inclui guias de início rápido com exemplos de código para técnicas como Quantização FP8 em Aceleradores de IA Intel Gaudi2 e carregamento de LLM apenas com pesos.

Atualizações recentes destacam o suporte experimental para quantização FP8 em Keras/JAX, quantização estática de cache KV/Atenção FP8 com AutoRound, e quantização NVFP4/MXFP4. O projeto incentiva ativamente contribuições e colaborações, com diretrizes claras para relatórios de bugs, solicitações de recursos e ideias de pesquisa via GitHub Issues e e-mail.

Recursos principais de Intel® Neural Compressor

  • Suporta frameworks PyTorch, TensorFlow e JAX

  • Oferece Quantização Estática, Quantização Dinâmica, SmoothQuant, Quantização Apenas de Pesos

  • Permite Treinamento Ciente de Quantização e Precisão Mista

  • Quantização avançada para LLMs e VLMs (ex: LLaMA, Qwen)

  • Integração com AutoRound para tipos de dados de baixa precisão otimizados

  • Suporte extensivo para hardware Intel (Gaudi, Xeon, Core Ultra, GPUs de Data Center)

  • Suporte limitado para CPU AMD, CPU ARM e GPU NVIDIA

  • Suporte experimental para quantização FP8 para Keras/JAX

  • Suporte experimental para quantização estática de cache KV/Atenção FP8

  • Suporte experimental para quantização NVFP4 e MXFP4

  • Carregamento de modelo de linguagem grande apenas com pesos

Primeiros passos com Intel® Neural Compressor

  1. Instalar dependências do framework: Escolha e instale os pacotes necessários com base no seu ambiente de implantação (ex: `pip install neural-compressor-pt`).

  2. Configurar quantização: Defina configurações de quantização, como FP8Config, para o seu modelo.

  3. Preparar modelo: Use a função `prepare` para integrar as configurações de quantização ao seu modelo.

  4. Converter modelo: Aplique a função `convert` para finalizar a compressão do modelo.

  5. Implantar e otimizar: Integre o modelo comprimido à sua aplicação para melhorar o desempenho de inferência.

Casos de uso de Intel® Neural Compressor

  • Quantização de LLM
  • Otimização de VLM
  • Aceleração de Hardware
  • Integração de Framework
  • Ajuste de Desempenho
  • Treinamento de Precisão Mista

Perguntas frequentes de Intel® Neural Compressor

Avaliações de Intel® Neural Compressor

Carregando...

Ferramentas de IA populares como Intel® Neural Compressor

Frameworks de IA

Ludwig é um framework de deep learning open-source e low-code. Ele permite que os usuários construam, ajustem e implementem modelos de IA para diversos tipos de dados, incluindo…

Plataformas de machine learning

Frameworks de IA

fastai é uma biblioteca de deep learning projetada para praticantes e pesquisadores. Ela oferece componentes de alto nível para o desenvolvimento rápido de resultados de ponta e…

DestaquePlataformas de machine learning

Frameworks de IA

DeepSpeed é uma biblioteca de otimização de deep learning projetada para simplificar e aumentar a eficiência do treinamento distribuído para modelos de IA. Ela se concentra em…

Plataformas de machine learning

Frameworks de IA

BigDL-LLM é uma biblioteca de código aberto para executar modelos de linguagem grandes (LLMs) em hardware Intel XPU, de laptops a GPUs na nuvem. Ela suporta quantização…

MLOps e implantação de modelos

Frameworks de IA

Eclipse Deeplearning4j é um framework de deep learning distribuído e de código aberto para a JVM. Ele oferece um ecossistema abrangente para construir, treinar e implantar redes…

Plataformas de machine learning

DeepSpeed é uma biblioteca de otimização de aprendizado profundo projetada para simplificar o treinamento distribuído. Ela melhora a eficiência e a eficácia, permitindo o…

DestaquePlataformas de machine learning

tinygrad é um framework de rede neural direto projetado para aprendizado profundo. Ele simplifica redes complexas em três tipos de operação, tornando-o acessível para…

DestaquePlataformas de machine learning

TensorFlow é um framework de código aberto projetado para aprendizado de máquina, permitindo que iniciantes e especialistas criem e implementem modelos em várias plataformas,…

Plataformas de machine learning