説明
Intel® Neural Compressorは、様々な圧縮技術を通じてディープラーニングモデルのパフォーマンスを向上させるために設計された強力なオープンソースPythonライブラリです。PyTorch、TensorFlow、JAXといった主要なフレームワークとシームレスに統合されており、開発者や研究者にとって汎用性の高いツールとなっています。
このライブラリは、静的量子化、動的量子化、SmoothQuant、重みのみ量子化、量子化認識トレーニング、混合精度など、包括的なモデル圧縮手法を提供します。主な機能として、LLaMA、Qwen、DeepSeekなどの大規模言語モデル(LLM)およびビジョン言語モデル(VLM)の高度な量子化をサポートしており、AutoRoundとの統合を活用して最適化された低精度データ型を実現します。
Intel® Neural Compressorは、幅広いハードウェア互換性に向けて設計されています。Intel Gaudi AIアクセラレータ、Intel Core Ultraプロセッサ、Intel Xeonスケーラブルプロセッサ、Intel Xeon CPU Maxシリーズ、Intel Data Center GPU Flexシリーズ、Intel Data Center GPU Maxシリーズなど、広範なIntelハードウェアに対する包括的なテストとサポートを提供します。さらに、AMD CPU、ARM CPU、NVIDIA GPUに対しても限定的なテストサポートを提供しています。
ライブラリのドキュメントには、異なるフレームワークおよびハードウェアのインストール手順が詳述されています。ユーザーは、pipを使用して、PyTorchの場合は`neural-compressor-pt`、TensorFlowの場合は`neural-compressor-tf`のように、特定のフレームワーク依存関係を持つNeural Compressorをインストールできます。JAXの場合、ソースからのビルドによるインストール方法が利用可能です。ドキュメントには、Intel Gaudi2 AIアクセラレータでのFP8量子化や重みのみLLMのロードなどの手法に関するサンプルコードを含む、開始ガイドも含まれています。
最近のアップデートでは、Keras/JAXでのFP8量子化、AutoRoundによるFP8 KVキャッシュ/Attention静的量子化、NVFP4/MXFP4量子化の実験的なサポートが強調されています。このプロジェクトは、GitHub Issuesやメールを通じてバグレポート、機能リクエスト、研究アイデアに関する明確なガイドラインを提供し、貢献と協力を積極的に奨励しています。
Intel® Neural Compressorの主要機能
PyTorch、TensorFlow、JAXフレームワークをサポート
静的量子化、動的量子化、SmoothQuant、重みのみ量子化を提供
量子化認識トレーニングと混合精度を可能にする
LLMおよびVLM(例:LLaMA、Qwen)向けの高度な量子化
最適化された低精度データ型のためのAutoRoundとの統合
Intelハードウェア(Gaudi、Xeon、Core Ultra、データセンターGPU)の包括的なサポート
AMD CPU、ARM CPU、NVIDIA GPUの限定的なサポート
Keras/JAX向けの実験的なFP8量子化サポート
実験的なFP8 KVキャッシュ/Attention静的量子化
実験的なNVFP4およびMXFP4量子化サポート
重みのみの大規模言語モデルのロード
Intel® Neural Compressorをはじめる
フレームワーク依存関係のインストール: デプロイメント環境に基づいて必要なパッケージを選択してインストールします(例: `pip install neural-compressor-pt`)。
量子化の設定: モデルのFP8Configなどの量子化設定を定義します。
モデルの準備: `prepare`関数を使用して、量子化設定をモデルに統合します。
モデルの変換: `convert`関数を適用して、モデル圧縮を完了します。
デプロイと最適化: 圧縮されたモデルをアプリケーションに統合し、推論パフォーマンスを向上させます。
Intel® Neural Compressorの使用例
- LLM量子化
- VLM最適化
- ハードウェアアクセラレーション
- フレームワーク統合
- パフォーマンスチューニング
- 混合精度トレーニング



