メインコンテンツへスキップ
ToolPotion

Intel® Neural Compressor

Intel® Neural Compressorは、PyTorch、TensorFlow、JAX向けの一般的なモデル圧縮技術を提供するオープンソースのPythonライブラリです。LLMおよびVLM向けの高度な量子化をサポートし、広範なテストを通じて様々なIntelハードウェアおよびその他のプラットフォームでのパフォーマンスを最適化します。

URLを訪問

説明

Intel® Neural Compressorは、様々な圧縮技術を通じてディープラーニングモデルのパフォーマンスを向上させるために設計された強力なオープンソースPythonライブラリです。PyTorch、TensorFlow、JAXといった主要なフレームワークとシームレスに統合されており、開発者や研究者にとって汎用性の高いツールとなっています。

このライブラリは、静的量子化、動的量子化、SmoothQuant、重みのみ量子化、量子化認識トレーニング、混合精度など、包括的なモデル圧縮手法を提供します。主な機能として、LLaMA、Qwen、DeepSeekなどの大規模言語モデル(LLM)およびビジョン言語モデル(VLM)の高度な量子化をサポートしており、AutoRoundとの統合を活用して最適化された低精度データ型を実現します。

Intel® Neural Compressorは、幅広いハードウェア互換性に向けて設計されています。Intel Gaudi AIアクセラレータ、Intel Core Ultraプロセッサ、Intel Xeonスケーラブルプロセッサ、Intel Xeon CPU Maxシリーズ、Intel Data Center GPU Flexシリーズ、Intel Data Center GPU Maxシリーズなど、広範なIntelハードウェアに対する包括的なテストとサポートを提供します。さらに、AMD CPU、ARM CPU、NVIDIA GPUに対しても限定的なテストサポートを提供しています。

ライブラリのドキュメントには、異なるフレームワークおよびハードウェアのインストール手順が詳述されています。ユーザーは、pipを使用して、PyTorchの場合は`neural-compressor-pt`、TensorFlowの場合は`neural-compressor-tf`のように、特定のフレームワーク依存関係を持つNeural Compressorをインストールできます。JAXの場合、ソースからのビルドによるインストール方法が利用可能です。ドキュメントには、Intel Gaudi2 AIアクセラレータでのFP8量子化や重みのみLLMのロードなどの手法に関するサンプルコードを含む、開始ガイドも含まれています。

最近のアップデートでは、Keras/JAXでのFP8量子化、AutoRoundによるFP8 KVキャッシュ/Attention静的量子化、NVFP4/MXFP4量子化の実験的なサポートが強調されています。このプロジェクトは、GitHub Issuesやメールを通じてバグレポート、機能リクエスト、研究アイデアに関する明確なガイドラインを提供し、貢献と協力を積極的に奨励しています。

Intel® Neural Compressorの主要機能

  • PyTorch、TensorFlow、JAXフレームワークをサポート

  • 静的量子化、動的量子化、SmoothQuant、重みのみ量子化を提供

  • 量子化認識トレーニングと混合精度を可能にする

  • LLMおよびVLM(例:LLaMA、Qwen)向けの高度な量子化

  • 最適化された低精度データ型のためのAutoRoundとの統合

  • Intelハードウェア(Gaudi、Xeon、Core Ultra、データセンターGPU)の包括的なサポート

  • AMD CPU、ARM CPU、NVIDIA GPUの限定的なサポート

  • Keras/JAX向けの実験的なFP8量子化サポート

  • 実験的なFP8 KVキャッシュ/Attention静的量子化

  • 実験的なNVFP4およびMXFP4量子化サポート

  • 重みのみの大規模言語モデルのロード

Intel® Neural Compressorをはじめる

  1. フレームワーク依存関係のインストール: デプロイメント環境に基づいて必要なパッケージを選択してインストールします(例: `pip install neural-compressor-pt`)。

  2. 量子化の設定: モデルのFP8Configなどの量子化設定を定義します。

  3. モデルの準備: `prepare`関数を使用して、量子化設定をモデルに統合します。

  4. モデルの変換: `convert`関数を適用して、モデル圧縮を完了します。

  5. デプロイと最適化: 圧縮されたモデルをアプリケーションに統合し、推論パフォーマンスを向上させます。

Intel® Neural Compressorの使用例

  • LLM量子化
  • VLM最適化
  • ハードウェアアクセラレーション
  • フレームワーク統合
  • パフォーマンスチューニング
  • 混合精度トレーニング

Intel® Neural CompressorのFAQ

Intel® Neural Compressor のレビュー

読み込み中...

Intel® Neural Compressor に似た人気のAIツール

AI フレームワーク

Ludwigは、オープンソースのローコード深層学習フレームワークです。ユーザーは、カスタムコードを必要とせずに、シンプルなYAML設定ファイルを使用して、テキスト、画像、LLMなどの様々なデータタイプに対応するAIモデルを構築、ファインチューニング、デプロイできます。

機械学習プラットフォーム

AI フレームワーク

fastaiは、実務家および研究者向けに設計されたディープラーニングライブラリです。最先端の結果を迅速に開発するための高レベルコンポーネントと、新しいアプローチのための低レベルコンポーネントを提供します。レイヤードアーキテクチャとPythonのダイナミズムを通じて、使いやすさ、柔軟性、パフォーマンスを目指しています。

注目機械学習プラットフォーム

AI フレームワーク

DeepSpeedは、AIモデルの分散学習を簡素化し効率を高めるために設計された深層学習最適化ライブラリです。研究者や開発者が大規模モデルの学習にアクセスしやすく、効果的に行えるようにすることに重点を置いており、高度なAIソリューションの迅速な実験とデプロイを可能にします。

機械学習プラットフォーム

AI フレームワーク

BigDL-LLMは、ラップトップからクラウドGPUまで、Intel XPUハードウェア上で大規模言語モデル(LLM)を実行するためのオープンソースライブラリです。低遅延推論のためのINT4/FP4/INT8/FP8量子化をサポートし、PyTorchモデル向けの包括的なファインチューニング機能を提供します。

MLOps・モデルデプロイ

AI フレームワーク

Eclipse Deeplearning4jは、JVM向けのオープンソース分散ディープラーニングフレームワークです。JavaおよびScalaでのニューラルネットワークの構築、トレーニング、デプロイのための包括的なエコシステムを提供し、ネイティブGPUアクセラレーションと高性能CPU計算に対応しています。データロード、変換、モデルインポート用の様々なライブラリ…

機械学習プラットフォーム

AI フレームワーク

DeepSpeedは、分散トレーニングを簡素化するために設計された深層学習最適化ライブラリです。効率と効果を向上させ、ZeROや3D-Parallelismなどの高度な技術を用いて大規模モデルのトレーニングを可能にします。

注目機械学習プラットフォーム

tinygradは、深層学習のために設計されたシンプルなニューラルネットワークフレームワークです。複雑なネットワークを3つの操作タイプに簡素化し、効率的に機械学習ソリューションを実装しようとする開発者にとってアクセスしやすくしています。

注目機械学習プラットフォーム

AI フレームワーク

TensorFlowは、デスクトップ、モバイル、Web、クラウドなど、さまざまなプラットフォームでモデルを構築およびデプロイできるようにする、機械学習用のオープンソースフレームワークです。データ準備、モデル構築、トレーニング、デプロイのためのツールを提供し、エンドツーエンドのMLパイプラインをサポートします。

機械学習プラットフォーム