Langsung ke konten utama
ToolPotion

Intel® Neural Compressor

Intel® Neural Compressor adalah pustaka Python open-source yang menawarkan teknik kompresi model populer untuk PyTorch, TensorFlow, dan JAX. Pustaka ini mendukung kuantisasi lanjutan untuk LLM dan VLM, mengoptimalkan kinerja di berbagai perangkat keras Intel dan platform lain dengan pengujian ekstensif.

Kunjungi URL

Deskripsi

Intel® Neural Compressor adalah pustaka Python open-source yang kuat yang dirancang untuk meningkatkan kinerja model deep learning melalui berbagai teknik kompresi. Pustaka ini terintegrasi secara mulus dengan kerangka kerja utama seperti PyTorch, TensorFlow, dan JAX, menjadikannya alat yang serbaguna bagi pengembang dan peneliti.

Pustaka ini menyediakan rangkaian lengkap metode kompresi model, termasuk Kuantisasi Statis, Kuantisasi Dinamis, SmoothQuant, Kuantisasi Hanya Bobot, Pelatihan Sadar Kuantisasi, dan Presisi Campuran. Kemampuan utama adalah dukungannya untuk kuantisasi lanjutan Model Bahasa Besar (LLM) dan Model Bahasa Visi (VLM) seperti LLaMA, Qwen, dan DeepSeek, memanfaatkan integrasi dengan AutoRound untuk tipe data presisi rendah yang dioptimalkan.

Intel® Neural Compressor direkayasa untuk kompatibilitas perangkat keras yang luas. Pustaka ini menawarkan pengujian dan dukungan ekstensif untuk berbagai perangkat keras Intel, termasuk Akselerator AI Intel Gaudi, Prosesor Intel Core Ultra, Prosesor Intel Xeon Skalabel, Seri Maksimum CPU Intel Xeon, Seri Fleksibel GPU Pusat Data Intel, dan Seri Maksimum GPU Pusat Data Intel. Selain itu, pustaka ini menyediakan dukungan pengujian terbatas untuk CPU AMD, CPU ARM, dan GPU NVIDIA.

Dokumentasi pustaka merinci prosedur instalasi untuk kerangka kerja dan perangkat keras yang berbeda. Pengguna dapat menginstal Neural Compressor dengan dependensi kerangka kerja tertentu melalui pip, seperti `neural-compressor-pt` untuk PyTorch atau `neural-compressor-tf` untuk TensorFlow. Untuk JAX, metode instalasi build-from-source tersedia. Dokumentasi juga mencakup panduan memulai dengan contoh kode untuk teknik seperti Kuantisasi FP8 pada Akselerator AI Intel Gaudi2 dan pemuatan LLM hanya bobot.

Pembaruan terbaru menyoroti dukungan eksperimental untuk kuantisasi FP8 di Keras/JAX, kuantisasi statis FP8 KV cache/Attention dengan AutoRound, dan kuantisasi NVFP4/MXFP4. Proyek ini secara aktif mendorong kontribusi dan kolaborasi, dengan panduan yang jelas untuk laporan bug, permintaan fitur, dan ide penelitian melalui Isu GitHub dan email.

Fitur Inti Intel® Neural Compressor

  • Mendukung kerangka kerja PyTorch, TensorFlow, dan JAX

  • Menawarkan Kuantisasi Statis, Kuantisasi Dinamis, SmoothQuant, Kuantisasi Hanya Bobot

  • Memungkinkan Pelatihan Sadar Kuantisasi dan Presisi Campuran

  • Kuantisasi lanjutan untuk LLM dan VLM (misalnya, LLaMA, Qwen)

  • Integrasi dengan AutoRound untuk tipe data presisi rendah yang dioptimalkan

  • Dukungan ekstensif untuk perangkat keras Intel (Gaudi, Xeon, Core Ultra, GPU Pusat Data)

  • Dukungan terbatas untuk CPU AMD, CPU ARM, dan GPU NVIDIA

  • Dukungan kuantisasi FP8 eksperimental untuk Keras/JAX

  • Kuantisasi statis FP8 KV cache/Attention eksperimental

  • Dukungan kuantisasi NVFP4 dan MXFP4 eksperimental

  • Pemuatan model bahasa besar hanya bobot

Memulai dengan Intel® Neural Compressor

  1. Instal dependensi kerangka kerja: Pilih dan instal paket yang diperlukan berdasarkan lingkungan penerapan Anda (misalnya, `pip install neural-compressor-pt`).

  2. Konfigurasi kuantisasi: Tentukan konfigurasi kuantisasi, seperti FP8Config, untuk model Anda.

  3. Siapkan model: Gunakan fungsi `prepare` untuk mengintegrasikan konfigurasi kuantisasi ke dalam model Anda.

  4. Konversi model: Terapkan fungsi `convert` untuk menyelesaikan kompresi model.

  5. Terapkan dan optimalkan: Integrasikan model yang terkompresi ke dalam aplikasi Anda untuk kinerja inferensi yang lebih baik.

Kasus Penggunaan Intel® Neural Compressor

  • Kuantisasi LLM
  • Optimasi VLM
  • Akselerasi Perangkat Keras
  • Integrasi Kerangka Kerja
  • Penyetelan Kinerja
  • Pelatihan Presisi Campuran

FAQ dari Intel® Neural Compressor

Ulasan Intel® Neural Compressor

Memuat...

Alat AI Populer Seperti Intel® Neural Compressor

Framework AI

Ludwig adalah framework deep learning open-source, low-code. Ini memungkinkan pengguna untuk membangun, menyempurnakan (fine-tune), dan menerapkan model AI untuk berbagai jenis…

Platform Machine Learning

Framework AI

fastai adalah pustaka deep learning yang dirancang untuk praktisi dan peneliti. Pustaka ini menawarkan komponen tingkat tinggi untuk pengembangan cepat hasil mutakhir dan komponen…

UnggulanPlatform Machine Learning

Framework AI

DeepSpeed adalah pustaka optimasi deep learning yang dirancang untuk menyederhanakan dan meningkatkan efisiensi pelatihan terdistribusi untuk model AI. Pustaka ini berfokus pada…

Platform Machine Learning

Framework AI

BigDL-LLM adalah pustaka sumber terbuka untuk menjalankan model bahasa besar (LLM) pada perangkat keras Intel XPU, dari laptop hingga GPU cloud. Pustaka ini mendukung kuantisasi…

MLOps & Penerapan Model

Eclipse Deeplearning4j adalah framework deep learning terdistribusi open-source untuk JVM. Ia menawarkan ekosistem komprehensif untuk membangun, melatih, dan menerapkan jaringan…

Platform Machine Learning

DeepSpeed adalah pustaka optimisasi pembelajaran mendalam yang dirancang untuk menyederhanakan pelatihan terdistribusi. Ini meningkatkan efisiensi dan efektivitas, memungkinkan…

UnggulanPlatform Machine Learning

TensorFlow adalah framework open-source yang dirancang untuk machine learning, memungkinkan pemula dan pakar untuk membangun dan menerapkan model di berbagai platform termasuk…

Platform Machine Learning