Deskripsi
Intel® Neural Compressor adalah pustaka Python open-source yang kuat yang dirancang untuk meningkatkan kinerja model deep learning melalui berbagai teknik kompresi. Pustaka ini terintegrasi secara mulus dengan kerangka kerja utama seperti PyTorch, TensorFlow, dan JAX, menjadikannya alat yang serbaguna bagi pengembang dan peneliti.
Pustaka ini menyediakan rangkaian lengkap metode kompresi model, termasuk Kuantisasi Statis, Kuantisasi Dinamis, SmoothQuant, Kuantisasi Hanya Bobot, Pelatihan Sadar Kuantisasi, dan Presisi Campuran. Kemampuan utama adalah dukungannya untuk kuantisasi lanjutan Model Bahasa Besar (LLM) dan Model Bahasa Visi (VLM) seperti LLaMA, Qwen, dan DeepSeek, memanfaatkan integrasi dengan AutoRound untuk tipe data presisi rendah yang dioptimalkan.
Intel® Neural Compressor direkayasa untuk kompatibilitas perangkat keras yang luas. Pustaka ini menawarkan pengujian dan dukungan ekstensif untuk berbagai perangkat keras Intel, termasuk Akselerator AI Intel Gaudi, Prosesor Intel Core Ultra, Prosesor Intel Xeon Skalabel, Seri Maksimum CPU Intel Xeon, Seri Fleksibel GPU Pusat Data Intel, dan Seri Maksimum GPU Pusat Data Intel. Selain itu, pustaka ini menyediakan dukungan pengujian terbatas untuk CPU AMD, CPU ARM, dan GPU NVIDIA.
Dokumentasi pustaka merinci prosedur instalasi untuk kerangka kerja dan perangkat keras yang berbeda. Pengguna dapat menginstal Neural Compressor dengan dependensi kerangka kerja tertentu melalui pip, seperti `neural-compressor-pt` untuk PyTorch atau `neural-compressor-tf` untuk TensorFlow. Untuk JAX, metode instalasi build-from-source tersedia. Dokumentasi juga mencakup panduan memulai dengan contoh kode untuk teknik seperti Kuantisasi FP8 pada Akselerator AI Intel Gaudi2 dan pemuatan LLM hanya bobot.
Pembaruan terbaru menyoroti dukungan eksperimental untuk kuantisasi FP8 di Keras/JAX, kuantisasi statis FP8 KV cache/Attention dengan AutoRound, dan kuantisasi NVFP4/MXFP4. Proyek ini secara aktif mendorong kontribusi dan kolaborasi, dengan panduan yang jelas untuk laporan bug, permintaan fitur, dan ide penelitian melalui Isu GitHub dan email.
Fitur Inti Intel® Neural Compressor
Mendukung kerangka kerja PyTorch, TensorFlow, dan JAX
Menawarkan Kuantisasi Statis, Kuantisasi Dinamis, SmoothQuant, Kuantisasi Hanya Bobot
Memungkinkan Pelatihan Sadar Kuantisasi dan Presisi Campuran
Kuantisasi lanjutan untuk LLM dan VLM (misalnya, LLaMA, Qwen)
Integrasi dengan AutoRound untuk tipe data presisi rendah yang dioptimalkan
Dukungan ekstensif untuk perangkat keras Intel (Gaudi, Xeon, Core Ultra, GPU Pusat Data)
Dukungan terbatas untuk CPU AMD, CPU ARM, dan GPU NVIDIA
Dukungan kuantisasi FP8 eksperimental untuk Keras/JAX
Kuantisasi statis FP8 KV cache/Attention eksperimental
Dukungan kuantisasi NVFP4 dan MXFP4 eksperimental
Pemuatan model bahasa besar hanya bobot
Memulai dengan Intel® Neural Compressor
Instal dependensi kerangka kerja: Pilih dan instal paket yang diperlukan berdasarkan lingkungan penerapan Anda (misalnya, `pip install neural-compressor-pt`).
Konfigurasi kuantisasi: Tentukan konfigurasi kuantisasi, seperti FP8Config, untuk model Anda.
Siapkan model: Gunakan fungsi `prepare` untuk mengintegrasikan konfigurasi kuantisasi ke dalam model Anda.
Konversi model: Terapkan fungsi `convert` untuk menyelesaikan kompresi model.
Terapkan dan optimalkan: Integrasikan model yang terkompresi ke dalam aplikasi Anda untuk kinerja inferensi yang lebih baik.
Kasus Penggunaan Intel® Neural Compressor
- Kuantisasi LLM
- Optimasi VLM
- Akselerasi Perangkat Keras
- Integrasi Kerangka Kerja
- Penyetelan Kinerja
- Pelatihan Presisi Campuran



