الوصف
Intel® Neural Compressor هي مكتبة Python قوية مفتوحة المصدر مصممة لتعزيز أداء نماذج التعلم العميق من خلال تقنيات ضغط متنوعة. تتكامل بسلاسة مع الأطر الرئيسية مثل PyTorch و TensorFlow و JAX، مما يجعلها أداة متعددة الاستخدامات للمطورين والباحثين.
توفر المكتبة مجموعة شاملة من أساليب ضغط النماذج، بما في ذلك التكميم الثابت (Static Quantization)، والتكميم الديناميكي (Dynamic Quantization)، و SmoothQuant، والتكميم المعتمد على الأوزان فقط (Weight-Only Quantization)، والتدريب المدرك للتكميم (Quantization-Aware Training)، والدقة المختلطة (Mixed Precision). تتمثل إحدى القدرات الرئيسية في دعمها للتكميم المتقدم لنماذج اللغات الكبيرة (LLMs) ونماذج الرؤية واللغة (VLMs) مثل LLaMA و Qwen و DeepSeek، بالاستفادة من التكامل مع AutoRound لأنواع البيانات منخفضة الدقة المحسّنة.
تم تصميم Intel® Neural Compressor لتوافق واسع مع الأجهزة. تقدم اختبارات ودعمًا شاملاً لمجموعة واسعة من أجهزة Intel، بما في ذلك مسرعات Intel Gaudi AI، ومعالجات Intel Core Ultra، ومعالجات Intel Xeon Scalable، وسلسلة معالجات Intel Xeon CPU Max، وسلسلة وحدات معالجة الرسومات Intel Data Center GPU Flex، وسلسلة وحدات معالجة الرسومات Intel Data Center GPU Max. بالإضافة إلى ذلك، توفر دعمًا محدودًا للاختبار لوحدات المعالجة المركزية AMD، ووحدات المعالجة المركزية ARM، ووحدات معالجة الرسومات NVIDIA.
توثق وثائق المكتبة إجراءات التثبيت للأطر والأجهزة المختلفة. يمكن للمستخدمين تثبيت Neural Compressor مع تبعيات إطار عمل محددة عبر pip، مثل `neural-compressor-pt` لـ PyTorch أو `neural-compressor-tf` لـ TensorFlow. بالنسبة لـ JAX، يتوفر طريقة تثبيت البناء من المصدر. تتضمن الوثائق أيضًا أدلة البدء مع أمثلة تعليمات برمجية لتقنيات مثل تكميم FP8 على مسرعات Intel Gaudi2 AI وتحميل نماذج LLM المعتمدة على الأوزان فقط.
تسلط التحديثات الأخيرة الضوء على الدعم التجريبي لتكميم FP8 في Keras/JAX، وتكميم FP8 KV cache/Attention الثابت مع AutoRound، وتكميم NVFP4/MXFP4. يشجع المشروع بنشاط على المساهمات والتعاون، مع إرشادات واضحة لتقارير الأخطاء وطلبات الميزات وأفكار البحث عبر GitHub Issues والبريد الإلكتروني.
الميزات الأساسية لـ Intel® Neural Compressor
يدعم أطر عمل PyTorch و TensorFlow و JAX
يقدم التكميم الثابت، والتكميم الديناميكي، و SmoothQuant، والتكميم المعتمد على الأوزان فقط
يمكّن التدريب المدرك للتكميم والدقة المختلطة
تكميم متقدم لنماذج LLMs و VLMs (مثل LLaMA و Qwen)
التكامل مع AutoRound لأنواع البيانات منخفضة الدقة المحسّنة
دعم شامل لأجهزة Intel (Gaudi و Xeon و Core Ultra و وحدات معالجة الرسومات لمراكز البيانات)
دعم محدود لوحدات المعالجة المركزية AMD و ARM ووحدات معالجة الرسومات NVIDIA
دعم تجريبي لتكميم FP8 لـ Keras/JAX
دعم تجريبي لتكميم FP8 KV cache/Attention الثابت
دعم تجريبي لتكميم NVFP4 و MXFP4
تحميل نماذج اللغات الكبيرة المعتمدة على الأوزان فقط
البدء مع Intel® Neural Compressor
تثبيت تبعيات إطار العمل: اختر وقم بتثبيت الحزم اللازمة بناءً على بيئة النشر الخاصة بك (على سبيل المثال، `pip install neural-compressor-pt`).
تكوين التكميم: حدد تكوينات التكميم، مثل FP8Config، لنموذجك.
إعداد النموذج: استخدم دالة `prepare` لدمج تكوينات التكميم في نموذجك.
تحويل النموذج: قم بتطبيق دالة `convert` لإنهاء ضغط النموذج.
النشر والتحسين: قم بدمج النموذج المضغوط في تطبيقك لتحسين أداء الاستدلال.
حالات استخدام Intel® Neural Compressor
- تكميم نماذج LLM
- تحسين نماذج VLM
- تسريع الأجهزة
- تكامل الأطر
- ضبط الأداء
- التدريب بالدقة المختلطة



