الوصف
يعالج التعلم شبه المراقب المواقف التي تحتوي فيها مجموعات بيانات التدريب على مزيج من العينات المسماة وغير المسماة. توفر وحدة `sklearn.semi_supervised` في Scikit-learn مقدرات مصممة للاستفادة من هذه البيانات غير المسماة، وبالتالي فهم توزيع البيانات بشكل أفضل وتحسين التعميم على عينات جديدة وغير مرئية. هذه التقنيات فعالة بشكل خاص عندما تكون البيانات المسماة نادرة، ولكن البيانات غير المسماة وفيرة.
من المهم ملاحظة أن خوارزميات التعلم شبه المراقب تعتمد على افتراضات حول توزيع البيانات لتحقيق مكاسب في الأداء. تقدم الوحدة نهجين أساسيين: التدريب الذاتي وانتشار التسمية.
يعتمد التدريب الذاتي، المستند إلى خوارزمية Yarowsky، على أي مصنف مراقب يدعم `predict_proba` للعمل بطريقة شبه مراقبة. يقوم `SelfTrainingClassifier` بتنبؤ تسميات للعينات غير المسماة بشكل متكرر ويضيف مجموعة فرعية منها إلى مجموعة البيانات المسماة. يمكن أن يعتمد اختيار هذه العينات على احتمالات التنبؤ، باستخدام عتبة أو اختيار أفضل k عينة. تستمر هذه العملية حتى يتم تسمية جميع العينات أو عدم تحديد عينات جديدة في تكرار، مع إمكانية التحكم في الحد الأقصى لعدد التكرارات عبر `max_iter`.
يشمل انتشار التسمية العديد من خوارزميات استدلال الرسم البياني شبه المراقب، بما في ذلك `LabelPropagation` و `LabelSpreading`. تبني هذه النماذج رسمًا بيانيًا للتشابه عبر جميع نقاط بيانات الإدخال. الفكرة الأساسية هي أن بنية البيانات غير المسماة متسقة مع هياكل الفئات، مما يسمح بتناقل تسميات الفئات إلى الملاحظات غير المسماة. يقوم `LabelPropagation` بإجراء تثبيت صارم لتسميات الإدخال، بينما يوفر `LabelSpreading` نهجًا أكثر قوة من خلال تقليل دالة خسارة بخصائص تنظيمية، مما يجعله أكثر مقاومة للضوضاء. تدعم كلتا النموذجين طرق النواة المدمجة مثل RBF و KNN، مما يؤثر على قابلية التوسع والأداء. تنشئ نواة RBF رسمًا بيانيًا كثيفًا، وقد يكون مكثفًا للذاكرة، بينما تنشئ نواة KNN رسمًا بيانيًا متفرقًا، مما يوفر كفاءة أفضل للذاكرة ويقلل من أوقات التشغيل.
هذه الأساليب قيمة للمهام التي يكون فيها وضع العلامات يدويًا مكلفًا أو مستهلكًا للوقت، مما يتيح إنشاء نماذج أكثر قوة ودقة من خلال تسخير ثروة البيانات غير المسماة المتاحة. يعتمد الاختيار بين التدريب الذاتي وانتشار التسمية على خصائص مجموعة البيانات المحددة والنهج المطلوب للاستفادة من المعلومات غير المسماة.
أبرز ملامح التعلم شبه المراقب في Scikit-learn
يدعم التصنيف شبه المراقب
يستخدم البيانات غير المسماة لتحسين التعميم
يشمل خوارزمية التدريب الذاتي
يدعم انتشار التسمية ونشر التسميات
يبني رسومًا بيانية للتشابه لانتشار التسمية
يقدم طرق نواة RBF و KNN
يسمح بالتحكم في تثبيت التسمية في الانتشار
عملية تعلم تكرارية للتدريب الذاتي
قابل للتكيف مع مختلف المصنفات المراقبة للتدريب الذاتي
يتعامل مع السيناريوهات ذات البيانات المسماة المحدودة
يعزز فهم توزيع البيانات الأساسي
البدء مع التعلم شبه المراقب في Scikit-learn
الوصول إلى النموذج: استيراد المقدرات ذات الصلة من `sklearn.semi_supervised`.
إعداد البيانات: تنظيم العينات المسماة وغير المسماة.
تكوين المقدر: إنشاء `SelfTrainingClassifier` أو `LabelPropagation`/`LabelSpreading` بالمعلمات المطلوبة.
تدريب النموذج: ملاءمة المقدر المختار لمجموعة البيانات المُعدة.
التنبؤ بالتسميات: استخدام النموذج المُدرب للتنبؤ بتسميات البيانات الجديدة.
تقييم الأداء: تقييم دقة النموذج وقدرات التعميم.
حالات استخدام التعلم شبه المراقب في Scikit-learn
- تصنيف النصوص
- التعرف على الصور
- كشف الاحتيال
- تقسيم العملاء
- التشخيص الطبي
- التعرف على الكلام




