تخطَّ إلى المحتوى الرئيسي
ToolPotion

التعلم شبه المراقب في Scikit-learn

تتيح وحدة التعلم شبه المراقب في Scikit-learn للنماذج الاستفادة من البيانات غير المسماة جنبًا إلى جنب مع البيانات المسماة لتحسين التعميم. وهي تقدم خوارزميات مثل التدريب الذاتي وانتشار التسمية، وهي مثالية للسيناريوهات التي تحتوي على عينات مسماة محدودة وبيانات غير مسماة وفيرة، مما يعزز أداء النموذج من خلال التقاط توزيع البيانات الأساسي.

زيارة الرابط

الوصف

يعالج التعلم شبه المراقب المواقف التي تحتوي فيها مجموعات بيانات التدريب على مزيج من العينات المسماة وغير المسماة. توفر وحدة `sklearn.semi_supervised` في Scikit-learn مقدرات مصممة للاستفادة من هذه البيانات غير المسماة، وبالتالي فهم توزيع البيانات بشكل أفضل وتحسين التعميم على عينات جديدة وغير مرئية. هذه التقنيات فعالة بشكل خاص عندما تكون البيانات المسماة نادرة، ولكن البيانات غير المسماة وفيرة.

من المهم ملاحظة أن خوارزميات التعلم شبه المراقب تعتمد على افتراضات حول توزيع البيانات لتحقيق مكاسب في الأداء. تقدم الوحدة نهجين أساسيين: التدريب الذاتي وانتشار التسمية.

يعتمد التدريب الذاتي، المستند إلى خوارزمية Yarowsky، على أي مصنف مراقب يدعم `predict_proba` للعمل بطريقة شبه مراقبة. يقوم `SelfTrainingClassifier` بتنبؤ تسميات للعينات غير المسماة بشكل متكرر ويضيف مجموعة فرعية منها إلى مجموعة البيانات المسماة. يمكن أن يعتمد اختيار هذه العينات على احتمالات التنبؤ، باستخدام عتبة أو اختيار أفضل k عينة. تستمر هذه العملية حتى يتم تسمية جميع العينات أو عدم تحديد عينات جديدة في تكرار، مع إمكانية التحكم في الحد الأقصى لعدد التكرارات عبر `max_iter`.

يشمل انتشار التسمية العديد من خوارزميات استدلال الرسم البياني شبه المراقب، بما في ذلك `LabelPropagation` و `LabelSpreading`. تبني هذه النماذج رسمًا بيانيًا للتشابه عبر جميع نقاط بيانات الإدخال. الفكرة الأساسية هي أن بنية البيانات غير المسماة متسقة مع هياكل الفئات، مما يسمح بتناقل تسميات الفئات إلى الملاحظات غير المسماة. يقوم `LabelPropagation` بإجراء تثبيت صارم لتسميات الإدخال، بينما يوفر `LabelSpreading` نهجًا أكثر قوة من خلال تقليل دالة خسارة بخصائص تنظيمية، مما يجعله أكثر مقاومة للضوضاء. تدعم كلتا النموذجين طرق النواة المدمجة مثل RBF و KNN، مما يؤثر على قابلية التوسع والأداء. تنشئ نواة RBF رسمًا بيانيًا كثيفًا، وقد يكون مكثفًا للذاكرة، بينما تنشئ نواة KNN رسمًا بيانيًا متفرقًا، مما يوفر كفاءة أفضل للذاكرة ويقلل من أوقات التشغيل.

هذه الأساليب قيمة للمهام التي يكون فيها وضع العلامات يدويًا مكلفًا أو مستهلكًا للوقت، مما يتيح إنشاء نماذج أكثر قوة ودقة من خلال تسخير ثروة البيانات غير المسماة المتاحة. يعتمد الاختيار بين التدريب الذاتي وانتشار التسمية على خصائص مجموعة البيانات المحددة والنهج المطلوب للاستفادة من المعلومات غير المسماة.

أبرز ملامح التعلم شبه المراقب في Scikit-learn

  • يدعم التصنيف شبه المراقب

  • يستخدم البيانات غير المسماة لتحسين التعميم

  • يشمل خوارزمية التدريب الذاتي

  • يدعم انتشار التسمية ونشر التسميات

  • يبني رسومًا بيانية للتشابه لانتشار التسمية

  • يقدم طرق نواة RBF و KNN

  • يسمح بالتحكم في تثبيت التسمية في الانتشار

  • عملية تعلم تكرارية للتدريب الذاتي

  • قابل للتكيف مع مختلف المصنفات المراقبة للتدريب الذاتي

  • يتعامل مع السيناريوهات ذات البيانات المسماة المحدودة

  • يعزز فهم توزيع البيانات الأساسي

البدء مع التعلم شبه المراقب في Scikit-learn

  1. الوصول إلى النموذج: استيراد المقدرات ذات الصلة من `sklearn.semi_supervised`.

  2. إعداد البيانات: تنظيم العينات المسماة وغير المسماة.

  3. تكوين المقدر: إنشاء `SelfTrainingClassifier` أو `LabelPropagation`/`LabelSpreading` بالمعلمات المطلوبة.

  4. تدريب النموذج: ملاءمة المقدر المختار لمجموعة البيانات المُعدة.

  5. التنبؤ بالتسميات: استخدام النموذج المُدرب للتنبؤ بتسميات البيانات الجديدة.

  6. تقييم الأداء: تقييم دقة النموذج وقدرات التعميم.

حالات استخدام التعلم شبه المراقب في Scikit-learn

  • تصنيف النصوص
  • التعرف على الصور
  • كشف الاحتيال
  • تقسيم العملاء
  • التشخيص الطبي
  • التعرف على الكلام

الأسئلة الشائعة من التعلم شبه المراقب في Scikit-learn

تقييمات التعلم شبه المراقب في Scikit-learn

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل التعلم شبه المراقب في Scikit-learn

أطر عمل الذكاء الاصطناعي

scikit-learn هو إطار عمل مفتوح المصدر للتعلم الآلي في بايثون، يوفر أدوات بسيطة وفعالة لتحليل البيانات التنبؤية. إنه متاح للجميع وقابل لإعادة الاستخدام في سياقات متنوعة، مبني على…

مميزةمنصّات تعلّم الآلة

أطر عمل الذكاء الاصطناعي

auto-sklearn هو مجموعة أدوات التعلم الآلي الآلي التي تعمل كبديل مباشر لمقدرات scikit-learn. يقوم بأتمتة اختيار الخوارزميات وضبط المعلمات الفائقة، مستفيدًا من التحسين البايزي…

منصّات تعلّم الآلة

تطبيقات الذكاء الاصطناعي

تقدم BasicAI منصة شاملة لتعليق بيانات الذكاء الاصطناعي وخدمات تسمية احترافية. بخبرة تزيد عن 7 سنوات، توفر مجموعات بيانات عالية الجودة للحقيقة الأرضية لتدريب نماذج الذكاء…

منصّات تعلّم الآلة

تطبيقات الذكاء الاصطناعي

Defined.ai هي منصة للوصول إلى نماذج الذكاء الاصطناعي ومجموعات البيانات وإدارتها. توفر أدوات لتصنيف البيانات وتدريب النماذج ونشرها، مما يمكّن المستخدمين من بناء حلول الذكاء…

منصّات تعلّم الآلة

أطر عمل الذكاء الاصطناعي

scikit-learn هي مكتبة بايثون تقدم أدوات بسيطة وفعالة لتحليل البيانات التنبؤي. مبنية على NumPy و SciPy و Matplotlib، توفر خوارزميات سهلة الوصول وقابلة لإعادة الاستخدام للتصنيف…

منصّات تعلّم الآلة

نماذج الذكاء الاصطناعي

المُشفّر التلقائي هو نوع من الشبكات العصبية المصممة للتعلم غير الخاضع للإشراف، مع التركيز على تعلم ترميزات فعالة للبيانات. يتكون من مُشفّر يضغط البيانات إلى رمز ومُفكّ تشفير يعيد…

منصّات تعلّم الآلة

نماذج الذكاء الاصطناعي

ULMFiT هي تقنية قوية لضبط نماذج اللغة المدربة مسبقًا. إنها تمكّن التعلم الانتقالي الفعال لمهام تصنيف النصوص، وتحقق نتائج متطورة بأقل قدر من البيانات والموارد الحسابية. هذه الطريقة…

منصّات تعلّم الآلة

نماذج الذكاء الاصطناعي

UniLM هو إطار عمل تدريب مسبق ذاتي الإشراف واسع النطاق طورته Microsoft. يمكّن النماذج من التعلم عبر مهام ولغات وأنماط متنوعة، بما في ذلك النص والصورة والصوت. يوفر هذا المشروع نماذج…

نماذج الذكاء الاصطناعي ونماذج اللغة الكبيرة