الوصف
يقدم مستودع تنفيذ SAINT باستخدام PyTorch الكود الرسمي لنموذج SAINT (شبكات عصبية محسنة للبيانات الجدولية عبر الانتباه للصف والتدريب المسبق التبايني). يهدف هذا المشروع إلى الباحثين والممارسين الذين يعملون مع مجموعات البيانات الجدولية، ويوفر إطار عمل مرن وقوي لبناء شبكات عصبية متقدمة.
يكمن جوهر SAINT في نهجه المبتكر للتعامل مع البيانات الجدولية. فهو يدمج آليات الانتباه للصف، مما يسمح للنموذج بالتركيز على الأجزاء ذات الصلة من بيانات الإدخال، ويستخدم التدريب المسبق التبايني لتحسين التعميم، خاصة في السيناريوهات ذات عينات التدريب المحدودة. يهدف هذا النهج المزدوج إلى التقاط العلاقات المعقدة داخل الهياكل الجدولية بشكل أكثر فعالية من الطرق التقليدية.
تم بناء التنفيذ باستخدام PyTorch، وهو إطار عمل شائع للتعلم العميق، مما يضمن سهولة التكامل لمن هم على دراية بالنظام البيئي. يتضمن المستودع نصوصًا برمجية للتدريب والتقييم، ويدعم مهام مختلفة مثل الانحدار والتصنيف الثنائي والتصنيف متعدد الفئات. يمكن للمستخدمين الاستفادة من النماذج المدربة مسبقًا أو تدريب نماذجهم الخاصة من الصفر، مع خيارات لتخصيص المعلمات الفائقة مثل حجم التضمين وعمق المحول ورؤوس الانتباه.
تشمل القدرات الرئيسية الوصول المباشر إلى البيانات من مجموعات بيانات OpenML بمجرد توفير معرف مجموعة البيانات، مما يبسط عملية تحميل البيانات. يدعم المشروع أيضًا التكامل الاختياري مع Weights & Biases (wandb) لتسجيل محسّن وتتبع التجارب. الكود موثق جيدًا، مع تعليمات واضحة حول إعداد البيئة وتدريب النماذج وإجراء التدريب المسبق لتحقيق المتانة والأداء المحسن على مجموعات البيانات الأصغر.
يشمل الجمهور المستهدف لهذا المستودع مهندسي التعلم الآلي وعلماء البيانات والباحثين الذين يتطلعون إلى تطبيق أحدث تقنيات التعلم العميق على البيانات الجدولية. إنه مفيد بشكل خاص لأولئك الذين يعملون على مهام قد تواجه فيها النماذج التقليدية صعوبة في التقاط الأنماط المعقدة أو عند التعامل مع مجموعات بيانات تحتوي على عدد كبير من الميزات.
تكمن القيمة المقترحة لتنفيذ SAINT باستخدام PyTorch في توفير حل متطور ومفتوح المصدر لنمذجة البيانات الجدولية. من خلال تقديم تنفيذ مباشر لورقة بحثية، فإنه يضفي طابعًا ديمقراطيًا على الوصول إلى التقنيات المتقدمة، مما يمكّن المستخدمين من تحقيق نتائج فائقة على مجموعة واسعة من مشاكل البيانات الجدولية.
أبرز ملامح تنفيذ SAINT باستخدام PyTorch
تنفيذ رسمي لنموذج SAINT باستخدام PyTorch
آلية الانتباه للصف للبيانات الجدولية
التدريب المسبق التبايني لتحسين التعميم
يدعم مهام الانحدار
يدعم مهام التصنيف الثنائي
يدعم مهام التصنيف متعدد الفئات
الوصول المباشر إلى البيانات من مجموعات بيانات OpenML عبر المعرف
معلمات فائقة قابلة للتخصيص (حجم التضمين، عمق المحول، رؤوس الانتباه)
تكامل اختياري مع Weights & Biases (wandb) للتسجيل
التدريب المسبق للمتانة وسيناريوهات البيانات المحدودة
ترخيص Apache 2.0
البدء مع تنفيذ SAINT باستخدام PyTorch
إعداد البيئة: قم بإنشاء وتفعيل بيئة conda باستخدام ملف `saint_environment.yml` المقدم.
تثبيت المتطلبات: تأكد من تثبيت PyTorch (>=1.8.1) و Torchvision (>=0.9.1).
تدريب النموذج: قم بتشغيل `python train.py` مع معرف مجموعة البيانات والمهمة ونوع الانتباه المحددين.
التدريب المسبق للنموذج: استخدم `train_robust.py` مع علامات التدريب المسبق والمهام وأنواع التحسين.
تكوين المعلمات الفائقة: اضبط المعلمات مثل `embedding_size` و `transformer_depth` و `attention_heads` حسب الحاجة.
تقييم النموذج: قم بتقييم الأداء باستخدام مقاييس مثل AuROC والدقة و RMSE على مجموعات التحقق والاختبار.
دمج النتائج: استخدم النماذج المدربة للتنبؤ على مجموعات البيانات الجدولية الجديدة.
حالات استخدام تنفيذ SAINT باستخدام PyTorch
- تصنيف البيانات الجدولية
- انحدار البيانات الجدولية
- تعلم الميزات للجداول
- التعلم قليل اللقطات على الجداول
- التعلم شبه المراقب
- النمذجة الجدولية المتقدمة






