الوصف
يعمل هذا المستودع كتنفيذ رسمي للورقة البحثية "إعادة النظر في نماذج التعلم العميق للبيانات الجدولية"، التي تم تقديمها في NeurIPS 2021. يتعمق المشروع في فعالية معماريات التعلم العميق المختلفة عند تطبيقها على مجموعات البيانات الجدولية، وهو مجال غالبًا ما تتفوق فيه الطرق التقليدية مثل أشجار القرار المعززة بالتدرج (GBDTs).
تشير النتائج الأساسية للورقة، كما تنعكس في هذا المستودع، إلى أن شبكات Perceptrons متعددة الطبقات (MLPs) البسيطة والمضبوطة جيدًا تظل تنافسية للغاية، وغالبًا ما تؤدي على قدم المساواة مع أو حتى تتجاوز نماذج التعلم العميق الأكثر تعقيدًا. تعزز معمارية ResNet، وهي تنويع لـ MLP يتضمن اتصالات تخطي وتطبيع الدُفعات، قوة الهياكل الشبيهة بـ MLP للبيانات الجدولية. ومع ذلك، يقدم البحث أيضًا FT-Transformer، وهي معمارية جديدة تتكيف مع نموذج Transformer للبيانات الجدولية. يُظهر FT-Transformer أداءً متوسطًا متفوقًا عبر المعايير مقارنة بالنماذج العميقة الأخرى ويقلل بشكل كبير من فجوة الأداء بين التعلم العميق و GBDTs على مجموعات البيانات التي تهيمن عليها GBDTs تقليديًا.
تم تنظيم المستودع لتسهيل إعادة إنتاج نتائج الورقة والمزيد من البحث. يتضمن حزمة Python للاستخدام العملي، ومقاييس مفصلة ومعلمات فائقة لمختلف النماذج ومجموعات البيانات، وتعليمات واضحة حول الإعداد، وتنزيل البيانات، وتنفيذ نصوص الضبط والتقييم والتجميع. تم تنظيم الكود في أدلة للتدريب والتجميع والضبط والتحليل والأدوات المشتركة، مع مخرجات تشمل إحصائيات وتكوينات مفصلة.
هذا المشروع قيم للباحثين والممارسين في مجال التعلم الآلي، وخاصة أولئك الذين يعملون مع البيانات الجدولية. يوفر إطارًا قويًا لتجربة نماذج التعلم العميق ونشرها، ويقدم رؤى حول المعماريات التي تؤدي بشكل أفضل وتحت أي ظروف. يشير تضمين FT-Transformer إلى اتجاه واعد لتعزيز التعلم العميق على البيانات المنظمة.
أبرز ملامح نماذج التعلم العميق للبيانات الجدولية
التنفيذ الرسمي لورقة NeurIPS 2021 'إعادة النظر في نماذج التعلم العميق للبيانات الجدولية'
استكشاف نماذج تشبه MLP كخطوط أساس قوية للبيانات الجدولية
تقديم FT-Transformer، وهو تكيف لمعمارية Transformer للبيانات الجدولية
توفير حزمة Python للتطبيق العملي والبحث المستقبلي
تضمين مقاييس مفصلة ومعلمات فائقة مضبوطة لمختلف النماذج ومجموعات البيانات
قاعدة كود لإعادة إنتاج النتائج المبلغ عنها
نصوص برمجية لضبط المعلمات الفائقة، وتقييم النماذج، والتجميع
دعم بيئات PyTorch و TensorFlow للتجريب
تسهيل المقارنة بين نماذج التعلم العميق و GBDTs على مجموعات البيانات الجدولية
تقديم رؤى حول خصائص أداء معماريات التعلم العميق المختلفة على البيانات الجدولية
البدء مع نماذج التعلم العميق للبيانات الجدولية
إعداد البيئة: تثبيت التبعيات اللازمة باستخدام Conda و pip.
تنزيل البيانات: الحصول على أرشيف مجموعة البيانات وفك ضغطه في جذر المستودع.
إعادة إنتاج النتائج: اتباع خطوات البرنامج التعليمي للضبط والتقييم والتجميع.
تشغيل النصوص البرمجية: تنفيذ نصوص Python البرمجية من جذر المستودع، مع توفير ملفات التكوين.
التكامل عبر API: استخدام حزمة Python للتطبيق العملي.
استكشاف المقاييس: تحليل ملفات `stats.json` لفهم أداء النموذج.
تكوين النماذج: تعديل ملفات التكوين TOML للتجارب المخصصة.
حالات استخدام نماذج التعلم العميق للبيانات الجدولية
- تحليل البيانات الجدولية
- قياس أداء النماذج
- تنفيذ الأبحاث
- استكشاف هندسة الميزات
- النمذجة التنبؤية








