Deskripsi
Repositori ini berfungsi sebagai implementasi resmi untuk makalah penelitian "Revisiting Deep Learning Models for Tabular Data," yang dipresentasikan di NeurIPS 2021. Proyek ini mendalami efektivitas berbagai arsitektur deep learning ketika diterapkan pada dataset tabular, sebuah domain di mana metode tradisional seperti gradient-boosted decision trees (GBDTs) seringkali unggul.
Temuan inti dari makalah ini, sebagaimana tercermin dalam repositori ini, menunjukkan bahwa Multi-Layer Perceptrons (MLPs) yang sederhana dan disetel dengan baik tetap sangat kompetitif, seringkali berkinerja setara atau bahkan melampaui model deep learning yang lebih kompleks. Arsitektur ResNet, varian MLP yang menggabungkan skip connections dan batch normalization, semakin memperkuat kekuatan struktur seperti MLP untuk data tabular. Namun, penelitian ini juga memperkenalkan FT-Transformer, arsitektur baru yang mengadaptasi model Transformer untuk data tabular. FT-Transformer menunjukkan kinerja rata-rata yang unggul di berbagai benchmark dibandingkan dengan model deep lainnya dan secara signifikan mempersempit kesenjangan kinerja antara deep learning dan GBDTs pada dataset di mana GBDTs secara tradisional mendominasi.
Repositori ini disusun untuk memfasilitasi reproduksi hasil makalah dan penelitian lebih lanjut. Ini mencakup paket Python untuk penggunaan praktis, metrik terperinci dan hyperparameter untuk berbagai model dan dataset, serta instruksi yang jelas tentang penyiapan, pengunduhan data, dan eksekusi skrip tuning, evaluasi, dan ensembling. Kode diatur ke dalam direktori untuk pelatihan, ensembling, tuning, analisis, dan alat umum, dengan output termasuk statistik dan konfigurasi terperinci.
Proyek ini berharga bagi para peneliti dan praktisi dalam machine learning, terutama mereka yang bekerja dengan data tabular. Ini menyediakan kerangka kerja yang kuat untuk bereksperimen dan menerapkan model deep learning, menawarkan wawasan tentang arsitektur mana yang berkinerja terbaik dan dalam kondisi apa. Penyertaan FT-Transformer menunjukkan arah yang menjanjikan untuk memajukan deep learning pada data terstruktur.
Sorotan Model Deep Learning untuk Data Tabular
Implementasi resmi makalah NeurIPS 2021 'Revisiting Deep Learning Models for Tabular Data'
Mengeksplorasi model seperti MLP sebagai baseline yang kuat untuk data tabular
Memperkenalkan FT-Transformer, adaptasi arsitektur Transformer untuk data tabular
Menyediakan paket Python untuk aplikasi praktis dan penelitian di masa mendatang
Mencakup metrik terperinci dan hyperparameter yang disetel untuk berbagai model dan dataset
Basis kode untuk mereproduksi hasil yang dilaporkan
Skrip untuk penyetelan hyperparameter, evaluasi model, dan ensembling
Mendukung lingkungan PyTorch dan TensorFlow untuk eksperimen
Memfasilitasi perbandingan antara model deep learning dan GBDT pada dataset tabular
Menawarkan wawasan tentang karakteristik kinerja arsitektur deep learning yang berbeda pada data tabular
Memulai dengan Model Deep Learning untuk Data Tabular
Siapkan lingkungan: Instal dependensi yang diperlukan menggunakan Conda dan pip.
Unduh data: Dapatkan arsip dataset dan ekstrak ke root repositori.
Reproduksi hasil: Ikuti langkah-langkah tutorial untuk tuning, evaluasi, dan ensembling.
Jalankan skrip: Eksekusi skrip Python dari root repositori, dengan menyediakan file konfigurasi.
Integrasikan melalui API: Manfaatkan paket Python untuk aplikasi praktis.
Jelajahi metrik: Analisis file `stats.json` untuk memahami kinerja model.
Konfigurasi model: Modifikasi file konfigurasi TOML untuk eksperimen kustom.
Kasus Penggunaan Model Deep Learning untuk Data Tabular
- Analisis Data Tabular
- Benchmarking Model
- Implementasi Riset
- Eksplorasi Rekayasa Fitur
- Pemodelan Prediktif








