説明
このリポジトリは、NeurIPS 2021で発表された研究論文「Revisiting Deep Learning Models for Tabular Data」の公式実装として機能します。このプロジェクトは、勾配ブースティング決定木(GBDT)のような従来のメソッドがしばしば優位性を示す表形式データセットに適用された際の、様々なディープラーニングアーキテクチャの効果を深く掘り下げます。
このリポジトリに反映されている論文の主要な発見は、シンプルで適切にチューニングされた多層パーセプトロン(MLP)が依然として非常に競争力があり、しばしばより複雑なディープラーニングモデルと同等またはそれ以上の性能を発揮することを示しています。スキップ接続とバッチ正規化を組み込んだMLPのバリアントであるResNetアーキテクチャは、表形式データに対するMLPライクな構造の強さをさらに強化します。しかし、この研究では、表形式データのためにTransformerモデルを適応させた新しいアーキテクチャであるFT-Transformerも紹介しています。FT-Transformerは、ベンチマーク全体で他のディープモデルと比較して優れた平均パフォーマンスを示し、GBDTが伝統的に支配的なデータセットにおいて、ディープラーニングとGBDTのパフォーマンスギャップを大幅に縮小します。
このリポジトリは、論文の結果の再現とさらなる研究を容易にするように構成されています。実用的な使用のためのPythonパッケージ、様々なモデルとデータセットの詳細なメトリクスとハイパーパラメータ、そしてセットアップ、データダウンロード、チューニング、評価、アンサンブルスクリプトの実行に関する明確な指示が含まれています。コードは、トレーニング、アンサンブル、チューニング、分析、および共通ツールのディレクトリに整理されており、出力には詳細な統計情報と設定が含まれます。
このプロジェクトは、機械学習、特に表形式データを扱う研究者や実務家にとって価値があります。ディープラーニングモデルの実験と展開のための堅牢なフレームワークを提供し、どのアーキテクチャがどのような条件下で最もパフォーマンスを発揮するかについての洞察を提供します。FT-Transformerの包含は、構造化データにおけるディープラーニングの進歩に向けた有望な方向性を示唆しています。
表形式データのためのディープラーニングモデルのハイライト
NeurIPS 2021論文「Revisiting Deep Learning Models for Tabular Data」の公式実装
表形式データのための強力なベースラインとしてMLPライクなモデルを探求
表形式データのためのTransformerアーキテクチャの適応であるFT-Transformerを紹介
実用的なアプリケーションと将来の研究のためのPythonパッケージを提供
様々なモデルとデータセットの詳細なメトリクスとチューニング済みハイパーパラメータを含む
報告された結果を再現するためのコードベース
ハイパーパラメータチューニング、モデル評価、アンサンブルのためのスクリプト
実験のためのPyTorchおよびTensorFlow環境をサポート
表形式データセットにおけるディープラーニングモデルとGBDTの比較を促進
表形式データにおける異なるディープラーニングアーキテクチャのパフォーマンス特性に関する洞察を提供
表形式データのためのディープラーニングモデルをはじめる
環境設定: Condaとpipを使用して必要な依存関係をインストールします。
データダウンロード: データセットアーカイブを取得し、リポジトリのルートに展開します。
結果の再現: チューニング、評価、アンサンブルのためのチュートリアル手順に従います。
スクリプト実行: 設定ファイルを指定して、リポジトリのルートからPythonスクリプトを実行します。
API経由での統合: 実用的なアプリケーションのためにPythonパッケージを利用します。
メトリクスの探索: `stats.json` ファイルを分析してモデルのパフォーマンスを理解します。
モデルの設定: TOML設定ファイルを変更してカスタム実験を行います。
表形式データのためのディープラーニングモデルの使用例
- 表形式データ分析
- モデルベンチマーキング
- 研究実装
- 特徴量エンジニアリングの探求
- 予測モデリング








