Descrição
Este repositório serve como a implementação oficial do artigo de pesquisa "Revisiting Deep Learning Models for Tabular Data", apresentado na NeurIPS 2021. O projeto investiga a eficácia de várias arquiteturas de deep learning quando aplicadas a conjuntos de dados tabulares, um domínio onde métodos tradicionais como árvores de decisão com gradient boosting (GBDTs) frequentemente se destacam.
As principais descobertas do artigo, refletidas neste repositório, indicam que Perceptrons Multicamadas (MLPs) simples e bem ajustados permanecem altamente competitivos, muitas vezes apresentando desempenho igual ou superior a modelos de deep learning mais complexos. A arquitetura ResNet, uma variante de MLP que incorpora conexões de salto (skip connections) e normalização em lote (batch normalization), reforça ainda mais a força das estruturas do tipo MLP para dados tabulares. No entanto, a pesquisa também introduz o FT-Transformer, uma arquitetura inovadora que adapta o modelo Transformer para dados tabulares. O FT-Transformer demonstra um desempenho médio superior em benchmarks em comparação com outros modelos profundos e reduz significativamente a lacuna de desempenho entre deep learning e GBDTs em conjuntos de dados onde os GBDTs tradicionalmente dominam.
O repositório é estruturado para facilitar a reprodução dos resultados do artigo e pesquisas futuras. Ele inclui um pacote Python para uso prático, métricas detalhadas e hiperparâmetros para vários modelos e conjuntos de dados, e instruções claras sobre configuração, download de dados e execução de scripts de ajuste, avaliação e ensembling. O código está organizado em diretórios para treinamento, ensembling, ajuste, análise e ferramentas comuns, com saídas incluindo estatísticas detalhadas e configurações.
Este projeto é valioso para pesquisadores e profissionais de machine learning, especialmente aqueles que trabalham com dados tabulares. Ele fornece um framework robusto para experimentar e implantar modelos de deep learning, oferecendo insights sobre quais arquiteturas têm melhor desempenho e sob quais condições. A inclusão do FT-Transformer sugere uma direção promissora para o avanço do deep learning em dados estruturados.
Destaques de Modelos de Deep Learning para Dados Tabulares
Implementação oficial do artigo NeurIPS 2021 'Revisiting Deep Learning Models for Tabular Data'
Explora modelos do tipo MLP como fortes baselines para dados tabulares
Introduz o FT-Transformer, uma adaptação da arquitetura Transformer para dados tabulares
Fornece pacote Python para aplicação prática e pesquisa futura
Inclui métricas detalhadas e hiperparâmetros ajustados para vários modelos e conjuntos de dados
Base de código para reprodução dos resultados reportados
Scripts para ajuste de hiperparâmetros, avaliação de modelos e ensembling
Suporta ambientes PyTorch e TensorFlow para experimentação
Facilita a comparação entre modelos de deep learning e GBDTs em conjuntos de dados tabulares
Oferece insights sobre as características de desempenho de diferentes arquiteturas de deep learning em dados tabulares
Primeiros passos com Modelos de Deep Learning para Dados Tabulares
Configurar ambiente: Instalar dependências necessárias usando Conda e pip.
Baixar dados: Obter o arquivo de conjunto de dados e descompactá-lo na raiz do repositório.
Reproduzir resultados: Seguir os passos do tutorial para ajuste, avaliação e ensembling.
Executar scripts: Executar scripts Python a partir da raiz do repositório, fornecendo arquivos de configuração.
Integrar via API: Utilizar o pacote Python para aplicação prática.
Explorar métricas: Analisar arquivos `stats.json` para entender o desempenho do modelo.
Configurar modelos: Modificar arquivos de configuração TOML para experimentos personalizados.
Casos de uso de Modelos de Deep Learning para Dados Tabulares
- Análise de Dados Tabulares
- Benchmarking de Modelos
- Implementação de Pesquisa
- Exploração de Engenharia de Features
- Modelagem Preditiva








