Description
Funnel-Transformer est un nouveau modèle d'auto-attention conçu pour améliorer l'efficacité du traitement du langage en compressant progressivement la séquence d'états cachés. Cette compression réduit considérablement les coûts de calcul tout en permettant simultanément la construction de modèles de plus grande capacité, soit plus profonds, soit plus larges, pour un budget de calcul donné. L'innovation principale réside dans sa capacité à réinvestir les FLOPs économisés dans la complexité du modèle.
De plus, Funnel-Transformer intègre un mécanisme de décodeur qui reconstruit des représentations profondes au niveau des tokens à partir de la séquence cachée compressée. Cette capacité est cruciale pour permettre des méthodologies de pré-entraînement standard, rendant le modèle plus polyvalent et applicable à un plus large éventail de tâches de traitement du langage naturel. Les détails techniques du modèle et sa validation expérimentale sont présentés dans un article de recherche.
Le projet fournit des implémentations en TensorFlow et en PyTorch. La version TensorFlow est spécifiquement développée pour le pré-entraînement et le fine-tuning sur TPU, prenant en charge des tâches telles que le fine-tuning du benchmark GLUE, la classification de texte, SQuAD et RACE. L'implémentation PyTorch sert d'exemple, prenant principalement en charge le fine-tuning sur GPU pour le benchmark GLUE et la classification de texte.
Des modèles pré-entraînés sont disponibles dans différentes tailles et configurations, y compris différentes profondeurs de couches et nombres d'unités cachées. Chaque package de modèle comprend un checkpoint TensorFlow ou PyTorch, un fichier de vocabulaire Word Piece pour la tokenisation et un fichier de configuration détaillant les hyperparamètres du modèle. Un script est également fourni pour télécharger tous les checkpoints disponibles. Les instructions pour utiliser les modèles pré-entraînés et le fine-tuning sont détaillées dans les fichiers README respectifs des répertoires TensorFlow et PyTorch.
Points forts de Funnel-Transformer
Compression progressive des états cachés
Coût de calcul réduit
Capacité accrue du modèle (profondeur/largeur)
Récupération de représentations au niveau des tokens
Permet le pré-entraînement standard
Implémentation TensorFlow pour TPU
Implémentation PyTorch pour GPU
Prend en charge le benchmark GLUE, la classification de texte, SQuAD, RACE
Plusieurs tailles de modèles pré-entraînés disponibles
Inclut des checkpoints de modèle, un vocabulaire et des fichiers de configuration
Premiers pas avec Funnel-Transformer
Accéder au modèle : Obtenez le code Funnel-Transformer et les modèles pré-entraînés depuis le dépôt GitHub.
Configurer l'environnement : Installez les dépendances nécessaires pour TensorFlow ou PyTorch.
Intégrer via le code : Chargez les checkpoints du modèle et les fichiers de configuration dans votre framework choisi.
Fine-tuner le modèle : Adaptez le modèle à des tâches spécifiques en aval en utilisant les scripts de fine-tuning fournis.
Utiliser les poids pré-entraînés : Appliquez les checkpoints téléchargés pour l'inférence ou l'entraînement supplémentaire.
Tokeniser les données : Utilisez le vocabulaire Word Piece fourni pour le prétraitement du texte.
Cas d'utilisation de Funnel-Transformer
- Modélisation linguistique efficace
- Classification de texte
- Réponse aux questions
- Compression de séquences
- Pré-entraînement standard
- Recherche et développement







