Description
Cet article de recherche de Google DeepMind aborde une question cruciale dans le développement des grands modèles de langage (LLM) : "Quelle est la taille optimale du modèle et le nombre de tokens d'entraînement pour un budget de calcul donné ?" La tendance dominante dans le développement des LLM a été d'augmenter le nombre de paramètres des modèles, entraînant des gains de performance impressionnants sur diverses tâches de NLP, comme en témoignent des modèles tels que Gopher (280 milliards de paramètres) et Megatron-Turing NLG (530 milliards de paramètres).
Cependant, le coût substantiel associé à l'entraînement de ces modèles massifs nécessite une estimation minutieuse de la configuration d'entraînement la plus efficace pour éviter le gaspillage de ressources. Le coût de calcul de l'entraînement des modèles transformer est influencé par deux facteurs principaux : la taille du modèle (nombre de paramètres) et la quantité de tokens d'entraînement. Les LLM actuels ont largement privilégié l'augmentation du nombre de paramètres tout en maintenant la taille des données d'entraînement relativement fixe, souvent autour de 300 milliards de tokens.
Cette étude adopte une approche empirique, entraînant des modèles de tailles variées avec différents nombres de tokens pour étudier l'équilibre optimal entre ces deux facteurs pour un budget de calcul donné. La conclusion principale est que de nombreux grands modèles de langage actuels sont disproportionnellement grands par rapport à leur budget de calcul et ne sont pas entraînés sur suffisamment de données. La recherche suggère que pour le calcul utilisé pour entraîner Gopher, un modèle quatre fois plus petit mais entraîné sur quatre fois plus de données aurait été préférable.
Pour valider cette hypothèse, DeepMind a entraîné Chinchilla, un modèle de 70 milliards de paramètres entraîné sur 1,3 trillion de tokens. Malgré un coût de calcul d'entraînement identique à celui de Gopher, Chinchilla a surpassé significativement Gopher et d'autres grands LLM sur de nombreux benchmarks, notamment la réponse aux questions, le raisonnement de bon sens, la compréhension de lecture et les connaissances générales. Cela démontre l'efficacité d'une stratégie de mise à l'échelle optimisée en calcul.
L'article discute également des implications de cette découverte à la lumière des sorties ultérieures de modèles comme PaLM (540 milliards de paramètres, 768 milliards de tokens). Bien que PaLM, entraîné avec un budget de calcul plus important, ait surpassé Chinchilla, les méthodes de recherche prédisent qu'un modèle optimisé en calcul pour le budget de PaLM serait un modèle de 140 milliards de paramètres entraîné sur 3 trillions de tokens, offrant une plus grande efficacité. Un avantage supplémentaire significatif de cette approche optimisée en calcul est la réduction du temps d'inférence et des coûts de mémoire, rendant ces modèles puissants plus accessibles et pratiques pour le déploiement sur du matériel moins exigeant.
Points forts de Entraînement des LLM optimisé en calcul
Analyse empirique de l'optimalité du calcul d'entraînement des LLM
Examine le compromis entre la taille du modèle et les tokens d'entraînement
Identifie une stratégie de mise à l'échelle optimisée en calcul pour les LLM
Démontre des gains de performance avec des modèles plus petits, entraînés sur plus de données
Quantifie les avantages des modèles optimisés en calcul pour l'efficacité de l'inférence
Présente Chinchilla, un modèle de 70 milliards de paramètres optimisé en calcul
Compare les performances par rapport à Gopher, GPT-3 et Megatron-Turing NLG
Fournit des prédictions pour des configurations de modèles optimales basées sur le budget de calcul
Met en évidence la réduction du temps d'inférence et des coûts de mémoire
Recherche publiée par Google DeepMind
Se concentre sur les modèles de langage basés sur des transformeurs
Premiers pas avec Entraînement des LLM optimisé en calcul
Comprendre les résultats de la recherche : Examiner l'analyse empirique sur l'entraînement des LLM optimisé en calcul.
Analyser les compromis : Considérer l'équilibre entre la taille du modèle et les données d'entraînement pour votre budget de calcul.
Appliquer les principes de mise à l'échelle : Mettre en œuvre des stratégies pour entraîner des modèles plus petits sur plus de données.
Évaluer les performances : Comparer les modèles optimisés en calcul aux homologues plus grands et moins efficacement entraînés.
Optimiser l'inférence : Utiliser des modèles plus petits et plus performants pour réduire les coûts et accélérer les réponses.
Cas d'utilisation de Entraînement des LLM optimisé en calcul
- Optimisation de l'entraînement des LLM
- Allocation des ressources
- Stratégie de développement de modèles
- Réduction des coûts d'inférence
- Recherche et développement







