Description
Le projet BERT (Bidirectional Encoder Representations from Transformers) fournit des modèles pré-entraînés pour les tâches de traitement du langage naturel. Parmi ses offres figurent des modèles multilingues conçus pour gérer un large éventail de langues, permettant la compréhension et les applications interlingues. Actuellement, deux modèles multilingues principaux sont disponibles : BERT-Base, Multilingual Cased (Nouveau, recommandé) et BERT-Base, Multilingual Uncased (Orig, non recommandé).
Le modèle BERT-Base, Multilingual Cased prend en charge 104 langues et présente une architecture à 12 couches avec 768 unités cachées, 12 têtes d'attention et 110 millions de paramètres. Ce modèle est recommandé en raison de sa normalisation améliorée pour de nombreuses langues, en particulier celles avec des alphabets non latins. Lors de l'utilisation de ce modèle, il est crucial de définir `--do_lower_case=false` dans les scripts d'exécution. Le modèle Multilingual Uncased, bien qu'il prenne en charge 102 langues avec la même architecture, n'est pas recommandé pour les nouveaux projets.
Pour les tâches en langue chinoise, un modèle BERT-Base, Chinese dédié est également disponible, prenant en charge le chinois simplifié et traditionnel. Bien que les modèles multilingues incluent le chinois, un modèle uniquement chinois peut donner de meilleurs résultats pour l'affinage spécifique au chinois. Les performances de ces modèles ont été évaluées sur le jeu de données XNLI, une tâche d'inférence en langage naturel interlingue. Les résultats indiquent que si les modèles à langue unique peuvent surpasser les modèles multilingues pour les langues à haute ressource, ces derniers offrent une solution pratique pour une couverture linguistique étendue sans avoir à maintenir de nombreux modèles à langue unique.
L'affinage des modèles BERT multilingues ne nécessite pas de changements d'API significatifs. Cependant, des mises à jour du `BasicTokenizer` peuvent être nécessaires pour la tokenisation des caractères chinois. Les modèles peuvent être intégrés dans des flux de travail à l'aide de scripts fournis comme `run_classifier.py`, qui a été mis à jour pour prendre en charge des jeux de données comme XNLI. La stratégie d'échantillonnage des données pour le pré-entraînement impliquait une pondération lissée exponentiellement des données de Wikipedia pour équilibrer les langues à haute et basse ressource, assurant une meilleure représentation pour tous. La tokenisation utilise un vocabulaire WordPiece partagé, avec une gestion spécifique pour les langues CJK afin de pallier l'absence d'espaces. Le modèle multilingue omet intentionnellement les marqueurs de langue pour faciliter les capacités d'apprentissage zero-shot.
Points forts de Modèles Multilingues BERT
Prend en charge 104 langues (Multilingual Cased)
Prend en charge 102 langues (Multilingual Uncased)
Architecture Transformer à 12 couches
768 unités cachées
12 têtes d'attention
110 millions de paramètres
Modèle Multilingual Cased recommandé pour une normalisation améliorée
Capacité d'apprentissage zero-shot
Support d'affinage pour des tâches spécifiques
Pré-entraîné sur des données Wikipedia
Vocabulaire WordPiece partagé
Gère les langues CJK avec tokenisation par caractère
Code TensorFlow open-source disponible
Premiers pas avec Modèles Multilingues BERT
Accéder au modèle : Télécharger les modèles BERT multilingues pré-entraînés.
Configurer l'environnement : Installer TensorFlow et les dépendances nécessaires.
Intégrer via API : Charger les modèles et les tokenizers en utilisant les bibliothèques fournies.
Préparer les données : Formater vos données textuelles multilingues pour l'entraînement ou l'inférence.
Affiner : Adapter le modèle à des tâches spécifiques en aval comme la classification ou la réponse aux questions.
Exécuter l'inférence : Utiliser le modèle affiné pour traiter de nouvelles données textuelles.
Évaluer les performances : Évaluer la précision du modèle sur des benchmarks multilingues pertinents.
Cas d'utilisation de Modèles Multilingues BERT
- Classification interlingue
- Analyse de sentiment multilingue
- Transfert zero-shot interlingue
- Évaluation de la traduction automatique
- Réponse aux questions multilingue
- Recherche d'informations interlingue
- Inférence en langage naturel







