Description
MiMo-V2.5-Pro est un modèle de langage Mixture-of-Experts (MoE) open-source à la pointe de la technologie, avec un total de 1,02 trillion de paramètres et 42 milliards de paramètres actifs. Il est conçu pour gérer les tâches agentiques les plus exigeantes, complexes en ingénierie logicielle et à long terme. Le modèle utilise une architecture d'attention hybride, entrelaçant l'attention par fenêtre glissante (SWA) et l'attention globale (GA) dans un rapport de 6:1, ce qui réduit considérablement le stockage du cache KV tout en maintenant des performances sur de longs contextes. Cette architecture est complétée par trois modules légers de prédiction multi-tokens (MTP) qui améliorent la vitesse de sortie lors de l'inférence.
Le modèle est pré-entraîné sur 27 trillions de tokens en utilisant une précision mixte FP8 et prend en charge une fenêtre de contexte allant jusqu'à 1 million de tokens. Après l'entraînement, MiMo-V2.5-Pro utilise un ajustement fin supervisé (SFT), un apprentissage par renforcement (RL) agentique à grande échelle et une distillation multi-enseignants en politique (MOPD) pour atteindre des performances supérieures dans des tâches complexes. Il excelle à maintenir des trajectoires complexes sur une fenêtre de contexte de 1 million de tokens, ce qui le rend très efficace pour les tâches nécessitant un suivi d'instructions solide et de la cohérence.
L'architecture de MiMo-V2.5-Pro aborde la complexité quadratique des longs contextes en intégrant l'attention par fenêtre glissante locale et l'attention globale. Son processus d'entraînement comprend un paradigme de post-entraînement en trois étapes qui commence par le SFT pour développer des compétences fondamentales, suivi d'un entraînement spécialisé par domaine avec divers modèles enseignants, et culminant en MOPD pour un apprentissage dynamique en politique.
Le déploiement du modèle est soutenu par les communautés SGLang et vLLM, avec des configurations recommandées pour des performances optimales. MiMo-V2.5-Pro est idéal pour les secteurs nécessitant des capacités avancées de traitement du langage, tels que l'ingénierie logicielle et les applications multilingues.
Points forts de MiMo-V2.5-Pro
1,02T de paramètres au total
42B de paramètres actifs
Architecture d'attention hybride
Prédiction multi-tokens (MTP)
Pré-entraînement efficace sur 27T de tokens
Longueur de contexte de 1M de tokens
Ajustement fin supervisé (SFT)
Distillation multi-enseignants en politique (MOPD)
Attention par fenêtre glissante (SWA)
Attention globale (GA)
Premiers pas avec MiMo-V2.5-Pro
Accéder à la page : Visitez la page du modèle Hugging Face
Charger le modèle : Téléchargez MiMo-V2.5-Pro
Configurer l'environnement : Configurez avec les paramètres recommandés
Intégrer : Implémentez dans votre application
Ajuster : Ajustez le modèle pour des tâches spécifiques
Cas d'utilisation de MiMo-V2.5-Pro
- Ingénierie Logicielle Complexe
- Tâches Agentiques
- Applications Multilingues
- Raisonnement sur Long Contexte
- Apprentissage par Renforcement







