Aller au contenu principal
ToolPotion

MiMo-V2.5-Pro

MiMo-V2.5-Pro est un modèle de langage Mixture-of-Experts open-source avancé conçu pour des tâches complexes. Il dispose d'une architecture d'attention hybride et prend en charge une longueur de contexte allant jusqu'à 1 million de tokens, ce qui le rend idéal pour des tâches exigeantes en ingénierie logicielle et à long terme.

Voir le modèle
Partager

Description

MiMo-V2.5-Pro est un modèle de langage Mixture-of-Experts (MoE) open-source à la pointe de la technologie, avec un total de 1,02 trillion de paramètres et 42 milliards de paramètres actifs. Il est conçu pour gérer les tâches agentiques les plus exigeantes, complexes en ingénierie logicielle et à long terme. Le modèle utilise une architecture d'attention hybride, entrelaçant l'attention par fenêtre glissante (SWA) et l'attention globale (GA) dans un rapport de 6:1, ce qui réduit considérablement le stockage du cache KV tout en maintenant des performances sur de longs contextes. Cette architecture est complétée par trois modules légers de prédiction multi-tokens (MTP) qui améliorent la vitesse de sortie lors de l'inférence.

Le modèle est pré-entraîné sur 27 trillions de tokens en utilisant une précision mixte FP8 et prend en charge une fenêtre de contexte allant jusqu'à 1 million de tokens. Après l'entraînement, MiMo-V2.5-Pro utilise un ajustement fin supervisé (SFT), un apprentissage par renforcement (RL) agentique à grande échelle et une distillation multi-enseignants en politique (MOPD) pour atteindre des performances supérieures dans des tâches complexes. Il excelle à maintenir des trajectoires complexes sur une fenêtre de contexte de 1 million de tokens, ce qui le rend très efficace pour les tâches nécessitant un suivi d'instructions solide et de la cohérence.

L'architecture de MiMo-V2.5-Pro aborde la complexité quadratique des longs contextes en intégrant l'attention par fenêtre glissante locale et l'attention globale. Son processus d'entraînement comprend un paradigme de post-entraînement en trois étapes qui commence par le SFT pour développer des compétences fondamentales, suivi d'un entraînement spécialisé par domaine avec divers modèles enseignants, et culminant en MOPD pour un apprentissage dynamique en politique.

Le déploiement du modèle est soutenu par les communautés SGLang et vLLM, avec des configurations recommandées pour des performances optimales. MiMo-V2.5-Pro est idéal pour les secteurs nécessitant des capacités avancées de traitement du langage, tels que l'ingénierie logicielle et les applications multilingues.

Points forts de MiMo-V2.5-Pro

  • 1,02T de paramètres au total

  • 42B de paramètres actifs

  • Architecture d'attention hybride

  • Prédiction multi-tokens (MTP)

  • Pré-entraînement efficace sur 27T de tokens

  • Longueur de contexte de 1M de tokens

  • Ajustement fin supervisé (SFT)

  • Distillation multi-enseignants en politique (MOPD)

  • Attention par fenêtre glissante (SWA)

  • Attention globale (GA)

Premiers pas avec MiMo-V2.5-Pro

  1. Accéder à la page : Visitez la page du modèle Hugging Face

  2. Charger le modèle : Téléchargez MiMo-V2.5-Pro

  3. Configurer l'environnement : Configurez avec les paramètres recommandés

  4. Intégrer : Implémentez dans votre application

  5. Ajuster : Ajustez le modèle pour des tâches spécifiques

Cas d'utilisation de MiMo-V2.5-Pro

  • Ingénierie Logicielle Complexe
  • Tâches Agentiques
  • Applications Multilingues
  • Raisonnement sur Long Contexte
  • Apprentissage par Renforcement

FAQ de MiMo-V2.5-Pro

From Xiaomi

a model in MiMo.

Avis sur MiMo-V2.5-Pro

Chargement...

Outils IA populaires comme MiMo-V2.5-Pro

DeepSeek-V3 est un modèle de langage Mixture-of-Experts avec 671 milliards de paramètres, conçu pour une inférence efficace et un entraînement économique. Il excelle dans divers…

En vedetteModèles d'IA et LLM

DeepSeek-V4-Pro est un modèle IA avancé conçu pour une intelligence contextuelle efficace sur un million de tokens. Il dispose d'une architecture d'attention hybride et est…

En vedetteModèles d'IA et LLM

Kimi K3 est un modèle IA multimodal avancé à poids ouvert conçu pour le codage à long terme, le travail de connaissance et le raisonnement. Il dispose d'une fenêtre de contexte de…

En vedetteModèles d'IA et LLM

MiMo-V2.5 est un modèle AI phare de Xiaomi, offrant des capacités de trillion de paramètres pour la productivité dans le monde réel. Il excelle dans les tâches à long terme et…

Modèles d'IA et LLM

Kimi-K2-Instruct est un modèle de langage à la pointe de la technologie, basé sur un mélange d'experts, conçu pour des tâches avancées en IA. Il excelle dans le raisonnement, la…

Modèles d'IA et LLM

NVIDIA Nemotron 3 Ultra est un puissant modèle IA conçu pour des tâches de raisonnement complexe et multilingues. Avec 550 milliards de paramètres, il excelle dans l'analyse de…

En vedetteModèles d'IA et LLM

Longformer Base 4096 est un modèle transformer conçu pour le traitement de longs documents. Il s'appuie sur RoBERTa, pré-entraîné sur des séquences étendues jusqu'à 4 096 tokens.…

Modèles d'IA et LLM

DeepSeek-v3 offre des solutions IA instantanées alimentées par une architecture MoE avancée et des modèles linguistiques de pointe. Découvrez des capacités IA de pointe avec ce…

Modèles d'IA et LLM