Descrição
MiMo-V2.5-Pro é um modelo de linguagem Mixture-of-Experts (MoE) de ponta, com um total de 1,02 trilhões de parâmetros e 42 bilhões de parâmetros ativos. Ele é projetado para lidar com as tarefas mais exigentes em engenharia de software complexa e de longo prazo. O modelo utiliza uma arquitetura de atenção híbrida, intercalando a Atenção de Janela Deslizante (SWA) e a Atenção Global (GA) em uma proporção de 6:1, o que reduz significativamente o armazenamento do cache KV, mantendo o desempenho em contextos longos. Essa arquitetura é complementada por três módulos leves de Previsão de Múltiplos Tokens (MTP) que aumentam a velocidade de saída durante a inferência.
O modelo é pré-treinado em 27 trilhões de tokens usando precisão mista FP8 e suporta uma janela de contexto de até 1 milhão de tokens. Após o treinamento, o MiMo-V2.5-Pro emprega Ajuste Fino Supervisionado (SFT), Aprendizado por Reforço (RL) em larga escala e Destilação On-Policy de Múltiplos Professores (MOPD) para alcançar desempenho superior em tarefas complexas. Ele se destaca em sustentar trajetórias complexas em uma janela de contexto de 1M tokens, tornando-o altamente eficaz para tarefas que exigem forte seguimento de instruções e coerência.
A arquitetura do MiMo-V2.5-Pro aborda a complexidade quadrática de longos contextos integrando Atenção Local de Janela Deslizante e Atenção Global. Seu processo de treinamento inclui um paradigma de pós-treinamento em três estágios que começa com SFT para construir habilidades fundamentais, seguido por Treinamento Especializado em Domínio com diversos modelos professores, e culminando em MOPD para aprendizado dinâmico em política.
A implantação do modelo é suportada pelas comunidades SGLang e vLLM, com configurações recomendadas para desempenho ideal. O MiMo-V2.5-Pro é ideal para indústrias que requerem capacidades avançadas de processamento de linguagem, como engenharia de software e aplicações multilíngues.
Destaques de MiMo-V2.5-Pro
1,02T parâmetros totais
42B parâmetros ativos
Arquitetura de atenção híbrida
Previsão de Múltiplos Tokens (MTP)
Pré-treinamento eficiente em 27T tokens
Comprimento de contexto de 1M tokens
Ajuste Fino Supervisionado (SFT)
Destilação On-Policy de Múltiplos Professores (MOPD)
Atenção de Janela Deslizante (SWA)
Atenção Global (GA)
Primeiros passos com MiMo-V2.5-Pro
Acesse a página: Visite a página do modelo Hugging Face
Carregue o modelo: Baixe o MiMo-V2.5-Pro
Configure o ambiente: Configure com os parâmetros recomendados
Integre: Implemente em sua aplicação
Ajuste fino: Ajuste o modelo para tarefas específicas
Casos de uso de MiMo-V2.5-Pro
- Engenharia de Software Complexa
- Tarefas Agentes
- Aplicações Multilíngues
- Raciocínio de Longo Contexto
- Aprendizado por Reforço







