Pular para o conteúdo principal
ToolPotion

MiMo-V2.5-Pro

MiMo-V2.5-Pro é um modelo de linguagem Mixture-of-Experts de código aberto avançado, projetado para tarefas complexas. Ele apresenta uma arquitetura de atenção híbrida e suporta um comprimento de contexto de até 1M tokens, tornando-o ideal para engenharia de software exigente e tarefas de longo prazo.

Ver modelo
Compartilhar

Descrição

MiMo-V2.5-Pro é um modelo de linguagem Mixture-of-Experts (MoE) de ponta, com um total de 1,02 trilhões de parâmetros e 42 bilhões de parâmetros ativos. Ele é projetado para lidar com as tarefas mais exigentes em engenharia de software complexa e de longo prazo. O modelo utiliza uma arquitetura de atenção híbrida, intercalando a Atenção de Janela Deslizante (SWA) e a Atenção Global (GA) em uma proporção de 6:1, o que reduz significativamente o armazenamento do cache KV, mantendo o desempenho em contextos longos. Essa arquitetura é complementada por três módulos leves de Previsão de Múltiplos Tokens (MTP) que aumentam a velocidade de saída durante a inferência.

O modelo é pré-treinado em 27 trilhões de tokens usando precisão mista FP8 e suporta uma janela de contexto de até 1 milhão de tokens. Após o treinamento, o MiMo-V2.5-Pro emprega Ajuste Fino Supervisionado (SFT), Aprendizado por Reforço (RL) em larga escala e Destilação On-Policy de Múltiplos Professores (MOPD) para alcançar desempenho superior em tarefas complexas. Ele se destaca em sustentar trajetórias complexas em uma janela de contexto de 1M tokens, tornando-o altamente eficaz para tarefas que exigem forte seguimento de instruções e coerência.

A arquitetura do MiMo-V2.5-Pro aborda a complexidade quadrática de longos contextos integrando Atenção Local de Janela Deslizante e Atenção Global. Seu processo de treinamento inclui um paradigma de pós-treinamento em três estágios que começa com SFT para construir habilidades fundamentais, seguido por Treinamento Especializado em Domínio com diversos modelos professores, e culminando em MOPD para aprendizado dinâmico em política.

A implantação do modelo é suportada pelas comunidades SGLang e vLLM, com configurações recomendadas para desempenho ideal. O MiMo-V2.5-Pro é ideal para indústrias que requerem capacidades avançadas de processamento de linguagem, como engenharia de software e aplicações multilíngues.

Destaques de MiMo-V2.5-Pro

  • 1,02T parâmetros totais

  • 42B parâmetros ativos

  • Arquitetura de atenção híbrida

  • Previsão de Múltiplos Tokens (MTP)

  • Pré-treinamento eficiente em 27T tokens

  • Comprimento de contexto de 1M tokens

  • Ajuste Fino Supervisionado (SFT)

  • Destilação On-Policy de Múltiplos Professores (MOPD)

  • Atenção de Janela Deslizante (SWA)

  • Atenção Global (GA)

Primeiros passos com MiMo-V2.5-Pro

  1. Acesse a página: Visite a página do modelo Hugging Face

  2. Carregue o modelo: Baixe o MiMo-V2.5-Pro

  3. Configure o ambiente: Configure com os parâmetros recomendados

  4. Integre: Implemente em sua aplicação

  5. Ajuste fino: Ajuste o modelo para tarefas específicas

Casos de uso de MiMo-V2.5-Pro

  • Engenharia de Software Complexa
  • Tarefas Agentes
  • Aplicações Multilíngues
  • Raciocínio de Longo Contexto
  • Aprendizado por Reforço

Perguntas frequentes de MiMo-V2.5-Pro

From Xiaomi

a model in MiMo.

Avaliações de MiMo-V2.5-Pro

Carregando...

Ferramentas de IA populares como MiMo-V2.5-Pro

DeepSeek-V3 é um modelo de linguagem Mixture-of-Experts com 671 bilhões de parâmetros, projetado para inferência eficiente e treinamento econômico. Ele se destaca em vários…

DestaqueModelos de IA e LLMs

DeepSeek-V4-Pro é um modelo de IA avançado projetado para inteligência de contexto eficiente com milhões de tokens. Ele apresenta uma arquitetura de atenção híbrida e é…

DestaqueModelos de IA e LLMs

Kimi K3 é um modelo de IA multimodal avançado de peso aberto, projetado para codificação de longo prazo, trabalho de conhecimento e raciocínio. Ele possui uma janela de contexto…

DestaqueModelos de IA e LLMs

MiMo-V2.5 é um modelo de IA de destaque da Xiaomi, oferecendo capacidades de trilhões de parâmetros para produtividade no mundo real. Ele se destaca em tarefas de longo prazo e…

Modelos de IA e LLMs

Kimi-K2-Instruct é um modelo de linguagem de mistura de especialistas de última geração, projetado para tarefas avançadas de IA. Ele se destaca em raciocínio, codificação e uso de…

Modelos de IA e LLMs

O NVIDIA Nemotron 3 Ultra é um poderoso modelo de IA projetado para raciocínio complexo e tarefas multilíngues. Com 550 bilhões de parâmetros, ele se destaca na análise de longos…

DestaqueModelos de IA e LLMs

Longformer Base 4096 é um modelo transformer projetado para processar documentos longos. Ele se baseia no RoBERTa, pré-treinado em sequências estendidas de até 4.096 tokens. Este…

Modelos de IA e LLMs

O DeepSeek-v3 oferece soluções de IA instantâneas impulsionadas por uma arquitetura MoE avançada e modelos de linguagem de ponta. Experimente capacidades de IA de vanguarda com…

Modelos de IA e LLMs