Descripción
MiMo-V2.5-Pro es un modelo de lenguaje Mixture-of-Experts (MoE) de vanguardia de código abierto con un total de 1.02 billones de parámetros y 42 mil millones de parámetros activos. Está diseñado para manejar las tareas más exigentes en ingeniería de software compleja y a largo plazo. El modelo utiliza una arquitectura de atención híbrida, intercalando Atención de Ventana Deslizante (SWA) y Atención Global (GA) en una proporción de 6:1, lo que reduce significativamente el almacenamiento de KV-cache mientras mantiene un rendimiento de contexto largo. Esta arquitectura se complementa con tres módulos ligeros de Predicción de Múltiples Tokens (MTP) que mejoran la velocidad de salida durante la inferencia.
El modelo se preentrena en 27 billones de tokens utilizando precisión mixta FP8 y admite una ventana de contexto de hasta 1 millón de tokens. Después del entrenamiento, MiMo-V2.5-Pro emplea Ajuste Fino Supervisado (SFT), Aprendizaje por Refuerzo (RL) a gran escala y Destilación On-Policy de Múltiples Maestros (MOPD) para lograr un rendimiento superior en tareas complejas. Destaca en mantener trayectorias complejas a lo largo de una ventana de contexto de 1M tokens, lo que lo hace altamente efectivo para tareas que requieren un fuerte seguimiento de instrucciones y coherencia.
La arquitectura de MiMo-V2.5-Pro aborda la complejidad cuadrática de los contextos largos integrando Atención Local de Ventana Deslizante y Atención Global. Su proceso de entrenamiento incluye un paradigma de post-entrenamiento en tres etapas que comienza con SFT para construir habilidades fundamentales, seguido de Entrenamiento Especializado por Dominio con diversos modelos de maestro, y culminando en MOPD para un aprendizaje dinámico en política RL.
El despliegue del modelo es respaldado por las comunidades SGLang y vLLM, con configuraciones recomendadas para un rendimiento óptimo. MiMo-V2.5-Pro es ideal para industrias que requieren capacidades avanzadas de procesamiento de lenguaje, como la ingeniería de software y aplicaciones multilingües.
Aspectos destacados de MiMo-V2.5-Pro
1.02T total de parámetros
42B parámetros activos
Arquitectura de atención híbrida
Predicción de Múltiples Tokens (MTP)
Pre-entrenamiento eficiente en 27T tokens
Longitud de contexto de 1M tokens
Ajuste Fino Supervisado (SFT)
Destilación On-Policy de Múltiples Maestros (MOPD)
Atención de Ventana Deslizante (SWA)
Atención Global (GA)
Primeros pasos con MiMo-V2.5-Pro
Acceder a la página: Visita la página del modelo en Hugging Face
Cargar modelo: Descarga MiMo-V2.5-Pro
Configurar entorno: Configúralo con los parámetros recomendados
Integrar: Implementa en tu aplicación
Ajustar: Ajusta el modelo para tareas específicas
Casos de uso de MiMo-V2.5-Pro
- Ingeniería de Software Compleja
- Tareas Agentes
- Aplicaciones Multilingües
- Razonamiento de Contexto Largo
- Aprendizaje por Refuerzo







