Saltar al contenido principal
ToolPotion

MiMo-V2.5-Pro

MiMo-V2.5-Pro es un modelo de lenguaje Mixture-of-Experts de código abierto avanzado diseñado para tareas complejas. Presenta una arquitectura de atención híbrida y admite hasta 1 millón de tokens de longitud de contexto, lo que lo hace ideal para ingeniería de software exigente y tareas a largo plazo.

Ver modelo
Compartir

Descripción

MiMo-V2.5-Pro es un modelo de lenguaje Mixture-of-Experts (MoE) de vanguardia de código abierto con un total de 1.02 billones de parámetros y 42 mil millones de parámetros activos. Está diseñado para manejar las tareas más exigentes en ingeniería de software compleja y a largo plazo. El modelo utiliza una arquitectura de atención híbrida, intercalando Atención de Ventana Deslizante (SWA) y Atención Global (GA) en una proporción de 6:1, lo que reduce significativamente el almacenamiento de KV-cache mientras mantiene un rendimiento de contexto largo. Esta arquitectura se complementa con tres módulos ligeros de Predicción de Múltiples Tokens (MTP) que mejoran la velocidad de salida durante la inferencia.

El modelo se preentrena en 27 billones de tokens utilizando precisión mixta FP8 y admite una ventana de contexto de hasta 1 millón de tokens. Después del entrenamiento, MiMo-V2.5-Pro emplea Ajuste Fino Supervisado (SFT), Aprendizaje por Refuerzo (RL) a gran escala y Destilación On-Policy de Múltiples Maestros (MOPD) para lograr un rendimiento superior en tareas complejas. Destaca en mantener trayectorias complejas a lo largo de una ventana de contexto de 1M tokens, lo que lo hace altamente efectivo para tareas que requieren un fuerte seguimiento de instrucciones y coherencia.

La arquitectura de MiMo-V2.5-Pro aborda la complejidad cuadrática de los contextos largos integrando Atención Local de Ventana Deslizante y Atención Global. Su proceso de entrenamiento incluye un paradigma de post-entrenamiento en tres etapas que comienza con SFT para construir habilidades fundamentales, seguido de Entrenamiento Especializado por Dominio con diversos modelos de maestro, y culminando en MOPD para un aprendizaje dinámico en política RL.

El despliegue del modelo es respaldado por las comunidades SGLang y vLLM, con configuraciones recomendadas para un rendimiento óptimo. MiMo-V2.5-Pro es ideal para industrias que requieren capacidades avanzadas de procesamiento de lenguaje, como la ingeniería de software y aplicaciones multilingües.

Aspectos destacados de MiMo-V2.5-Pro

  • 1.02T total de parámetros

  • 42B parámetros activos

  • Arquitectura de atención híbrida

  • Predicción de Múltiples Tokens (MTP)

  • Pre-entrenamiento eficiente en 27T tokens

  • Longitud de contexto de 1M tokens

  • Ajuste Fino Supervisado (SFT)

  • Destilación On-Policy de Múltiples Maestros (MOPD)

  • Atención de Ventana Deslizante (SWA)

  • Atención Global (GA)

Primeros pasos con MiMo-V2.5-Pro

  1. Acceder a la página: Visita la página del modelo en Hugging Face

  2. Cargar modelo: Descarga MiMo-V2.5-Pro

  3. Configurar entorno: Configúralo con los parámetros recomendados

  4. Integrar: Implementa en tu aplicación

  5. Ajustar: Ajusta el modelo para tareas específicas

Casos de uso de MiMo-V2.5-Pro

  • Ingeniería de Software Compleja
  • Tareas Agentes
  • Aplicaciones Multilingües
  • Razonamiento de Contexto Largo
  • Aprendizaje por Refuerzo

Preguntas frecuentes de MiMo-V2.5-Pro

From Xiaomi

a model in MiMo.

Reseñas de MiMo-V2.5-Pro

Cargando...

Herramientas de IA populares como MiMo-V2.5-Pro

DeepSeek-V3 es un modelo de lenguaje Mixture-of-Experts con 671 mil millones de parámetros, diseñado para una inferencia eficiente y un entrenamiento rentable. Destaca en varios…

DestacadaModelos de IA y LLM

DeepSeek-V4-Pro es un modelo de IA avanzado diseñado para una inteligencia contextual eficiente de un millón de tokens. Presenta una arquitectura de atención híbrida y está…

DestacadaModelos de IA y LLM

Kimi K3 es un modelo de IA multimodal avanzado de peso abierto diseñado para codificación a largo plazo, trabajo de conocimiento y razonamiento. Cuenta con una ventana de contexto…

DestacadaModelos de IA y LLM

MiMo-V2.5 es un modelo de IA insignia de Xiaomi, que ofrece capacidades de un billón de parámetros para la productividad en el mundo real. Destaca en tareas de largo horizonte y…

Modelos de IA y LLM

Kimi-K2-Instruct es un modelo de lenguaje de última generación basado en mezcla de expertos, diseñado para tareas avanzadas de IA. Destaca en razonamiento, codificación y uso de…

Modelos de IA y LLM

NVIDIA Nemotron 3 Ultra es un potente modelo de IA diseñado para razonamiento complejo y tareas multilingües. Con 550 mil millones de parámetros, sobresale en análisis de contexto…

DestacadaModelos de IA y LLM

Longformer Base 4096 es un modelo transformer diseñado para procesar documentos largos. Se basa en RoBERTa, preentrenado en secuencias extendidas de hasta 4.096 tokens. Este…

Modelos de IA y LLM

DeepSeek-v3 ofrece soluciones de IA instantáneas impulsadas por una arquitectura MoE avanzada y modelos de lenguaje de última generación. Experimente capacidades de IA de…

Modelos de IA y LLM