Beschreibung
MiMo-V2.5-Pro ist ein hochmodernes Open-Source Mixture-of-Experts (MoE) Sprachmodell mit insgesamt 1,02 Billionen Parametern und 42 Milliarden aktiven Parametern. Es wurde entwickelt, um die anspruchsvollsten agentischen, komplexen Softwareentwicklungs- und langfristigen Aufgaben zu bewältigen. Das Modell nutzt eine hybride Aufmerksamkeitsarchitektur, die Sliding Window Attention (SWA) und Global Attention (GA) im Verhältnis 6:1 kombiniert, was den Speicherbedarf für den KV-Cache erheblich reduziert und gleichzeitig die Leistung bei langen Kontexten aufrechterhält. Diese Architektur wird durch drei leichte Multi-Token Prediction (MTP) Module ergänzt, die die Ausgabegeschwindigkeit während der Inferenz erhöhen.
Das Modell wurde auf 27 Billionen Tokens mit FP8-Mischpräzision vortrainiert und unterstützt ein Kontextfenster von bis zu 1 Million Tokens. Nach dem Training verwendet MiMo-V2.5-Pro Supervised Fine-Tuning (SFT), großangelegtes agentisches Reinforcement Learning (RL) und Multi-Teacher On-Policy Distillation (MOPD), um eine überlegene Leistung bei komplexen Aufgaben zu erzielen. Es zeichnet sich durch die Fähigkeit aus, komplexe Trajektorien über ein 1M-Token-Kontextfenster aufrechtzuerhalten, was es äußerst effektiv für Aufgaben macht, die starkes Befolgen von Anweisungen und Kohärenz erfordern.
Die Architektur von MiMo-V2.5-Pro adressiert die quadratische Komplexität langer Kontexte, indem sie lokale Sliding Window Attention und Global Attention integriert. Der Trainingsprozess umfasst ein dreistufiges Nachtraining, das mit SFT beginnt, um grundlegende Fähigkeiten aufzubauen, gefolgt von domänenspezifischem Training mit verschiedenen Lehrermodellen und gipfelt in MOPD für dynamisches On-Policy RL.
Die Bereitstellung des Modells wird von den SGLang- und vLLM-Communities unterstützt, mit empfohlenen Konfigurationen für optimale Leistung. MiMo-V2.5-Pro ist ideal für Branchen, die fortschrittliche Sprachverarbeitungsfähigkeiten erfordern, wie Softwareentwicklung und mehrsprachige Anwendungen.
MiMo-V2.5-Pro im Überblick
1,02 Billionen Gesamtparameter
42 Milliarden aktive Parameter
Hybride Aufmerksamkeitsarchitektur
Multi-Token Prediction (MTP)
Effizientes Vortraining auf 27 Billionen Tokens
1 Million Tokens Kontextlänge
Supervised Fine-Tuning (SFT)
Multi-Teacher On-Policy Distillation (MOPD)
Sliding Window Attention (SWA)
Global Attention (GA)
Erste Schritte mit MiMo-V2.5-Pro
Zugriff auf die Seite: Besuchen Sie die Hugging Face Modellseite
Modell laden: Laden Sie MiMo-V2.5-Pro herunter
Umgebung konfigurieren: Richten Sie sie mit empfohlenen Parametern ein
Integrieren: Implementieren Sie es in Ihrer Anwendung
Feinabstimmung: Passen Sie das Modell für spezifische Aufgaben an
MiMo-V2.5-Pro's Anwendungsfälle
- Komplexe Softwareentwicklung
- Agentische Aufgaben
- Mehrsprachige Anwendungen
- Langzeitkontext-Argumentation
- Reinforcement Learning







