Deskripsi
MiMo-V2.5-Pro adalah model bahasa Mixture-of-Experts (MoE) sumber terbuka yang mutakhir dengan total 1,02 triliun parameter dan 42 miliar parameter aktif. Model ini dirancang untuk menangani tugas-tugas rekayasa perangkat lunak yang kompleks dan menuntut. Model ini memanfaatkan arsitektur perhatian hibrida, menggabungkan Sliding Window Attention (SWA) dan Global Attention (GA) dengan rasio 6:1, yang secara signifikan mengurangi penyimpanan KV-cache sambil mempertahankan kinerja konteks panjang. Arsitektur ini dilengkapi dengan tiga modul Multi-Token Prediction (MTP) ringan yang meningkatkan kecepatan keluaran selama inferensi.
Model ini telah dilatih sebelumnya pada 27 triliun token menggunakan presisi campuran FP8 dan mendukung jendela konteks hingga 1 juta token. Setelah pelatihan, MiMo-V2.5-Pro menerapkan Supervised Fine-Tuning (SFT), Reinforcement Learning (RL) agenik skala besar, dan Multi-Teacher On-Policy Distillation (MOPD) untuk mencapai kinerja yang unggul dalam tugas-tugas kompleks. Model ini unggul dalam mempertahankan trajektori kompleks di jendela konteks 1 juta token, menjadikannya sangat efektif untuk tugas yang memerlukan kepatuhan instruksi yang kuat dan koherensi.
Arsitektur MiMo-V2.5-Pro mengatasi kompleksitas kuadratik dari konteks panjang dengan mengintegrasikan Local Sliding Window Attention dan Global Attention. Proses pelatihannya mencakup paradigma pasca-pelatihan tiga tahap yang dimulai dengan SFT untuk membangun keterampilan dasar, diikuti dengan Pelatihan Khusus Domain dengan berbagai model pengajar, dan diakhiri dengan MOPD untuk RL dinamis on-policy.
Penerapan model ini didukung oleh komunitas SGLang dan vLLM, dengan konfigurasi yang direkomendasikan untuk kinerja optimal. MiMo-V2.5-Pro sangat ideal untuk industri yang memerlukan kemampuan pemrosesan bahasa tingkat lanjut, seperti rekayasa perangkat lunak dan aplikasi multibahasa.
Sorotan MiMo-V2.5-Pro
1,02T total parameter
42B parameter aktif
Arsitektur perhatian hibrida
Multi-Token Prediction (MTP)
Pelatihan awal yang efisien pada 27T token
Panjang konteks 1M token
Supervised Fine-Tuning (SFT)
Multi-Teacher On-Policy Distillation (MOPD)
Sliding Window Attention (SWA)
Global Attention (GA)
Memulai dengan MiMo-V2.5-Pro
Akses halaman: Kunjungi halaman model Hugging Face
Muat model: Unduh MiMo-V2.5-Pro
Konfigurasi lingkungan: Siapkan dengan parameter yang direkomendasikan
Integrasi: Implementasikan dalam aplikasi Anda
Fine-tune: Sesuaikan model untuk tugas spesifik
Kasus Penggunaan MiMo-V2.5-Pro
- Rekayasa Perangkat Lunak Kompleks
- Tugas Agenik
- Aplikasi Multibahasa
- Penalaran Konteks Panjang
- Reinforcement Learning







