Langsung ke konten utama
ToolPotion

MiMo-V2.5-Pro

MiMo-V2.5-Pro adalah model bahasa Mixture-of-Experts sumber terbuka yang canggih, dirancang untuk tugas-tugas kompleks. Model ini memiliki arsitektur perhatian hibrida dan mendukung panjang konteks hingga 1 juta token, menjadikannya ideal untuk rekayasa perangkat lunak yang menuntut dan tugas jangka panjang.

Lihat Model
Bagikan

Deskripsi

MiMo-V2.5-Pro adalah model bahasa Mixture-of-Experts (MoE) sumber terbuka yang mutakhir dengan total 1,02 triliun parameter dan 42 miliar parameter aktif. Model ini dirancang untuk menangani tugas-tugas rekayasa perangkat lunak yang kompleks dan menuntut. Model ini memanfaatkan arsitektur perhatian hibrida, menggabungkan Sliding Window Attention (SWA) dan Global Attention (GA) dengan rasio 6:1, yang secara signifikan mengurangi penyimpanan KV-cache sambil mempertahankan kinerja konteks panjang. Arsitektur ini dilengkapi dengan tiga modul Multi-Token Prediction (MTP) ringan yang meningkatkan kecepatan keluaran selama inferensi.

Model ini telah dilatih sebelumnya pada 27 triliun token menggunakan presisi campuran FP8 dan mendukung jendela konteks hingga 1 juta token. Setelah pelatihan, MiMo-V2.5-Pro menerapkan Supervised Fine-Tuning (SFT), Reinforcement Learning (RL) agenik skala besar, dan Multi-Teacher On-Policy Distillation (MOPD) untuk mencapai kinerja yang unggul dalam tugas-tugas kompleks. Model ini unggul dalam mempertahankan trajektori kompleks di jendela konteks 1 juta token, menjadikannya sangat efektif untuk tugas yang memerlukan kepatuhan instruksi yang kuat dan koherensi.

Arsitektur MiMo-V2.5-Pro mengatasi kompleksitas kuadratik dari konteks panjang dengan mengintegrasikan Local Sliding Window Attention dan Global Attention. Proses pelatihannya mencakup paradigma pasca-pelatihan tiga tahap yang dimulai dengan SFT untuk membangun keterampilan dasar, diikuti dengan Pelatihan Khusus Domain dengan berbagai model pengajar, dan diakhiri dengan MOPD untuk RL dinamis on-policy.

Penerapan model ini didukung oleh komunitas SGLang dan vLLM, dengan konfigurasi yang direkomendasikan untuk kinerja optimal. MiMo-V2.5-Pro sangat ideal untuk industri yang memerlukan kemampuan pemrosesan bahasa tingkat lanjut, seperti rekayasa perangkat lunak dan aplikasi multibahasa.

Sorotan MiMo-V2.5-Pro

  • 1,02T total parameter

  • 42B parameter aktif

  • Arsitektur perhatian hibrida

  • Multi-Token Prediction (MTP)

  • Pelatihan awal yang efisien pada 27T token

  • Panjang konteks 1M token

  • Supervised Fine-Tuning (SFT)

  • Multi-Teacher On-Policy Distillation (MOPD)

  • Sliding Window Attention (SWA)

  • Global Attention (GA)

Memulai dengan MiMo-V2.5-Pro

  1. Akses halaman: Kunjungi halaman model Hugging Face

  2. Muat model: Unduh MiMo-V2.5-Pro

  3. Konfigurasi lingkungan: Siapkan dengan parameter yang direkomendasikan

  4. Integrasi: Implementasikan dalam aplikasi Anda

  5. Fine-tune: Sesuaikan model untuk tugas spesifik

Kasus Penggunaan MiMo-V2.5-Pro

  • Rekayasa Perangkat Lunak Kompleks
  • Tugas Agenik
  • Aplikasi Multibahasa
  • Penalaran Konteks Panjang
  • Reinforcement Learning

FAQ dari MiMo-V2.5-Pro

From Xiaomi

a model in MiMo.

Ulasan MiMo-V2.5-Pro

Memuat...

Alat AI Populer Seperti MiMo-V2.5-Pro

DeepSeek-V3 adalah model bahasa Mixture-of-Experts dengan 671 miliar parameter, dirancang untuk inferensi yang efisien dan pelatihan yang hemat biaya. Model ini unggul dalam…

UnggulanModel AI & LLM

DeepSeek-V4-Pro adalah model AI canggih yang dirancang untuk kecerdasan konteks dengan jutaan token secara efisien. Model ini memiliki arsitektur perhatian hibrida dan telah…

UnggulanModel AI & LLM

Kimi K3 adalah model AI multimodal open-weight canggih yang dirancang untuk pengkodean jangka panjang, pekerjaan pengetahuan, dan penalaran. Model ini memiliki jendela konteks 1…

UnggulanModel AI & LLM

MiMo-V2.5 adalah model AI unggulan dari Xiaomi, menawarkan kemampuan triliun parameter untuk produktivitas di dunia nyata. Model ini unggul dalam tugas jangka panjang dan…

Model AI & LLM

Kimi-K2-Instruct adalah model bahasa campuran ahli yang canggih, dirancang untuk tugas AI tingkat lanjut. Model ini unggul dalam penalaran, pengkodean, dan penggunaan alat,…

Model AI & LLM

NVIDIA Nemotron 3 Ultra adalah model AI yang kuat dirancang untuk penalaran kompleks dan tugas multibahasa. Dengan 550 miliar parameter, model ini unggul dalam analisis konteks…

UnggulanModel AI & LLM

Longformer Base 4096 adalah model transformer yang dirancang untuk memproses dokumen panjang. Model ini dibangun di atas RoBERTa, yang telah dilatih sebelumnya pada urutan yang…

Model AI & LLM

DeepSeek-v3 menawarkan solusi AI instan yang didukung oleh arsitektur MoE canggih dan model bahasa mutakhir. Rasakan kemampuan AI terdepan dengan model yang stabil, gratis, dan…

Model AI & LLM