説明
MiMo-V2.5-Proは、1.02兆のパラメータと420億のアクティブパラメータを持つ最先端のオープンソースMixture-of-Experts(MoE)言語モデルです。最も要求の厳しいエージェント的で複雑なソフトウェアエンジニアリングおよび長期的なタスクを処理するように設計されています。このモデルは、スライディングウィンドウアテンション(SWA)とグローバルアテンション(GA)を6:1の比率で交互に使用するハイブリッドアテンションアーキテクチャを利用しており、長いコンテキストのパフォーマンスを維持しながらKVキャッシュストレージを大幅に削減します。このアーキテクチャは、推論中の出力速度を向上させる3つの軽量マルチトークン予測(MTP)モジュールによって補完されています。
このモデルは、FP8混合精度を使用して27兆トークンで事前トレーニングされており、最大1百万トークンのコンテキストウィンドウをサポートしています。トレーニング後、MiMo-V2.5-Proは、複雑なタスクにおける優れたパフォーマンスを達成するために、教師ありファインチューニング(SFT)、大規模なエージェント的強化学習(RL)、およびマルチティーチャーオンポリシー蒸留(MOPD)を採用しています。1Mトークンのコンテキストウィンドウで複雑な軌道を維持するのに優れており、強力な指示の遵守と一貫性を必要とするタスクに非常に効果的です。
MiMo-V2.5-Proのアーキテクチャは、ローカルスライディングウィンドウアテンションとグローバルアテンションを統合することで、長いコンテキストの二次的な複雑さに対処しています。そのトレーニングプロセスには、基礎的なスキルを構築するためのSFTから始まり、多様な教師モデルを用いたドメイン特化型トレーニングを経て、動的なオンポリシーRLのためのMOPDで締めくくる3段階のポストトレーニングパラダイムが含まれています。
このモデルの展開は、SGLangおよびvLLMコミュニティによってサポートされており、最適なパフォーマンスのための推奨設定があります。MiMo-V2.5-Proは、ソフトウェアエンジニアリングや多言語アプリケーションなど、高度な言語処理能力を必要とする業界に最適です。
MiMo-V2.5-Proのハイライト
1.02Tの総パラメータ
42Bのアクティブパラメータ
ハイブリッドアテンションアーキテクチャ
マルチトークン予測(MTP)
27Tトークンでの効率的な事前トレーニング
1Mトークンのコンテキスト長
教師ありファインチューニング(SFT)
マルチティーチャーオンポリシー蒸留(MOPD)
スライディングウィンドウアテンション(SWA)
グローバルアテンション(GA)
MiMo-V2.5-Proをはじめる
ページにアクセス: Hugging Faceモデルページを訪問
モデルをロード: MiMo-V2.5-Proをダウンロード
環境を設定: 推奨パラメータでセットアップ
統合: アプリケーションに実装
ファインチューニング: 特定のタスクにモデルを調整
MiMo-V2.5-Proの使用例
- 複雑なソフトウェアエンジニアリング
- エージェント的タスク
- 多言語アプリケーション
- 長いコンテキストの推論
- 強化学習







