メインコンテンツへスキップ
ToolPotion

MiMo-V2.5-Pro

MiMo-V2.5-Proは、複雑なタスク向けに設計された高度なオープンソースのMixture-of-Experts言語モデルです。ハイブリッドアテンションアーキテクチャを特徴とし、最大1Mトークンのコンテキスト長をサポートしているため、要求の厳しいソフトウェアエンジニアリングや長期的なタスクに最適です。

モデルを見る
共有

説明

MiMo-V2.5-Proは、1.02兆のパラメータと420億のアクティブパラメータを持つ最先端のオープンソースMixture-of-Experts(MoE)言語モデルです。最も要求の厳しいエージェント的で複雑なソフトウェアエンジニアリングおよび長期的なタスクを処理するように設計されています。このモデルは、スライディングウィンドウアテンション(SWA)とグローバルアテンション(GA)を6:1の比率で交互に使用するハイブリッドアテンションアーキテクチャを利用しており、長いコンテキストのパフォーマンスを維持しながらKVキャッシュストレージを大幅に削減します。このアーキテクチャは、推論中の出力速度を向上させる3つの軽量マルチトークン予測(MTP)モジュールによって補完されています。

このモデルは、FP8混合精度を使用して27兆トークンで事前トレーニングされており、最大1百万トークンのコンテキストウィンドウをサポートしています。トレーニング後、MiMo-V2.5-Proは、複雑なタスクにおける優れたパフォーマンスを達成するために、教師ありファインチューニング(SFT)、大規模なエージェント的強化学習(RL)、およびマルチティーチャーオンポリシー蒸留(MOPD)を採用しています。1Mトークンのコンテキストウィンドウで複雑な軌道を維持するのに優れており、強力な指示の遵守と一貫性を必要とするタスクに非常に効果的です。

MiMo-V2.5-Proのアーキテクチャは、ローカルスライディングウィンドウアテンションとグローバルアテンションを統合することで、長いコンテキストの二次的な複雑さに対処しています。そのトレーニングプロセスには、基礎的なスキルを構築するためのSFTから始まり、多様な教師モデルを用いたドメイン特化型トレーニングを経て、動的なオンポリシーRLのためのMOPDで締めくくる3段階のポストトレーニングパラダイムが含まれています。

このモデルの展開は、SGLangおよびvLLMコミュニティによってサポートされており、最適なパフォーマンスのための推奨設定があります。MiMo-V2.5-Proは、ソフトウェアエンジニアリングや多言語アプリケーションなど、高度な言語処理能力を必要とする業界に最適です。

MiMo-V2.5-Proのハイライト

  • 1.02Tの総パラメータ

  • 42Bのアクティブパラメータ

  • ハイブリッドアテンションアーキテクチャ

  • マルチトークン予測(MTP)

  • 27Tトークンでの効率的な事前トレーニング

  • 1Mトークンのコンテキスト長

  • 教師ありファインチューニング(SFT)

  • マルチティーチャーオンポリシー蒸留(MOPD)

  • スライディングウィンドウアテンション(SWA)

  • グローバルアテンション(GA)

MiMo-V2.5-Proをはじめる

  1. ページにアクセス: Hugging Faceモデルページを訪問

  2. モデルをロード: MiMo-V2.5-Proをダウンロード

  3. 環境を設定: 推奨パラメータでセットアップ

  4. 統合: アプリケーションに実装

  5. ファインチューニング: 特定のタスクにモデルを調整

MiMo-V2.5-Proの使用例

  • 複雑なソフトウェアエンジニアリング
  • エージェント的タスク
  • 多言語アプリケーション
  • 長いコンテキストの推論
  • 強化学習

MiMo-V2.5-ProのFAQ

From Xiaomi

a model in MiMo.

MiMo-V2.5-Pro のレビュー

読み込み中...

MiMo-V2.5-Pro に似た人気のAIツール

DeepSeek-V3は、6710億のパラメータを持つMixture-of-Experts言語モデルで、効率的な推論とコスト効果の高いトレーニングを目的としています。自然言語処理タスクにおいて強力なパフォーマンスを示し、さまざまなベンチマークで優れた結果を出しています。

注目AIモデルとLLM

DeepSeek-V4-Proは、効率的な百万トークンコンテキストインテリジェンスのために設計された高度なAIモデルです。ハイブリッドアテンションアーキテクチャを特徴とし、32兆トークン以上で事前学習されており、複雑な推論タスクやコーディングベンチマークに適しています。

注目AIモデルとLLM

Kimi K3は、長期的なコーディング、知識作業、推論のために設計された高度なオープンウェイトのマルチモーダルAIモデルです。1百万トークンのコンテキストウィンドウを備え、効率とパフォーマンスを向上させる革新的なアーキテクチャに基づいています。

注目AIモデルとLLM

MiMo-V2.5は、XiaomiによるフラッグシップAIモデルで、現実世界の生産性向上のためにトリリオンパラメータの能力を提供します。長期的なタスクに優れ、単一のコンテキストで最大1Mトークンをサポートし、複雑なプロジェクトに最適です。

AIモデルとLLM

Kimi-K2-Instructは、高度なAIタスク向けに設計された最先端のミクスチャー・オブ・エキスパート言語モデルです。推論、コーディング、ツール使用に優れ、320億のアクティブパラメータを持つ堅牢なパフォーマンスを提供します。

AIモデルとLLM

NVIDIA Nemotron 3 Ultraは、複雑な推論と多言語タスクのために設計された強力なAIモデルです。5500億のパラメータを持ち、長文コンテキスト分析とツール使用に優れており、さまざまな業界での高リスクアプリケーションに最適です。

注目AIモデルとLLM

Longformer Base 4096 は、長文ドキュメントの処理に特化したTransformerモデルです。RoBERTaをベースとし、最大4,096トークンの拡張シーケンスで事前学習されています。このモデルは、スライディングウィンドウとグローバルアテンションを組み合わせたハイブリッドアテンションメカニズムを採用し、効率的な長文理解とタスク固有の表現学習…

AIモデルとLLM

DeepSeek-v3は、高度なMoEアーキテクチャと最先端の言語モデルにより、即時のAIソリューションを提供します。この安定した無料かつ無制限のモデルで、効率的な推論と多様なハードウェア展開における多言語サポートを備えた最先端のAI機能を体験してください。

AIモデルとLLM