描述
MiMo-V2.5-Pro 是一个前沿的开源混合专家 (MoE) 语言模型,拥有 1.02 万亿个参数和 420 亿个活跃参数。它旨在处理最具挑战性的代理性、复杂的软件工程和长时间跨度的任务。该模型利用混合注意力架构,以 6:1 的比例交错使用滑动窗口注意力 (SWA) 和全局注意力 (GA),显著减少 KV-cache 存储,同时保持长上下文性能。这种架构辅以三个轻量级的多标记预测 (MTP) 模块,增强了推理过程中的输出速度。
该模型在 27 万亿个标记上进行了预训练,使用 FP8 混合精度,并支持最长 100 万个标记的上下文窗口。训练后,MiMo-V2.5-Pro 采用监督微调 (SFT)、大规模代理性强化学习 (RL) 和多教师在线蒸馏 (MOPD) 方法,以在复杂任务中实现卓越性能。它在 100 万个标记的上下文窗口中保持复杂轨迹的能力,使其在需要强指令跟随和连贯性的任务中表现出色。
MiMo-V2.5-Pro 的架构通过整合局部滑动窗口注意力和全局注意力来解决长上下文的平方复杂性。其训练过程包括一个三阶段的后训练范式,首先进行 SFT 以建立基础技能,然后进行多样化教师模型的领域专门训练,最后以 MOPD 进行动态在线政策强化学习。
该模型的部署得到了 SGLang 和 vLLM 社区的支持,并提供了推荐配置以实现最佳性能。MiMo-V2.5-Pro 非常适合需要先进语言处理能力的行业,如软件工程和多语言应用。
MiMo-V2.5-Pro亮点
1.02T 总参数
42B 活跃参数
混合注意力架构
多标记预测 (MTP)
在 27T 标记上高效预训练
1M 标记上下文长度
监督微调 (SFT)
多教师在线蒸馏 (MOPD)
滑动窗口注意力 (SWA)
全局注意力 (GA)
MiMo-V2.5-Pro入门
访问页面:访问 Hugging Face 模型页面
加载模型:下载 MiMo-V2.5-Pro
配置环境:使用推荐参数进行设置
集成:在您的应用程序中实现
微调:根据特定任务调整模型
MiMo-V2.5-Pro的使用案例
- 复杂软件工程
- 代理性任务
- 多语言应用
- 长上下文推理
- 强化学习







