跳转到主要内容
ToolPotion

MiMo-V2.5-Pro

MiMo-V2.5-Pro 是一个先进的开源混合专家语言模型,旨在处理复杂任务。它具有混合注意力架构,支持最长 100 万个标记的上下文长度,非常适合要求高的软件工程和长时间跨度的任务。

查看模型
分享

描述

MiMo-V2.5-Pro 是一个前沿的开源混合专家 (MoE) 语言模型,拥有 1.02 万亿个参数和 420 亿个活跃参数。它旨在处理最具挑战性的代理性、复杂的软件工程和长时间跨度的任务。该模型利用混合注意力架构,以 6:1 的比例交错使用滑动窗口注意力 (SWA) 和全局注意力 (GA),显著减少 KV-cache 存储,同时保持长上下文性能。这种架构辅以三个轻量级的多标记预测 (MTP) 模块,增强了推理过程中的输出速度。

该模型在 27 万亿个标记上进行了预训练,使用 FP8 混合精度,并支持最长 100 万个标记的上下文窗口。训练后,MiMo-V2.5-Pro 采用监督微调 (SFT)、大规模代理性强化学习 (RL) 和多教师在线蒸馏 (MOPD) 方法,以在复杂任务中实现卓越性能。它在 100 万个标记的上下文窗口中保持复杂轨迹的能力,使其在需要强指令跟随和连贯性的任务中表现出色。

MiMo-V2.5-Pro 的架构通过整合局部滑动窗口注意力和全局注意力来解决长上下文的平方复杂性。其训练过程包括一个三阶段的后训练范式,首先进行 SFT 以建立基础技能,然后进行多样化教师模型的领域专门训练,最后以 MOPD 进行动态在线政策强化学习。

该模型的部署得到了 SGLang 和 vLLM 社区的支持,并提供了推荐配置以实现最佳性能。MiMo-V2.5-Pro 非常适合需要先进语言处理能力的行业,如软件工程和多语言应用。

MiMo-V2.5-Pro亮点

  • 1.02T 总参数

  • 42B 活跃参数

  • 混合注意力架构

  • 多标记预测 (MTP)

  • 在 27T 标记上高效预训练

  • 1M 标记上下文长度

  • 监督微调 (SFT)

  • 多教师在线蒸馏 (MOPD)

  • 滑动窗口注意力 (SWA)

  • 全局注意力 (GA)

MiMo-V2.5-Pro入门

  1. 访问页面:访问 Hugging Face 模型页面

  2. 加载模型:下载 MiMo-V2.5-Pro

  3. 配置环境:使用推荐参数进行设置

  4. 集成:在您的应用程序中实现

  5. 微调:根据特定任务调整模型

MiMo-V2.5-Pro的使用案例

  • 复杂软件工程
  • 代理性任务
  • 多语言应用
  • 长上下文推理
  • 强化学习

MiMo-V2.5-Pro的常见问题

From Xiaomi

a model in MiMo.

MiMo-V2.5-Pro 评价

加载中...

与 MiMo-V2.5-Pro 类似的热门AI工具

DeepSeek-V3 是一个具有 6710 亿参数的专家混合语言模型,旨在实现高效推理和经济实惠的训练。它在各种基准测试中表现出色,展示了在自然语言处理任务中的强大性能。

精选AI 模型与大语言模型

DeepSeek-V4-Pro是一个先进的AI模型,旨在实现高效的百万标记上下文智能。它具有混合注意力架构,并在超过32万亿个标记上进行了预训练,适用于复杂推理任务和编码基准。

精选AI 模型与大语言模型

Kimi K3是一款先进的开放权重多模态AI模型,旨在进行长时间编码、知识工作和推理。它具有100万标记的上下文窗口,并基于创新架构构建,以提高效率和性能。

精选AI 模型与大语言模型

MiMo-V2.5是小米推出的旗舰AI模型,具备万亿参数能力,旨在提升现实世界的生产力。它在长时间任务中表现出色,支持在单一上下文中处理多达100万的tokens,非常适合复杂项目。

AI 模型与大语言模型

Kimi-K2-Instruct 是一款先进的混合专家语言模型,专为高级人工智能任务而设计。它在推理、编码和工具使用方面表现出色,提供了32亿激活参数的强大性能。

AI 模型与大语言模型

NVIDIA Nemotron 3 Ultra是一款强大的AI模型,旨在处理复杂推理和多语言任务。它拥有5500亿个参数,在长文本分析和工具使用方面表现出色,适用于各个行业的高风险应用。

精选AI 模型与大语言模型

Longformer Base 4096 是一款为处理长文档而设计的 Transformer 模型。它基于 RoBERTa,并在最长 4096 个 token 的扩展序列上进行了预训练。该模型采用混合注意力机制,结合了滑动窗口和全局注意力,以实现高效的长文档理解和特定任务的表征学习。

AI 模型与大语言模型

DeepSeek-v3 提供即时 AI 解决方案,由先进的 MoE 架构和最先进的语言模型驱动。通过这款稳定、免费且无限制的模型体验尖端 AI 功能,该模型专为各种硬件部署的高效推理和多语言支持而设计。

AI 模型与大语言模型