描述
Phi-4-reasoning-plus 是由微软研究院开发的高级推理模型。它通过在链式思维轨迹数据集上进行监督学习和强化学习,从 Phi-4 模型微调而来。该模型旨在在推理任务中表现出色,特别是在数学、科学和编码方面。它采用了一个具有 140 亿参数的密集解码器仅 Transformer 架构,并针对文本输入进行了优化,尤其是在聊天格式中。模型的训练涉及 160 亿个标记,约有 83 亿个独特标记,使用 32 个 H100-80G GPU 在 2.5 天内完成。该模型生成的文本响应包含推理链式思维块,后跟总结块,使其适合需要深度、多步骤推理或广泛上下文的任务。
Phi-4-reasoning-plus 已在多个基准上进行了评估,包括 AIME、GPQA-Diamond、OmniMath 和 LiveCodeBench,展示了在推理密集型任务中的强大表现。该模型还支持 Ollama、llama.cpp 和任何与 Phi-4 兼容的框架。它在 MIT 许可证下发布,旨在用于通用 AI 系统和应用,特别是在内存/计算受限的环境和延迟受限的场景中。
该模型通过监督微调采用了强大的安全后训练方法,遵循微软的安全指南。它经过了广泛的安全评估,包括对抗性对话模拟和微软独立 AI 红队的评估。尽管具备强大能力,开发者仍应意识到模型的局限性,例如潜在的偏见、不准确性以及在选举关键查询中的缺陷率升高。鼓励开发者在部署模型时应用负责任的 AI 最佳实践,并确保遵守相关法律法规。
Phi-4-reasoning-plus 模型亮点
最先进的推理模型
从 Phi-4 微调而来
140 亿参数
密集解码器仅 Transformer 架构
在 160 亿个标记上训练
支持聊天格式输入
生成推理链式思维和总结块
强大的安全后训练方法
Phi-4-reasoning-plus 模型入门
访问页面:访问 Hugging Face 模型页面
加载模型:下载并加载 Phi-4-reasoning-plus 模型
配置环境:设置所需依赖的环境
集成:在您的应用中使用该模型
微调:如有必要,调整模型以适应特定任务
Phi-4-reasoning-plus 模型的使用案例
- 高级推理
- 编码辅助
- 研究加速
- 通用 AI
- 内存受限环境








