描述
Qwen3.8-Flash-Next 是 Hugging Face 开发的实验性 AI 模型,旨在通过开源和开放科学倡议推动人工智能的边界。该模型是实现人工通用智能 (AGI) 的重要一步,通过引入架构创新来提高大型语言模型 (LLMs) 的效率。
该代码库包含与 Hugging Face Transformers、vLLM、SGLang 和 TokenSpeed 兼容的模型权重和配置文件。希望进行托管和可扩展推理的用户可以利用 Qwen Cloud 提供的官方 Qwen API 服务。Qwen3.8-Flash 版本在 Qwen3.8-Flash-Next 的基础上构建,提供额外的生产特性,如默认上下文长度为 100 万个标记和内置工具。
Qwen3.8-Flash-Next 引入了几个关键创新,包括具有 Qwen 稀疏注意力 (QSA) 的混合注意力,通过在微块级别处理显著减少长上下文延迟。门控残差机制通过残差流增强信息流动,保持训练稳定性,同时允许更大的表现力。此外,该模型采用 N-gram 嵌入以实现高效的参数缩放,量身定制的训练配方以优化学习率,以及支持高达 100 万个标记的上下文长度的独特架构。
该模型特别适合需要高级自然语言理解、编码任务和多模态应用的 AI 领域开发者和研究人员。凭借其强大的架构和可扩展的特性,Qwen3.8-Flash-Next 有望在软件工程、科学推理和一般指令遵循等多个领域促进创新解决方案。
Qwen3.8-Flash-Next亮点
模型类型:具有视觉编码器的因果语言模型
参数数量:125B
激活参数:6B
N-gram 嵌入参数:51B
上下文长度:1,000,000 个标记
训练阶段:预训练和后训练
混合注意力:是
门控残差:是
量身定制的训练配方:是
API 可用:是
Qwen3.8-Flash-Next入门
访问页面:访问 Hugging Face 上的 Qwen3.8-Flash-Next 代码库。
加载模型:下载模型权重和配置文件。
配置环境:设置与兼容框架的开发环境。
集成:通过提供的 API 在应用程序中使用该模型。
微调:根据特定任务调整模型参数。
Qwen3.8-Flash-Next的使用案例
- 自然语言处理
- 软件工程
- 科学研究
- 多模态应用
- 指令遵循









