跳转到主要内容
ToolPotion

SmolLM3语言模型

SmolLM3是一个拥有30亿参数的语言模型,旨在推动小型模型的边界。它支持双模式推理、六种语言和长上下文处理,在30亿到40亿规模上提供强大的性能。

查看模型
分享

描述

SmolLM3是一个拥有30亿参数的语言模型,旨在提升人工智能中小型模型的能力。它设计支持双模式推理,并且是多语言的,原生支持六种语言:英语、法语、西班牙语、德语、意大利语和葡萄牙语。该模型完全开放,具有开放权重和全面的训练细节,包括公共数据混合和训练配置。

SmolLM3的架构是一个仅解码器的变换器,使用GQA和NoPE,比例为3:1。它在112万亿个标记上进行了预训练,采用了包括网络、代码、数学和推理数据的分阶段课程。后期训练涉及在1400亿个推理标记上的中期训练,随后通过锚定偏好优化(APO)进行监督微调和对齐。

SmolLM3针对混合推理进行了优化,支持长上下文处理,训练于64k上下文,并能够使用YARN外推处理多达128k个标记。该模型可以使用vLLM和SGLang进行部署,兼容OpenAI格式的API。它还支持工具调用,允许通过XML或Python函数调用与各种工具集成。

对于本地推理,SmolLM3可以与llama.cpp、ONNX、MLX、MLC和ExecuTorch一起使用。量化检查点可用于高效部署。该模型的性能已在各种基准测试中进行评估,显示出在多语言问答、竞争编程和指令跟随任务中的强大表现。

SmolLM3是开发者和研究人员利用人工智能进行多语言和复杂推理任务的宝贵工具。然而,用户应注意,生成的内容可能并不总是事实准确或不受训练数据中存在的偏见影响。

SmolLM3语言模型亮点

  • 30亿参数语言模型

  • 支持双模式推理

  • 多语言:6种语言

  • 长上下文处理,最多128k个标记

  • 开放模型,具有开放权重

  • 针对混合推理优化的指令模型

  • 支持工具调用

  • 与vLLM和SGLang兼容

SmolLM3语言模型入门

  1. 访问页面:访问Hugging Face模型页面

  2. 加载模型:使用transformers v4.53.0或最新的vllm

  3. 配置环境:设置采样参数和上下文长度

  4. 集成:使用XML或Python函数进行工具调用

  5. 微调:应用监督微调和对齐

SmolLM3语言模型的使用案例

  • 多语言问答
  • 混合推理
  • 工具集成
  • 长上下文处理
  • 指令跟随

SmolLM3语言模型的常见问题

From Hugging Face

SmolLM3语言模型 评价

加载中...

与 SmolLM3语言模型 类似的热门AI工具

Qwen3-8B 是一个大型语言模型,旨在实现高级推理、遵循指令和多语言支持。它具有无缝模式切换功能,以在各种场景中实现最佳性能,使其适用于人工智能的多种应用。

精选AI 模型与大语言模型

Gemma 3-27B IT 是谷歌推出的最先进的多模态 AI 模型,能够处理文本和图像输入以生成文本输出。它支持超过 140 种语言,并设计用于在资源有限的环境中高效部署。

AI 模型与大语言模型

Falcon3-10B-Instruct 是一款先进的语言模型,旨在进行推理、语言理解和遵循指令的任务。它支持多种语言,并提供较长的上下文长度以增强理解能力。

AI 模型与大语言模型

AI 模型

腾讯混元的 Hy3 预览是一个开源语言模型,具有 2950 亿个参数。它在数学、编码和多语言任务中表现出色,提供与 256K 上下文窗口相竞争的性能。可在腾讯云和 OpenRouter 上使用。

AI 模型与大语言模型

Kimi K3是一款先进的开放权重多模态AI模型,旨在进行长时间编码、知识工作和推理。它具有100万标记的上下文窗口,并基于创新架构构建,以提高效率和性能。

精选AI 模型与大语言模型

Phi-4-reasoning-plus 是由微软研究院开发的最先进的推理模型。它通过监督学习和强化学习对 Phi-4 进行了微调,旨在处理数学、科学和编码中的高级推理任务。

AI 模型与大语言模型

Mistral Small 4是一个多功能的AI模型,将推理、编码和多模态能力统一到一个平台中。它允许用户高效地自定义、微调和部署AI助手和代理,非常适合各种企业应用。

精选AI 模型与大语言模型

Llama-3.1-8B-Instruct 是由 Meta 开发的多语言大型语言模型,针对基于指令的任务进行了优化。它旨在商业和研究应用中提供自然语言理解和生成的高级能力。

精选AI 模型与大语言模型