Aller au contenu principal
ToolPotion

Modèle de Langage SmolLM3

SmolLM3 est un modèle de langage de 3 milliards de paramètres conçu pour repousser les limites des petits modèles. Il prend en charge le raisonnement en mode double, six langues et le traitement de longs contextes, offrant de solides performances à l'échelle de 3B–4B.

Voir le modèle
Partager

Description

SmolLM3 est un modèle de langage de 3 milliards de paramètres développé pour faire progresser les capacités des petits modèles en intelligence artificielle. Il est conçu pour prendre en charge le raisonnement en mode double et est multilingue, prenant en charge nativement six langues : anglais, français, espagnol, allemand, italien et portugais. Le modèle est entièrement ouvert, avec des poids ouverts et des détails de formation complets, y compris des mélanges de données publiques et des configurations d'entraînement.

L'architecture de SmolLM3 est un transformateur uniquement décodeur utilisant GQA et NoPE avec un ratio de 3:1. Il a été préentraîné sur 11,2 trillions de tokens en utilisant un curriculum par étapes qui incluait des données web, de code, de mathématiques et de raisonnement. L'entraînement postérieur a impliqué un entraînement intermédiaire sur 140 milliards de tokens de raisonnement, suivi d'un ajustement supervisé et d'un alignement via l'Optimisation de Préférence Ancrée (APO).

SmolLM3 est optimisé pour le raisonnement hybride et prend en charge le traitement de longs contextes, entraîné sur un contexte de 64k et capable de gérer jusqu'à 128k tokens en utilisant l'extrapolation YARN. Le modèle peut être déployé en utilisant vLLM et SGLang, compatible avec les API au format OpenAI. Il prend également en charge l'appel d'outils, permettant l'intégration avec divers outils via des appels de fonctions XML ou Python.

Pour l'inférence locale, SmolLM3 peut être utilisé avec llama.cpp, ONNX, MLX, MLC et ExecuTorch. Des points de contrôle quantifiés sont disponibles pour un déploiement efficace. Les performances du modèle ont été évaluées à travers divers benchmarks, démontrant de solides résultats dans les tâches de Q&A multilingues, de programmation compétitive et de suivi d'instructions.

SmolLM3 est un outil précieux pour les développeurs et les chercheurs cherchant à tirer parti de l'IA pour des tâches de raisonnement multilingues et complexes. Cependant, les utilisateurs doivent être conscients que le contenu généré peut ne pas toujours être factuellement exact ou exempt de biais présents dans les données d'entraînement.

Points forts de Modèle de Langage SmolLM3

  • Modèle de langage de 3 milliards de paramètres

  • Prend en charge le raisonnement en mode double

  • Multilingue : 6 langues

  • Traitement de longs contextes jusqu'à 128k tokens

  • Modèle ouvert avec des poids ouverts

  • Modèle d'instruction optimisé pour le raisonnement hybride

  • Prise en charge de l'appel d'outils

  • Compatible avec vLLM et SGLang

Premiers pas avec Modèle de Langage SmolLM3

  1. Accéder à la page : Visitez la page du modèle Hugging Face

  2. Charger le modèle : Utilisez transformers v4.53.0 ou la dernière version de vllm

  3. Configurer l'environnement : Définir les paramètres d'échantillonnage et la longueur du contexte

  4. Intégrer : Utilisez l'appel d'outils avec des fonctions XML ou Python

  5. Ajuster : Appliquer un ajustement supervisé et un alignement

Cas d'utilisation de Modèle de Langage SmolLM3

  • Q&A multilingue
  • Raisonnement hybride
  • Intégration d'outils
  • Traitement de longs contextes
  • Suivi d'instructions

FAQ de Modèle de Langage SmolLM3

From Hugging Face

Avis sur Modèle de Langage SmolLM3

Chargement...

Outils IA populaires comme Modèle de Langage SmolLM3

Qwen3-8B est un modèle de langage de grande taille conçu pour un raisonnement avancé, le suivi d'instructions et le support multilingue. Il dispose d'un changement de mode sans…

En vedetteModèles d'IA et LLM

Gemma 3-27B IT est un modèle d'IA multimodal de pointe développé par Google, capable de traiter des entrées textuelles et d'image pour générer des sorties textuelles. Il prend en…

Modèles d'IA et LLM

Falcon3-10B-Instruct est un modèle de langage à la pointe de la technologie, conçu pour des tâches de raisonnement, de compréhension linguistique et de suivi d'instructions. Il…

Modèles d'IA et LLM

Modèles IA

Hy3 Preview de Tencent Hunyuan est un modèle de langage open-source comportant 295 milliards de paramètres. Il excelle dans les tâches mathématiques, de codage et multilingues,…

Modèles d'IA et LLM

Kimi K3 est un modèle IA multimodal avancé à poids ouvert conçu pour le codage à long terme, le travail de connaissance et le raisonnement. Il dispose d'une fenêtre de contexte de…

En vedetteModèles d'IA et LLM

Phi-4-reasoning-plus est un modèle de raisonnement à la pointe de la technologie développé par Microsoft Research. Il est affiné à partir de Phi-4 en utilisant l'apprentissage…

Modèles d'IA et LLM

Mistral Small 4 est un modèle IA polyvalent qui unifie le raisonnement, la programmation et les capacités multimodales en une seule plateforme. Il permet aux utilisateurs de…

En vedetteModèles d'IA et LLM

Llama-3.1-8B-Instruct est un modèle de langage large multilingue développé par Meta, optimisé pour les tâches basées sur des instructions. Il est conçu pour des applications…

En vedetteModèles d'IA et LLM