Zum Hauptinhalt springen
ToolPotion

SmolLM3 Sprachmodell

SmolLM3 ist ein Sprachmodell mit 3 Milliarden Parametern, das entwickelt wurde, um die Grenzen kleiner Modelle zu erweitern. Es unterstützt duales Modus-Reasoning, sechs Sprachen und die Verarbeitung langer Kontexte und bietet starke Leistungen im Bereich von 3B–4B.

Modell ansehen
Teilen

Beschreibung

SmolLM3 ist ein Sprachmodell mit 3 Milliarden Parametern, das entwickelt wurde, um die Fähigkeiten kleiner Modelle in der künstlichen Intelligenz voranzutreiben. Es ist darauf ausgelegt, duales Modus-Reasoning zu unterstützen und ist mehrsprachig, wobei es nativ sechs Sprachen unterstützt: Englisch, Französisch, Spanisch, Deutsch, Italienisch und Portugiesisch. Das Modell ist vollständig offen, mit offenen Gewichten und umfassenden Trainingsdetails, einschließlich öffentlicher Datenmischungen und Trainingskonfigurationen.

Die Architektur von SmolLM3 ist ein Decoder-Only-Transformer, der GQA und NoPE im Verhältnis 3:1 verwendet. Es wurde auf 11,2 Billionen Tokens vortrainiert, wobei ein gestuftes Curriculum verwendet wurde, das Web-, Code-, Mathematik- und Reasoning-Daten umfasste. Nach dem Training fand ein Midtraining auf 140 Milliarden Reasoning-Tokens statt, gefolgt von überwachten Feinabstimmungen und Ausrichtungen durch Anchored Preference Optimization (APO).

SmolLM3 ist für hybrides Reasoning optimiert und unterstützt die Verarbeitung langer Kontexte, trainiert auf einem Kontext von 64k und in der Lage, bis zu 128k Tokens mithilfe von YARN-Extrapolation zu verarbeiten. Das Modell kann mit vLLM und SGLang bereitgestellt werden und ist mit OpenAI-Format-APIs kompatibel. Es unterstützt auch das Tool-Calling, was die Integration mit verschiedenen Tools über XML oder Python-Funktionsaufrufe ermöglicht.

Für lokale Inferenz kann SmolLM3 mit llama.cpp, ONNX, MLX, MLC und ExecuTorch verwendet werden. Quantisierte Checkpoints sind für eine effiziente Bereitstellung verfügbar. Die Leistung des Modells wurde anhand verschiedener Benchmarks bewertet und zeigt starke Ergebnisse in mehrsprachigen Q&A, wettbewerbsorientiertem Programmieren und Aufgaben zur Befolgung von Anweisungen.

SmolLM3 ist ein wertvolles Werkzeug für Entwickler und Forscher, die KI für mehrsprachige und komplexe Reasoning-Aufgaben nutzen möchten. Benutzer sollten jedoch beachten, dass die generierten Inhalte möglicherweise nicht immer faktisch genau oder frei von Vorurteilen sind, die in den Trainingsdaten vorhanden sind.

SmolLM3 Sprachmodell im Überblick

  • 3B-Parameter-Sprachmodell

  • Unterstützt duales Modus-Reasoning

  • Mehrsprachig: 6 Sprachen

  • Verarbeitung langer Kontexte bis zu 128k Tokens

  • Offenes Modell mit offenen Gewichten

  • Instruct-Modell optimiert für hybrides Reasoning

  • Unterstützung für Tool-Calling

  • Kompatibel mit vLLM und SGLang

Erste Schritte mit SmolLM3 Sprachmodell

  1. Zugriff auf die Seite: Besuchen Sie die Hugging Face-Modellseite

  2. Modell laden: Verwenden Sie transformers v4.53.0 oder die neueste vllm

  3. Umgebung konfigurieren: Sampling-Parameter und Kontextlänge festlegen

  4. Integrieren: Verwenden Sie Tool-Calling mit XML oder Python-Funktionen

  5. Feinabstimmung: Wenden Sie überwachte Feinabstimmung und Ausrichtung an

SmolLM3 Sprachmodell's Anwendungsfälle

  • Mehrsprachige Q&A
  • Hybrides Reasoning
  • Tool-Integration
  • Verarbeitung langer Kontexte
  • Befolgung von Anweisungen

FAQ von SmolLM3 Sprachmodell

From Hugging Face

SmolLM3 Sprachmodell Bewertungen

Wird geladen...

Beliebte KI-Tools wie SmolLM3 Sprachmodell

Qwen3-8B ist ein großes Sprachmodell, das für fortgeschrittenes Denken, das Befolgen von Anweisungen und mehrsprachige Unterstützung entwickelt wurde. Es bietet nahtloses…

EmpfohlenKI-Modelle & LLMs

Gemma 3-27B IT ist ein hochmodernes multimodales KI-Modell von Google, das in der Lage ist, Text- und Bilddaten zu verarbeiten, um Textausgaben zu generieren. Es unterstützt über…

KI-Modelle & LLMs

Falcon3-10B-Instruct ist ein hochmodernes Sprachmodell, das für Aufgaben in den Bereichen Denken, Sprachverständnis und Befolgen von Anweisungen entwickelt wurde. Es unterstützt…

KI-Modelle & LLMs

KI-Modelle

Hy3 Vorschau von Tencent Hunyuan ist ein Open-Source-Sprachmodell mit 295 Milliarden Parametern. Es glänzt in Mathematik, Programmierung und mehrsprachigen Aufgaben und bietet…

KI-Modelle & LLMs

Kimi K3 ist ein fortschrittliches, offenes multimodales KI-Modell, das für langfristiges Codieren, Wissensarbeit und logisches Denken entwickelt wurde. Es verfügt über ein…

EmpfohlenKI-Modelle & LLMs

Phi-4-reasoning-plus ist ein hochmodernes Denkmodell, das von Microsoft Research entwickelt wurde. Es wurde aus Phi-4 durch überwachtes Lernen und verstärkendes Lernen…

KI-Modelle & LLMs

Mistral Small 4 ist ein vielseitiges KI-Modell, das Denken, Programmierung und multimodale Fähigkeiten in einer einzigen Plattform vereint. Es ermöglicht Benutzern, KI-Assistenten…

EmpfohlenKI-Modelle & LLMs

Llama-3.1-8B-Instruct ist ein mehrsprachiges großes Sprachmodell, das von Meta entwickelt wurde und für auf Anweisungen basierende Aufgaben optimiert ist. Es ist für kommerzielle…

EmpfohlenKI-Modelle & LLMs