Langsung ke konten utama
ToolPotion

Model Bahasa SmolLM3

SmolLM3 adalah model bahasa dengan 3 miliar parameter yang dirancang untuk mendorong batasan model kecil. Model ini mendukung penalaran mode ganda, enam bahasa, dan pemrosesan konteks panjang, menawarkan kinerja yang kuat pada skala 3B–4B.

Lihat Model
Bagikan

Deskripsi

SmolLM3 adalah model bahasa dengan 3 miliar parameter yang dikembangkan untuk meningkatkan kemampuan model kecil dalam kecerdasan buatan. Model ini dirancang untuk mendukung penalaran mode ganda dan bersifat multibahasa, secara native mendukung enam bahasa: Inggris, Prancis, Spanyol, Jerman, Italia, dan Portugis. Model ini sepenuhnya terbuka, dengan bobot terbuka dan rincian pelatihan yang komprehensif, termasuk campuran data publik dan konfigurasi pelatihan.

Arsitektur SmolLM3 adalah transformer hanya decoder yang menggunakan GQA dan NoPE dengan rasio 3:1. Model ini dilatih sebelumnya pada 11,2 triliun token menggunakan kurikulum bertahap yang mencakup data web, kode, matematika, dan penalaran. Setelah pelatihan, dilakukan pelatihan menengah pada 140 miliar token penalaran, diikuti dengan fine-tuning terawasi dan penyelarasan melalui Optimisasi Preferensi Berbasis (APO).

SmolLM3 dioptimalkan untuk penalaran hibrida dan mendukung pemrosesan konteks panjang, dilatih pada konteks 64k dan mampu menangani hingga 128k token menggunakan eksrapolasi YARN. Model ini dapat diterapkan menggunakan vLLM dan SGLang, kompatibel dengan API format OpenAI. Model ini juga mendukung pemanggilan alat, memungkinkan integrasi dengan berbagai alat melalui panggilan fungsi XML atau Python.

Untuk inferensi lokal, SmolLM3 dapat digunakan dengan llama.cpp, ONNX, MLX, MLC, dan ExecuTorch. Titik pemeriksaan terkuantisasi tersedia untuk penerapan yang efisien. Kinerja model telah dievaluasi di berbagai tolok ukur, menunjukkan hasil yang kuat dalam Q&A multibahasa, pemrograman kompetitif, dan tugas mengikuti instruksi.

SmolLM3 adalah alat yang berharga bagi pengembang dan peneliti yang ingin memanfaatkan AI untuk tugas penalaran multibahasa dan kompleks. Namun, pengguna harus menyadari bahwa konten yang dihasilkan mungkin tidak selalu akurat secara faktual atau bebas dari bias yang ada dalam data pelatihan.

Sorotan Model Bahasa SmolLM3

  • Model bahasa dengan 3 miliar parameter

  • Mendukung penalaran mode ganda

  • Multibahasa: 6 bahasa

  • Pemrosesan konteks panjang hingga 128k token

  • Model terbuka dengan bobot terbuka

  • Model instruksi dioptimalkan untuk penalaran hibrida

  • Dukungan pemanggilan alat

  • Kompatibel dengan vLLM dan SGLang

Memulai dengan Model Bahasa SmolLM3

  1. Akses halaman: Kunjungi halaman model Hugging Face

  2. Muat model: Gunakan transformers v4.53.0 atau vllm terbaru

  3. Konfigurasi lingkungan: Atur parameter sampling dan panjang konteks

  4. Integrasi: Gunakan pemanggilan alat dengan fungsi XML atau Python

  5. Fine-tune: Terapkan fine-tuning terawasi dan penyelarasan

Kasus Penggunaan Model Bahasa SmolLM3

  • Q&A Multibahasa
  • Penalaran Hibrida
  • Integrasi Alat
  • Pemrosesan Konteks Panjang
  • Mengikuti Instruksi

FAQ dari Model Bahasa SmolLM3

From Hugging Face

Ulasan Model Bahasa SmolLM3

Memuat...

Alat AI Populer Seperti Model Bahasa SmolLM3

Qwen3-8B adalah model bahasa besar yang dirancang untuk penalaran lanjutan, mengikuti instruksi, dan dukungan multibahasa. Model ini memiliki kemampuan beralih mode yang mulus…

UnggulanModel AI & LLM

Model IT Gemma 3-27B adalah model AI multimodal canggih dari Google, mampu menangani input teks dan gambar untuk menghasilkan output teks. Model ini mendukung lebih dari 140…

Model AI & LLM

Falcon3-10B-Instruct adalah model bahasa mutakhir yang dirancang untuk tugas penalaran, pemahaman bahasa, dan mengikuti instruksi. Model ini mendukung berbagai bahasa dan…

Model AI & LLM

Model AI

Hy3 Preview oleh Tencent Hunyuan adalah model bahasa sumber terbuka yang memiliki 295 miliar parameter. Model ini unggul dalam tugas matematika, pemrograman, dan multibahasa,…

Model AI & LLM

Kimi K3 adalah model AI multimodal open-weight canggih yang dirancang untuk pengkodean jangka panjang, pekerjaan pengetahuan, dan penalaran. Model ini memiliki jendela konteks 1…

UnggulanModel AI & LLM

Phi-4-reasoning-plus adalah model penalaran mutakhir yang dikembangkan oleh Microsoft Research. Model ini disesuaikan dari Phi-4 menggunakan pembelajaran terawasi dan pembelajaran…

Model AI & LLM

Mistral Small 4 adalah model AI serbaguna yang menggabungkan kemampuan penalaran, pengkodean, dan multimodal ke dalam satu platform. Ini memungkinkan pengguna untuk menyesuaikan,…

UnggulanModel AI & LLM

Llama-3.1-8B-Instruct adalah model bahasa besar multibahasa yang dikembangkan oleh Meta, dioptimalkan untuk tugas berbasis instruksi. Model ini dirancang untuk aplikasi komersial…

UnggulanModel AI & LLM