Описание
SmolLM3 — это языковая модель с 3 миллиардами параметров, разработанная для повышения возможностей малых моделей в области искусственного интеллекта. Она предназначена для поддержки двойного режимного рассуждения и является многоязычной, нативно поддерживая шесть языков: английский, французский, испанский, немецкий, итальянский и португальский. Модель полностью открыта, с открытыми весами и подробными данными о тренировках, включая публичные смеси данных и конфигурации обучения.
Архитектура SmolLM3 представляет собой трансформер только для декодирования, использующий GQA и NoPE с соотношением 3:1. Она была предварительно обучена на 11,2 триллионах токенов с использованием поэтапной учебной программы, которая включала данные из веба, кода, математики и рассуждений. После обучения проводилось промежуточное обучение на 140 миллиардах токенов рассуждений, за которым следовало контролируемое дообучение и выравнивание с помощью оптимизации предпочтений с привязкой (APO).
SmolLM3 оптимизирована для гибридного рассуждения и поддерживает обработку длинного контекста, обученная на контексте 64k и способная обрабатывать до 128k токенов с использованием экстраполяции YARN. Модель может быть развернута с использованием vLLM и SGLang, совместима с API формата OpenAI. Она также поддерживает вызов инструментов, позволяя интеграцию с различными инструментами через XML или вызовы функций Python.
Для локального вывода SmolLM3 может использоваться с llama.cpp, ONNX, MLX, MLC и ExecuTorch. Доступны квантизированные контрольные точки для эффективного развертывания. Производительность модели была оценена по различным бенчмаркам, демонстрируя высокие результаты в многоязычных вопросах и ответах, конкурентном программировании и задачах следования инструкциям.
SmolLM3 является ценным инструментом для разработчиков и исследователей, стремящихся использовать ИИ для многоязычных и сложных задач рассуждения. Однако пользователи должны быть осведомлены о том, что сгенерированный контент может не всегда быть фактически точным или свободным от предвзятостей, присутствующих в данных обучения.
Главное о Модель языка SmolLM3
Языковая модель с 3 миллиардами параметров
Поддержка двойного режимного рассуждения
Многоязычность: 6 языков
Обработка длинного контекста до 128k токенов
Открытая модель с открытыми весами
Модель для инструкций, оптимизированная для гибридного рассуждения
Поддержка вызова инструментов
Совместимость с vLLM и SGLang
Начало работы с Модель языка SmolLM3
Доступ к странице: Посетите страницу модели Hugging Face
Загрузите модель: Используйте transformers v4.53.0 или последнюю версию vllm
Настройте окружение: Установите параметры выборки и длину контекста
Интеграция: Используйте вызов инструментов с XML или функциями Python
Дообучение: Примените контролируемое дообучение и выравнивание
Варианты использования Модель языка SmolLM3
- Многоязычные вопросы и ответы
- Гибридное рассуждение
- Интеграция инструментов
- Обработка длинного контекста
- Следование инструкциям









