Descripción
SmolLM3 es un modelo de lenguaje de 3 mil millones de parámetros desarrollado para avanzar en las capacidades de los modelos pequeños en inteligencia artificial. Está diseñado para soportar razonamiento en modo dual y es multilingüe, soportando nativamente seis idiomas: inglés, francés, español, alemán, italiano y portugués. El modelo es completamente abierto, con pesos abiertos y detalles de entrenamiento completos, incluyendo mezclas de datos públicos y configuraciones de entrenamiento.
La arquitectura de SmolLM3 es un transformador solo de decodificador que utiliza GQA y NoPE con una proporción de 3:1. Fue preentrenado en 11.2 billones de tokens utilizando un currículo escalonado que incluía datos de web, código, matemáticas y razonamiento. El post-entrenamiento involucró un entrenamiento intermedio en 140 mil millones de tokens de razonamiento, seguido de un ajuste fino supervisado y alineación a través de la Optimización de Preferencia Anclada (APO).
SmolLM3 está optimizado para razonamiento híbrido y soporta procesamiento de contexto largo, entrenado en un contexto de 64k y capaz de manejar hasta 128k tokens utilizando extrapolación YARN. El modelo puede ser desplegado utilizando vLLM y SGLang, compatible con APIs en formato OpenAI. También soporta llamadas a herramientas, permitiendo la integración con varias herramientas a través de llamadas a funciones XML o Python.
Para inferencia local, SmolLM3 puede ser utilizado con llama.cpp, ONNX, MLX, MLC y ExecuTorch. Se encuentran disponibles puntos de control cuantizados para un despliegue eficiente. El rendimiento del modelo ha sido evaluado en varios benchmarks, demostrando resultados sólidos en tareas de Q&A multilingüe, programación competitiva y seguimiento de instrucciones.
SmolLM3 es una herramienta valiosa para desarrolladores e investigadores que buscan aprovechar la IA para tareas de razonamiento multilingüe y complejas. Sin embargo, los usuarios deben ser conscientes de que el contenido generado puede no ser siempre factualmente preciso o estar libre de sesgos presentes en los datos de entrenamiento.
Aspectos destacados de Modelo de Lenguaje SmolLM3
Modelo de lenguaje de 3 mil millones de parámetros
Soporta razonamiento en modo dual
Multilingüe: 6 idiomas
Procesamiento de contexto largo de hasta 128k tokens
Modelo abierto con pesos abiertos
Modelo instruccional optimizado para razonamiento híbrido
Soporte para llamadas a herramientas
Compatible con vLLM y SGLang
Primeros pasos con Modelo de Lenguaje SmolLM3
Acceder a la página: Visita la página del modelo en Hugging Face
Cargar modelo: Usa transformers v4.53.0 o la última versión de vllm
Configurar entorno: Establece parámetros de muestreo y longitud de contexto
Integrar: Usa llamadas a herramientas con funciones XML o Python
Ajustar: Aplica ajuste fino supervisado y alineación
Casos de uso de Modelo de Lenguaje SmolLM3
- Q&A Multilingüe
- Razonamiento Híbrido
- Integración de Herramientas
- Procesamiento de Contexto Largo
- Seguimiento de Instrucciones









