SmolLM3: ¿qué tal es este pequeño modelo de Hugging Face ?
SmolLM3 es un modelo de Hugging Face de 3 mil millones de parámetros, multilingüe (incluyendo el francés), con un contexto de entrenamiento de 64 000 tokens extensible hasta 128 000, y un modo de razonamiento activable mediante /think en el prompt de sistema. Punto importante antes de instalar: no existe una ficha oficial library/smollm3 en Ollama, solo etiquetas comunitarias o el GGUF oficial alojado en Hugging Face, que se puede descargar a través de su dirección completa.
SmolLM3 es el pequeño modelo de lenguaje publicado por Hugging Face, diseñado para funcionar en hardware modesto manteniendo un contexto largo y un modo de razonamiento opcional. Esta guía comprueba qué ofrece realmente el modelo, muestra cómo instalarlo sin equivocarse de fuente y delimita lo que cabe esperar razonablemente de sus 3 mil millones de parámetros.
#SmolLM3 en una frase
SmolLM3 es un modelo de lenguaje de 3 mil millones de parámetros publicado por Hugging Face, situado entre los modelos de 1B, demasiado limitados para un uso general, y los modelos de 7-8B, que consumen más memoria. El interés de un modelo de este tamaño no es competir con un modelo de 30B o más, sino caber en la memoria de una máquina modesta (portátil sin GPU dedicada, mini-PC) y seguir siendo útil para resumir, redactar textos cortos o responder a preguntas factuales sencillas.
#Lo que realmente ofrece el modelo
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
Hugging Face indica que SmolLM3 se entrenó con 11,2 T de tokens según una estrategia en tres etapas. El contexto de entrenamiento se amplía progresivamente, primero de 4.000 a 32.000 tokens, luego de 32.000 a 64.000 tokens; más allá, el modelo puede alcanzar 128.000 tokens gracias a una extrapolación técnica llamada YARN. Es dos veces la longitud realmente entrenada, y debe tratarse como una capacidad máxima en lugar de una garantía de calidad constante en todo ese contexto.
| Característica | Valor |
|---|---|
| Parámetros | 3 mil millones |
| Contexto de entrenamiento | 64.000 tokens |
| Contexto ampliado (YARN) | 128 000 tokens |
| Tokens de entrenamiento | 11,2 T |
| Idiomas compatibles de forma nativa | 6 (incluyendo el francés) |
#¿Por qué un modelo de 3B puede manejar un contexto largo sin que se dispare el consumo de memoria?
Hugging Face detalla las decisiones de arquitectura que hacen viable este contexto largo en hardware modesto. SmolLM3 sustituye la atención clásica de múltiples cabezas por atención de consultas agrupadas (grouped-query attention) con solo 4 grupos, lo que reduce directamente el tamaño de la caché KV que debe almacenarse por cada token generado: el principal factor que dispara el consumo de RAM o VRAM cuando el contexto se alarga. El modelo también aplica una técnica llamada NoPE (No Positional Encoding): RoPE, la codificación posicional habitual, se elimina de una de cada cuatro capas, un compromiso documentado para mejorar el comportamiento con contextos largos sin degradar el rendimiento con contextos cortos.
Otro detalle del entrenamiento que tiene un efecto concreto en la calidad: la atención utiliza una máscara intradocumento, es decir, los tokens de dos documentos diferentes concatenados en una misma secuencia de entrenamiento no se influyen entre sí. Para el usuario final, esto limita el riesgo de que un modelo compacto «mezcle» información sin relación entre sí cuando se introducen varias fuentes en el mismo contexto, un defecto más visible en los modelos pequeños que en los grandes.
#El francés, un idioma con soporte nativo
A diferencia de muchos modelos pequeños diseñados inicialmente para el inglés y luego adaptados, SmolLM3 anuncia el francés entre los seis idiomas que admite de forma nativa, junto con el inglés, el español, el alemán, el italiano y el portugués. Hugging Face también precisa que el modelo ha visto datos en árabe, chino y ruso, pero en menor cantidad que en los seis idiomas principales: usarlo con precaución en estos idiomas secundarios, ya que la ficha oficial no afirma que la calidad sea equivalente.
#Instalar: atención al tag
Primera trampa que debes evitar: en el momento de redactar este texto, no existe una ficha oficial «library/smollm3» en el catálogo público de Ollama. Las etiquetas que puedes encontrar con ese nombre en ollama.com son versiones republicadas por la comunidad en espacios de nombres personales, sin garantía de que se ajusten al repositorio original. La vía fiable consiste en usar el GGUF oficial publicado por la organización ggml-org en Hugging Face, que Ollama y llama.cpp pueden cargar directamente mediante su dirección completa.
- 01Verificar la fuenteUsar el repositorio oficial ggml-org/SmolLM3-3B-GGUF en Hugging Face en lugar de una etiqueta comunitaria no verificada, para asegurarte de la conformidad del modelo y del tokenizer.
- 02Iniciar con OllamaEjecutar ollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_M, que descarga y arranca directamente la cuantización Q4_K_M desde Hugging Face.
- 03O lanzar con llama.cppUsar llama-server -hf ggml-org/SmolLM3-3B-GGUF:Q4_K_M para un servidor local, o llama-cli para una sesión en línea de comando.
- 04Elegir la cuantizaciónQ4_K_M (1,92 GB) para la mayoría de las máquinas, Q8_0 (3,28 GB) si tienes memoria suficiente y quieres limitar la pérdida de calidad, F16 (6,16 GB) solo como referencia de comparación.
También existe una etiqueta comunitaria, alibayram/smollm3, directamente en el catálogo público de Ollama (ollama pull alibayram/smollm3), que funciona sin usar la dirección completa de Hugging Face. Sin embargo, la mantiene un colaborador individual, no Hugging Face ni el equipo de Ollama: en caso de duda sobre una versión o un comportamiento inesperado, el GGUF oficial de ggml-org sigue siendo la referencia con la que comparar antes de concluir que se trata de un error del propio modelo.
#Activar el modo razonamiento
SmolLM3 funciona en dos modos: un modo directo y un modo de razonamiento, que genera una secuencia de reflexión antes de responder. El modo se activa añadiendo el indicador /think (o se desactiva con /no_think) en el prompt de sistema enviado al modelo. Este ajuste se realiza en el mensaje de sistema, no como una opción de lanzamiento: cualquier interfaz que permita personalizar el prompt de sistema puede activar este modo.
El modo razonamiento tiene un costo directo: cada respuesta comienza con una fase de reflexión interna de duración variable antes del texto final, lo que aumenta el número de tokens generados y por tanto el tiempo de respuesta. Para una pregunta factual sencilla, el modo directo (/no_think) sigue siendo ampliamente suficiente y claramente más rápido.
#Cómo situar SmolLM3 frente a los otros tamaños
Un modelo de 3B de parámetros se sitúa en una zona intermedia del mercado de los pequeños modelos: más capaz que un 1B, a menudo limitado a tareas simples y a un estilo bastante rígido, pero menos versátil que un 7-8B, que sigue siendo la referencia para un uso general en una máquina con 8 GB de RAM o más. La pregunta que hay que plantearse no es, en términos absolutos, «¿Es bueno SmolLM3?», sino «¿Mi máquina y mi uso justifican bajar a 3B en lugar de seguir con un 7-8B?».
El contexto anunciado (64 000 tokens durante el entrenamiento, hasta 128 000 por extrapolación) es un factor diferenciador frente a los modelos pequeños de la competencia, que suelen estar limitados a 8 000 o 32 000 tokens. En concreto, permite introducir un documento más largo de una sola vez, por ejemplo para resumirlo, sin necesidad de dividirlo previamente. Sin embargo, esta ventaja de contexto no compensa una falta de capacidad de razonamiento puro: ante una pregunta que exige encadenar varios pasos lógicos, un modelo más grande suele seguir siendo más fiable, tenga o no un contexto largo.
En cuanto a los resultados, Hugging Face anuncia que SmolLM3 supera a Llama-3.2-3B y Qwen2.5-3B en un conjunto de 12 benchmarks públicos que abarcan conocimiento, razonamiento, matemáticas y código, manteniéndose competitivo con modelos de 4B más pesados. Es un dato publicado por el editor del modelo, no una medición independiente: sitúa a SmolLM3 entre los mejores modelos de su tamaño, sin sustituir una prueba con tus propios prompts si tu uso va más allá del alcance de estos benchmarks generales.
| Paso | Tokens acumulados | Web | Código | Matemáticas |
|---|---|---|---|---|
| Etapa 1 | 0 à 8 T | 85 % | 12 % | 3 % |
| Etapa 2 | 8 à 10 T | 75 % | 15 % | 10 % |
| Etapa 3 | 10 à 11,1 T | 63 % | 24 % | 13 % |
Este aumento en el código y en las matemáticas al final del entrenamiento (respectivamente un 12 % y luego un 24 %, y un 3 % y luego un 13 %) explica en parte por qué un modelo de este tamaño puede resolver tareas sencillas de programación y cálculo, mientras que un pequeño modelo entrenado únicamente con texto web general falla más a menudo.
#Para qué sirve realmente el 3B
- Resumen de texto corto
- Eficiente con documentos de unas pocas páginas, con un contexto cómodo hasta 64.000 tokens en uso entrenado.
- Redacción de borradores cortos
- Correos, mensajes, reformulaciones: un uso típico de un modelo compacto, sin pretensiones creativas avanzadas.
- Preguntas factuales sencillas
- Respuestas correctas sobre hechos comunes, con un mayor riesgo de error que un modelo más grande en preguntas especializadas.
- Integración en sistemas embebidos
- El tamaño reducido del modelo y las cuantizaciones ligeras (1,92 GB en Q4_K_M) lo convierten en un candidato para máquinas con memoria limitada, más que para tareas que requieran un razonamiento complejo.
#Lo que un 3B no hará
Ninguna fuente oficial publica mediciones del rendimiento de SmolLM3 en hardware de consumo como una Raspberry Pi: debes verificar por tu cuenta cualquier promesa de este tipo antes de tomarla como supuesto para un despliegue. Del mismo modo, el contexto ampliado a 128 000 tokens mediante YARN es una capacidad técnica, no una prueba de que la calidad de las respuestas se mantenga constante en un documento tan largo: sigue siendo necesario hacer una prueba con tu propio caso de uso antes de confiar en esta capacidad para un uso crítico.
- Hoja técnica completa de SmolLM3 3B
- Instalar un LLM local paso a paso
- Ejecutar un LLM sin GPU según la RAM disponible
- Entender los formatos GGUF y safetensors
- Fuente: presentación oficial de SmolLM3 (Hugging Face)
- Fuente: repositorio oficial GGUF ggml-org
- Fuente: etiqueta comunitaria SmolLM3 en Ollama
¿Está disponible directamente SmolLM3 en Ollama?+
¿SmolLM3 habla bien francés?+
¿Cómo activar el modo de razonamiento en SmolLM3?+
¿Qué cuantización elegir para SmolLM3?+
¿Qué ajustes de muestreo usar con SmolLM3?+
¿Es SmolLM3 mejor que Qwen2.5-3B o Llama-3.2-3B?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.