Principiante 9 minEdge

SmolLM3: ¿qué tal es este pequeño modelo de Hugging Face ?

Respuesta directa

SmolLM3 es un modelo de Hugging Face de 3 mil millones de parámetros, multilingüe (incluyendo el francés), con un contexto de entrenamiento de 64 000 tokens extensible hasta 128 000, y un modo de razonamiento activable mediante /think en el prompt de sistema. Punto importante antes de instalar: no existe una ficha oficial library/smollm3 en Ollama, solo etiquetas comunitarias o el GGUF oficial alojado en Hugging Face, que se puede descargar a través de su dirección completa.

SmolLM3 es el pequeño modelo de lenguaje publicado por Hugging Face, diseñado para funcionar en hardware modesto manteniendo un contexto largo y un modo de razonamiento opcional. Esta guía comprueba qué ofrece realmente el modelo, muestra cómo instalarlo sin equivocarse de fuente y delimita lo que cabe esperar razonablemente de sus 3 mil millones de parámetros.

Por Mohamed Meguedmi·Actualización 2026-09-28·Probado en Windows, macOS y Linux

#SmolLM3 en una frase

SmolLM3 es un modelo de lenguaje de 3 mil millones de parámetros publicado por Hugging Face, situado entre los modelos de 1B, demasiado limitados para un uso general, y los modelos de 7-8B, que consumen más memoria. El interés de un modelo de este tamaño no es competir con un modelo de 30B o más, sino caber en la memoria de una máquina modesta (portátil sin GPU dedicada, mini-PC) y seguir siendo útil para resumir, redactar textos cortos o responder a preguntas factuales sencillas.

#Lo que realmente ofrece el modelo

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Hugging Face indica que SmolLM3 se entrenó con 11,2 T de tokens según una estrategia en tres etapas. El contexto de entrenamiento se amplía progresivamente, primero de 4.000 a 32.000 tokens, luego de 32.000 a 64.000 tokens; más allá, el modelo puede alcanzar 128.000 tokens gracias a una extrapolación técnica llamada YARN. Es dos veces la longitud realmente entrenada, y debe tratarse como una capacidad máxima en lugar de una garantía de calidad constante en todo ese contexto.

SmolLM3: lo que se confirma en la ficha oficial
CaracterísticaValor
Parámetros3 mil millones
Contexto de entrenamiento64.000 tokens
Contexto ampliado (YARN)128 000 tokens
Tokens de entrenamiento11,2 T
Idiomas compatibles de forma nativa6 (incluyendo el francés)

#¿Por qué un modelo de 3B puede manejar un contexto largo sin que se dispare el consumo de memoria?

Hugging Face detalla las decisiones de arquitectura que hacen viable este contexto largo en hardware modesto. SmolLM3 sustituye la atención clásica de múltiples cabezas por atención de consultas agrupadas (grouped-query attention) con solo 4 grupos, lo que reduce directamente el tamaño de la caché KV que debe almacenarse por cada token generado: el principal factor que dispara el consumo de RAM o VRAM cuando el contexto se alarga. El modelo también aplica una técnica llamada NoPE (No Positional Encoding): RoPE, la codificación posicional habitual, se elimina de una de cada cuatro capas, un compromiso documentado para mejorar el comportamiento con contextos largos sin degradar el rendimiento con contextos cortos.

Otro detalle del entrenamiento que tiene un efecto concreto en la calidad: la atención utiliza una máscara intradocumento, es decir, los tokens de dos documentos diferentes concatenados en una misma secuencia de entrenamiento no se influyen entre sí. Para el usuario final, esto limita el riesgo de que un modelo compacto «mezcle» información sin relación entre sí cuando se introducen varias fuentes en el mismo contexto, un defecto más visible en los modelos pequeños que en los grandes.

→
Configuraciones de muestreo recomendadas
Hugging Face recomienda temperature=0.6 y top_p=0.95 para las respuestas en modo estándar. No son valores universales: determinan el equilibrio entre creatividad y coherencia y sirven como punto de partida antes de ajustarlos según tu caso de uso (por ejemplo, bajar la temperatura para obtener respuestas más factuales).

#El francés, un idioma con soporte nativo

A diferencia de muchos modelos pequeños diseñados inicialmente para el inglés y luego adaptados, SmolLM3 anuncia el francés entre los seis idiomas que admite de forma nativa, junto con el inglés, el español, el alemán, el italiano y el portugués. Hugging Face también precisa que el modelo ha visto datos en árabe, chino y ruso, pero en menor cantidad que en los seis idiomas principales: usarlo con precaución en estos idiomas secundarios, ya que la ficha oficial no afirma que la calidad sea equivalente.

i
Gradiente de sorpresa
Un pequeño modelo multilingüe no es automáticamente bueno en francés: lo que importa es la distribución real de los datos de entrenamiento por idioma, no el número de idiomas listados. Aquí, el francés forma parte del núcleo principal de entrenamiento, no de un añadido marginal.

#Instalar: atención al tag

Primera trampa que debes evitar: en el momento de redactar este texto, no existe una ficha oficial «library/smollm3» en el catálogo público de Ollama. Las etiquetas que puedes encontrar con ese nombre en ollama.com son versiones republicadas por la comunidad en espacios de nombres personales, sin garantía de que se ajusten al repositorio original. La vía fiable consiste en usar el GGUF oficial publicado por la organización ggml-org en Hugging Face, que Ollama y llama.cpp pueden cargar directamente mediante su dirección completa.

  1. 01
    Verificar la fuente
    Usar el repositorio oficial ggml-org/SmolLM3-3B-GGUF en Hugging Face en lugar de una etiqueta comunitaria no verificada, para asegurarte de la conformidad del modelo y del tokenizer.
  2. 02
    Iniciar con Ollama
    Ejecutar ollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_M, que descarga y arranca directamente la cuantización Q4_K_M desde Hugging Face.
  3. 03
    O lanzar con llama.cpp
    Usar llama-server -hf ggml-org/SmolLM3-3B-GGUF:Q4_K_M para un servidor local, o llama-cli para una sesión en línea de comando.
  4. 04
    Elegir la cuantización
    Q4_K_M (1,92 GB) para la mayoría de las máquinas, Q8_0 (3,28 GB) si tienes memoria suficiente y quieres limitar la pérdida de calidad, F16 (6,16 GB) solo como referencia de comparación.
Iniciar SmolLM3 a través de Ollama (repositorio oficial de Hugging Face)
ollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_M

También existe una etiqueta comunitaria, alibayram/smollm3, directamente en el catálogo público de Ollama (ollama pull alibayram/smollm3), que funciona sin usar la dirección completa de Hugging Face. Sin embargo, la mantiene un colaborador individual, no Hugging Face ni el equipo de Ollama: en caso de duda sobre una versión o un comportamiento inesperado, el GGUF oficial de ggml-org sigue siendo la referencia con la que comparar antes de concluir que se trata de un error del propio modelo.

#Activar el modo razonamiento

SmolLM3 funciona en dos modos: un modo directo y un modo de razonamiento, que genera una secuencia de reflexión antes de responder. El modo se activa añadiendo el indicador /think (o se desactiva con /no_think) en el prompt de sistema enviado al modelo. Este ajuste se realiza en el mensaje de sistema, no como una opción de lanzamiento: cualquier interfaz que permita personalizar el prompt de sistema puede activar este modo.

→
Con llama.cpp
Para aprovechar el modo de razonamiento extendido con llama.cpp, la documentación oficial recomienda añadir la opción --jinja al iniciar el programa; esta opción activa el procesamiento correcto de la plantilla de chat necesaria para este modo.

El modo razonamiento tiene un costo directo: cada respuesta comienza con una fase de reflexión interna de duración variable antes del texto final, lo que aumenta el número de tokens generados y por tanto el tiempo de respuesta. Para una pregunta factual sencilla, el modo directo (/no_think) sigue siendo ampliamente suficiente y claramente más rápido.

#Cómo situar SmolLM3 frente a los otros tamaños

Un modelo de 3B de parámetros se sitúa en una zona intermedia del mercado de los pequeños modelos: más capaz que un 1B, a menudo limitado a tareas simples y a un estilo bastante rígido, pero menos versátil que un 7-8B, que sigue siendo la referencia para un uso general en una máquina con 8 GB de RAM o más. La pregunta que hay que plantearse no es, en términos absolutos, «¿Es bueno SmolLM3?», sino «¿Mi máquina y mi uso justifican bajar a 3B en lugar de seguir con un 7-8B?».

El contexto anunciado (64 000 tokens durante el entrenamiento, hasta 128 000 por extrapolación) es un factor diferenciador frente a los modelos pequeños de la competencia, que suelen estar limitados a 8 000 o 32 000 tokens. En concreto, permite introducir un documento más largo de una sola vez, por ejemplo para resumirlo, sin necesidad de dividirlo previamente. Sin embargo, esta ventaja de contexto no compensa una falta de capacidad de razonamiento puro: ante una pregunta que exige encadenar varios pasos lógicos, un modelo más grande suele seguir siendo más fiable, tenga o no un contexto largo.

i
Ganancia de información
La progresión del contexto en etapas (4k luego 32k luego 64k) documentada por Hugging Face muestra que el entrenamiento con contexto largo se realiza en etapas sucesivas sobre volúmenes específicos de tokens (100 mil millones de tokens solo para la extensión de contexto), en lugar de una sola pasada. Esta información es útil para entender por qué la calidad puede variar según la longitud real del texto procesado, incluso bajo el umbral anunciado.

En cuanto a los resultados, Hugging Face anuncia que SmolLM3 supera a Llama-3.2-3B y Qwen2.5-3B en un conjunto de 12 benchmarks públicos que abarcan conocimiento, razonamiento, matemáticas y código, manteniéndose competitivo con modelos de 4B más pesados. Es un dato publicado por el editor del modelo, no una medición independiente: sitúa a SmolLM3 entre los mejores modelos de su tamaño, sin sustituir una prueba con tus propios prompts si tu uso va más allá del alcance de estos benchmarks generales.

Distribución de los datos de entrenamiento según el progreso (fuente Hugging Face)
PasoTokens acumuladosWebCódigoMatemáticas
Etapa 10 à 8 T85 %12 %3 %
Etapa 28 à 10 T75 %15 %10 %
Etapa 310 à 11,1 T63 %24 %13 %

Este aumento en el código y en las matemáticas al final del entrenamiento (respectivamente un 12 % y luego un 24 %, y un 3 % y luego un 13 %) explica en parte por qué un modelo de este tamaño puede resolver tareas sencillas de programación y cálculo, mientras que un pequeño modelo entrenado únicamente con texto web general falla más a menudo.

#Para qué sirve realmente el 3B

Resumen de texto corto
Eficiente con documentos de unas pocas páginas, con un contexto cómodo hasta 64.000 tokens en uso entrenado.
Redacción de borradores cortos
Correos, mensajes, reformulaciones: un uso típico de un modelo compacto, sin pretensiones creativas avanzadas.
Preguntas factuales sencillas
Respuestas correctas sobre hechos comunes, con un mayor riesgo de error que un modelo más grande en preguntas especializadas.
Integración en sistemas embebidos
El tamaño reducido del modelo y las cuantizaciones ligeras (1,92 GB en Q4_K_M) lo convierten en un candidato para máquinas con memoria limitada, más que para tareas que requieran un razonamiento complejo.

#Lo que un 3B no hará

Ninguna fuente oficial publica mediciones del rendimiento de SmolLM3 en hardware de consumo como una Raspberry Pi: debes verificar por tu cuenta cualquier promesa de este tipo antes de tomarla como supuesto para un despliegue. Del mismo modo, el contexto ampliado a 128 000 tokens mediante YARN es una capacidad técnica, no una prueba de que la calidad de las respuestas se mantenga constante en un documento tan largo: sigue siendo necesario hacer una prueba con tu propio caso de uso antes de confiar en esta capacidad para un uso crítico.

!
Objección: «¿por qué no un 7B inmediatamente?»
Si tu máquina dispone de 8 GB de RAM o más, un modelo de 7-8B en Q4 suele dar mejores resultados en general. SmolLM3 tiene sentido cuando la memoria o el almacenamiento están realmente limitados, o cuando disponer de un contexto largo en un modelo de 3B es un criterio decisivo para tu uso.
Preguntas frecuentes
¿Está disponible directamente SmolLM3 en Ollama?+
No mediante una ficha oficial library/smollm3 en el momento de la redacción. El comando fiable sigue siendo ollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_M, que descarga el GGUF oficial desde Hugging Face con la cuantización que elijas. También existe una etiqueta comunitaria, alibayram/smollm3, que funciona, pero la mantiene un colaborador individual, no Hugging Face ni el equipo de Ollama.
¿SmolLM3 habla bien francés?+
El francés forma parte de los 6 idiomas que el modelo admite de forma nativa según la ficha de Hugging Face, junto con el inglés, el español, el alemán, el italiano y el portugués, con una base de datos de entrenamiento dedicada en lugar de un añadido marginal. Es uno de los puntos fuertes del modelo en comparación con modelos pequeños centrados principalmente en el inglés.
¿Cómo activar el modo de razonamiento en SmolLM3?+
Añadiendo el indicador /think al prompt de sistema enviado al modelo (o /no_think para desactivarlo y permanecer en el modo directo, más rápido). Con llama.cpp, añade la opción --jinja al iniciar para que se aplique correctamente la plantilla de chat necesaria para este modo; de lo contrario, puede que la fase de reflexión nunca termine correctamente.
¿Qué cuantización elegir para SmolLM3?+
Q4_K_M (1,92 GB) es adecuado para la mayoría de las máquinas y sigue siendo la opción predeterminada recomendada por su buena relación entre calidad y memoria. Q8_0 (3,28 GB) reduce la pérdida de calidad si tienes memoria disponible. F16 (6,16 GB) sirve principalmente como referencia de comparación durante tus pruebas y rara vez resulta útil para el uso habitual de un modelo 3B.
¿Qué ajustes de muestreo usar con SmolLM3?+
Hugging Face recomienda temperature=0.6 y top_p=0.95 como punto de partida en modo estándar, valores que equilibran coherencia y variedad en las respuestas. No son ajustes universales: reducirlos ayuda a obtener respuestas más factuales y reproducibles para uso técnico, mientras que aumentarlos ligeramente favorece reformulaciones más variadas para redacción creativa.
¿Es SmolLM3 mejor que Qwen2.5-3B o Llama-3.2-3B?+
Hugging Face anuncia que SmolLM3 supera a estos dos modelos en 12 benchmarks públicos de conocimiento, razonamiento, matemáticas y código, manteniéndose competitivo con modelos de 4B. Es un resultado publicado por el editor, que conviene confirmar con tus propios prompts si tu uso real difiere de estos benchmarks genéricos.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.