Magistral Small 24B vs Qwen 3 32B: mini-Mistral 2026

Le Magistral Small 24B es el modelo de razonamiento compacto de Mistral AI, diseñado para ejecutarse localmente en una sola GPU de consumo. Frente a él, el Qwen 3 32B de Alibaba se ha consolidado como uno de los referentes entre los modelos de pesos abiertos en la categoría de modelos densos de tamaño medio desde su lanzamiento en 2025. Este artículo compara ambos en detalle: especificaciones de VRAM según la cuantización, velocidad de inferencia en hardware real, licencias, resultados en benchmarks públicos y casos de uso concretos. Tanto si estás montando una estación de trabajo orientada al razonamiento como si buscas un modelo versátil para procesar textos largos, esta página te ofrece los elementos necesarios para elegir.


Presentación de los dos modelos

Magistral Small 24B

Magistral Small 24B pertenece a la familia Magistral de Mistral AI, al lado de una variante más grande (Magistral Medium, ~123 mil millones de parámetros). Su característica principal es su orientación razonamiento estructurado : el modelo genera una cadena de pensamiento intermedia (chain-of-thought) antes de producir su respuesta final, lo que lo diferencia de los modelos Mistral de generaciones anteriores. Con 24 mil millones de parámetros, se enfoca en la categoría de LLM accesibles en una GPU de 24 GB con cuantización Q4.

La ficha técnica oficial está disponible en HuggingFace — mistralai/Magistral-Small-2506 y en elanuncio de Mistral AI.

Qwen 3 32B

El Qwen 3 32B es un modelo dense (no-MoE) desarrollado por Alibaba Research, derivado de la tercera generación de la familia Qwen. Su arquitectura densa lo hace más predecible en el consumo de VRAM que las variantes MoE de la misma familia, como el Qwen 3 235B-A22B que activa solo 22 mil millones de parámetros en inferencia a pesar de tener 235 mil millones totales. El Qwen 3 32B cubre un espectro amplio: codificación, razonamiento matemático, procesamiento multilingüe, contexto largo.

Documentación oficial sobre HuggingFace — Qwen/Qwen3-32B y en el blog Qwen.


Especificaciones técnicas y VRAM

Para estimar la VRAM, la regla empírica es: parámetros × 0,5 a 0,55 GB en Q4, × 1 GB en Q8, × 2 GB en FP16. Los valores siguientes son estimaciones basadas en este método y en experiencias compartidas por la comunidad; compruébalos según tu backend (llama.cpp, llamafile, LM Studio).

Magistral Small 24B

En Q4_K_M, el modelo cabe holgadamente en una RTX 4090 (24 GB), con margen para la caché KV en contextos cortos. En Q8, la tarjeta llega a su límite; una RTX 6000 Ada (48 GB) o una A5000 es preferible para sesiones largas.

Qwen 3 32B

Qwen 3 32B cabe en Q4 en una RTX 4090, pero con un contexto largo (64 K tokens o más), la caché KV hace que el total supere los 24 GB disponibles. Para un uso cómodo con contexto ampliado, se recomienda una tarjeta de 48 GB (RTX 6000 Ada, A40).

Para profundizar en los cálculos de VRAM según la cuantización, consulta el guía de VRAM de QuéLLM.


Velocidad de inferencia

Los números siguientes son estimaciones basadas en retroalimentación comunitaria sobre llama.cpp y LM Studio. Varían según el hardware, la longitud del prompt, el backend y la cuantización exacta utilizada.

En RTX 4090 (24 GB, Q4_K_M)

Magistral Small 24B - Generación : ~25–40 tokens/segundo (estimado, prompt corto) - Prefill : ~1 500–2 500 tokens/seg (estimado)

Qwen 3 32B - Generación : ~18–28 tokens/sec (estimado, prompt corto) - Prefill : ~1 000–1 800 tokens/seg (estimado)

El modelo más ligero (24B) genera sensiblemente más rápido en la misma GPU: aproximadamente entre un 30 y un 50 % más de tokens por segundo en Q4 (estimado). La diferencia se reduce en GPU de 48 GB o al procesar varias solicitudes por lotes.

En un Apple M3 Max (128 GB de RAM unificada)

Los Mac con Apple Silicon permiten ejecutar ambos modelos cómodamente, incluso el 24B en Q8 con 64 GB de RAM.


Licencias

Magistral Small 24B Mistral AI ha publicado sus modelos abiertos bajo Apache 2.0 o licencia Modified MIT según la versión. La licencia exacta del Magistral Small 24B debe verificarse en la página oficial de HuggingFace antes de cualquier uso comercial o redistribución. No asumas la licencia solo por pertenecer a una familia de modelos.

Qwen 3 32B Publicado bajo Apache 2.0, lo que permite el uso comercial, la modificación y la redistribución sin pagar regalías, siempre que se conserven los avisos legales. Es uno de los beneficios concretos del Qwen 3 32B en comparación con modelos con licencias comunitarias más restrictivas.

Para filtrar los modelos del catálogo por tipo de licencia, ve a quelllm.fr/catalogue.


Pruebas y rendimiento comparado

Los resultados de los benchmarks varían según la versión del modelo, el entorno de evaluación y los parámetros de generación. Los valores que aparecen a continuación proceden de informes públicos o son estimaciones: compruébalos en las clasificaciones oficiales, como elOpen LLM Leaderboard HuggingFace antes de tomar decisiones de despliegue basadas en ellos.

MMLU (conocimiento general)

Qwen 3 32B se beneficia del gran volumen de datos de entrenamiento de Alibaba, especialmente rico en contenido académico y multilingüe, lo que se refleja en MMLU.

HumanEval (programación)

En programación pura en benchmarks estándar, Qwen 3 32B mantiene la ventaja. Sin embargo, el modo de razonamiento de Magistral Small puede compensar esa desventaja en problemas algorítmicos complejos que requieren varias etapas de descomposición.

AIME (razonamiento matemático)

Es en benchmarks de razonamiento como AIME donde Magistral Small 24B busca destacarse. Su diseño orientado a la cadena de pensamiento le permite abordar problemas de matemáticas de competición con una metodología estructurada en lugar de limitarse a identificar patrones. Las puntuaciones exactas siguen pendientes de confirmación en las clasificaciones públicas.

Posición en el catálogo QuéLLM

Para situar estos dos modelos en el ecosistema:


Casos de uso concretos

Cuándo elegir Magistral Small 24B

Cuándo elegir Qwen 3 32B


FAQ

P: ¿El Magistral Small 24B funciona en una RTX 4090?

Sí. En Q4_K_M, requiere aproximadamente 13 GB de VRAM: una RTX 4090 (24 GB) lo ejecuta con margen para la caché KV en contextos cortos. En Q8, se aprovechan al máximo los 24 GB disponibles; los contextos muy largos (con los 32 K tokens ocupados) pueden saturar la memoria. En la práctica, Q5_K_M representa un buen equilibrio entre calidad y VRAM en esta tarjeta.

P: ¿Cuál es la licencia de Qwen 3 32B?

El Qwen 3 32B se publica bajo Apache 2.0, una licencia permisiva que permite el uso comercial, la modificación y la redistribución. No se exige el pago de regalías para integrarlo en un producto o servicio, siempre que se conserven los avisos legales originales. Es una de las licencias más favorables del ecosistema de pesos abiertos.

P: ¿Magistral Small 24B o Qwen 3 32B para RAG (Generación aumentada por recuperación)?

Para RAG, el Qwen 3 32B tiene ventaja por su contexto nativo de 128 K tokens y su alto rendimiento en comprensión de documentos. El Magistral Small 24B puede generar respuestas mejor estructuradas y argumentadas en consultas complejas gracias a su modo de razonamiento. La elección depende principalmente de la longitud de los documentos procesados y de la complejidad de las preguntas planteadas.

P: ¿Hay una diferencia de velocidad significativa entre los dos modelos?

Sí. Con 8 mil millones de parámetros menos, Magistral Small 24B es sensiblemente más rápido en la generación con la misma GPU — aproximadamente entre un 30 y un 50 % más de tokens por segundo en Q4 en una RTX 4090 (estimado). Esta diferencia se atenúa en GPU de 80 GB o en despliegues por lotes, donde el ancho de banda de la memoria ya no es el principal factor limitante.

P: ¿El Magistral Small 24B soporta el modo "thinking"?

Sí, es su característica principal en comparación con los LLM Mistral de generación anterior. Genera un razonamiento intermedio antes de la respuesta final. La activación se realiza mediante el formato de prompt o una opción específica según el backend utilizado (llama.cpp, LM Studio, etc.). Los detalles de implementación se deben verificar en la documentación oficial de HuggingFace.

P: ¿Cómo comparar estos modelos con otros LLM del catálogo QuéLLM?

Le catálogo QuéLLM lista 249 modelos con sus especificaciones de VRAM, licencias y tokens/sec filtrables. Para una comparación directa con otro modelo de tamaño similar, el comparador integrado permite poner las fichas una al lado de otra según tus criterios (VRAM disponible, licencia, uso).


Conclusión

Le Magistral Small 24B y el Qwen 3 32B representan dos filosofías para un tamaño similar: razonamiento estructurado por un lado, polivalencia densa por el otro. Si tu prioridad es la velocidad de inferencia y la calidad del razonamiento paso a paso en una GPU de 24 GB, el Magistral Small 24B merece una evaluación seria. Si priorizas la programación, el contexto largo y una licencia Apache 2.0 sin ambigüedades, el Qwen 3 32B es una opción sólida. Explora todos los modelos filtrados por VRAM y licencia en quelllm.fr/catalogue, o déjalo configurador hacer la selección según tu configuración exacta.

Artículo publicado y actualizado el por Mohamed Meguedmi · Fuente de datos: /api/models.json · Licencia del contenido: CC BY 4.0.

¿Tienes algún error o alguna actualización que comunicar? Colaborar.