Principiante 12 minModelos

Qwen 3 local: prueba completa y benchmarks reales

Qwen 3 se ha convertido en la referencia de pesos abiertos para muchas personas que ejecutan un LLM en local. Pero entre las versiones densas (8B, 14B, 32B) y la versión MoE 30B-A3B, es fácil perderse. Este benchmark de Qwen3 con Ollama prueba tres variantes en tres máquinas muy diferentes —RTX 4090, RTX 3060 de 12 GB y MacBook Pro M4 Pro— para ofrecer cifras reales y un veredicto sin rodeos.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux
i
En resumen
Qwen 3 existe en version densa (8B, 14B, 32B) y en MoE (30B-A3B, 3B de parámetros activos sobre 30). · En RTX 4090, esperá cerca de 95 tok/s en 8B, 78 tok/s en 14B, y 110 tok/s en 30B-A3B — el MoE es más rápido que el 8B denso. · En RTX 3060 12 GB, el 14B (aproximadamente 32 tok/s) sigue siendo el mejor equilibrio; el 30B-A3B no cabe en la VRAM de esta tarjeta. · En Mac M4 Pro, esperá 38, 24 y 45 tok/s respectivamente.

#La gama Qwen 3: modelos densos vs MoE

Alibaba ha publicado Qwen 3 en dos familias distintas. Los modelos densos (Qwen3-1.7B, 4B, 8B, 14B, 32B) siguen la arquitectura clásica: todos los parámetros se usan en cada token. La familia MoE (Qwen3-30B-A3B, Qwen3-235B-A22B) activa solo una fracción de los expertos por token — por eso el sufijo A3B = 3 mil millones de parámetros activos sobre 30 totales.

En concreto, para quien usa el modelo en local, esto cambia dos cosas: la VRAM necesaria corresponde a los parámetros totales (el modelo entero debe caber en memoria), pero la velocidad corresponde a los parámetros activos. Un MoE 30B-A3B cabe en 19 GB en Q4, como un modelo denso de 32B, pero genera sus tokens a la velocidad de uno de 3B. Eso es lo que lo hace tan interesante.

i
Las tres variantes de la prueba
Nos centramos en Qwen3-8B (denso), Qwen3-14B (denso) y Qwen3-30B-A3B (MoE). Son los tres tamaños que la mayoría de las configuraciones de 12 a 24 GB pueden ejecutar cómodamente.

#Configuración y equipo probado

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Tres máquinas cubren aproximadamente todo el espectro de la ejecución en local en 2026:

RTX 4090 24 GB
Equipo de torre con Windows 11, Ryzen 9 7950X, 64 GB DDR5. La gama alta de consumo.
RTX 3060 12 GB
Torre con Linux Ubuntu 24.04, Ryzen 5 5600X y 32 GB de DDR4. La configuración económica más popular.
MacBook Pro M4 Pro 48 GB
macOS 15, GPU de 16 núcleos, memoria unificada. Representativo de los portátiles de gama alta de Apple.

Backend idéntico en todos lados: Ollama (daemon en localhost:11434). Todos los modelos en Q4_K_M por defecto, contexto de 8192 tokens, prompt estandarizado de aproximadamente 500 tokens. Velocidad medida en 10 generaciones de 500 tokens en promedio.

Descargar los tres modelos
ollama pull qwen3:8b
ollama pull qwen3:14b
ollama pull qwen3:30b-a3b
→
Medir en tu equipo
Para reproducir esta prueba, añade --verbose a ollama run. Ollama muestra eval rate (tokens/segundo durante la generación) y prompt eval rate (velocidad de prefill) al final de cada respuesta.

#Qwen3-8B: el modelo denso de entrada de gama

Modelo denso de 8 mil millones de parámetros, ~5 GB en Q4_K_M. Diseñado para funcionar en cualquier lugar: 8 GB de VRAM son más que suficientes. Es el candidato natural cuando se descubre Qwen 3 en una RTX 3060 o en un portátil.

RTX 4090
~95 tokens/sec. La tarjeta está muy infrautilizada: toda la VRAM disponible se aprovecha poco a este nivel.
RTX 3060 12 GB
~52 tokens/seg. Muy cómodo, estamos muy por encima del umbral de fluidez (20 t/s).
M4 Pro 48 GB
~38 tokens/seg. Una velocidad inferior a la de las RTX, pero perfectamente utilizable, y sin ruido de ventilador.

En cuanto a calidad, Qwen3-8B hace muy bien el trabajo en tareas comunes: resumen, reformulación, código simple, preguntas y respuestas. Se ve claramente superado cuando se entra en razonamiento de múltiples pasos o en código no trivial — allí se siente que se está usando un 8B. El francés es correcto pero no excelente, se observan algunos anglicismos y expresiones extrañas.

#Qwen3-14B: el equilibrio ideal entre los modelos densos

Modelo denso de 14B, aproximadamente 9 GB en Q4_K_M. Cabe sin problemas en 12 GB de VRAM con un contexto razonable. Es el modelo que recomendamos al 90 % de las personas que tienen una RTX 3060 de 12 GB, una 4070 o una equivalente.

RTX 4090
~78 tokens/sec. Velocidad excelente, aún estamos lejos del límite de la GPU.
RTX 3060 12 GB
~32 tokens/seg. Cómodo para chatear; el contexto de 8k cabe sin offload.
M4 Pro 48 GB
~24 tokens/s. Justo en el límite de lo cómodo, pero utilizable en el día a día.

El salto de calidad respecto al 8B es notable. Código Python correcto en funciones de 50 a 80 líneas, razonamiento más sólido, francés claramente mejor (giros naturales, pocos errores de género). Es el primer modelo de la gama que realmente se parece a un asistente en la nube de gama baja en cuanto a coherencia.

!
Contexto por defecto de Ollama
Ollama se limita a 2048 tokens de contexto por defecto, lo cual es ridículo para Qwen 3 (que soporta 32k de forma nativa). Fuerza num_ctx mediante un Modelfile o mediante /set parameter num_ctx 8192 en la sesión; de lo contrario, truncarás las conversaciones largas.

#Qwen3-30B-A3B: el MoE que cambia todo

Es aquí donde se vuelve interesante. El 30B-A3B pesa aproximadamente 19 GB en Q4_K_M (= se necesitan 24 GB de VRAM para ejecutarlo cómodamente con contexto), pero solo genera con 3B de parámetros activos. Resultado: calidad de un 30B, velocidad de un 3B.

RTX 4090
~110 tokens/segundo. Sí, más rápido que el 8B denso. Es la magia del MoE: menos cálculo por token.
RTX 3060 12 GB
No cabe en la VRAM. Descarga parcial a la CPU ≈ 8 t/s — se puede usar para probar, pero resulta frustrante.
M4 Pro 48 GB
~45 tokens/seg. La memoria unificada brilla aquí: todo cabe en RAM, y el MoE compensa los FLOPS limitados.

La calidad es muy similar a la de un Qwen 32B denso. El 30B-A3B destaca especialmente en código (al mismo nivel que un Qwen3-Coder 30B-A3B en tareas intermedias de Python) y en razonamiento estructurado. En francés escrito, es francamente bueno; al nivel de un Mistral Small 24B, como referencia.

→
El veredicto sorpresa
Si tienes 24 GB de VRAM o un Mac con 32 GB o más de memoria unificada, Qwen3-30B-A3B sigue siendo un excelente MoE de propósito general: mejor calidad Y mayor velocidad que el 14B denso, sin compromisos. Desde esta prueba, la siguiente generación ha tomado el relevo en este segmento: Qwen 3.8 27B (el «cercano a Copilot» de 2026, 262k de contexto) y Qwen 3.6 35B-A3B, una apuesta fiable para configuraciones de 24-32 GB. El 30B-A3B medido aquí conserva todo su ADN MoE.

#Modo de pensamiento: ¿útil o no?

Qwen 3 introduce un modo de pensamiento que se puede activar y desactivar. Cuando está activado, el modelo genera primero un bloque <think>...</think> con su razonamiento antes de producir la respuesta final. Está inspirado en DeepSeek R1, pero es más modular: se puede activar o desactivar sobre la marcha.

Activar o desactivar el thinking
# Dans la session Ollama
/set parameter think true
/set parameter think false

# Ou via prompt direct (Qwen 3 reconnaît les balises)
>>> /think Combien fait 17 × 23 ?
>>> /no_think Salut, ça va ?

Lo que se observa en 50 prompts probados:

Tareas simples (chat, reformulación)
Modo de pensamiento = pérdida de tiempo. Añade 2 a 5 segundos de latencia sin ganar calidad alguna. Desactiva este modo.
Matemáticas, lógica, razonamiento en múltiples pasos
Aumento neto en precisión: +20 a +30 % de respuestas correctas en problemas tipo GSM8K. Mantener activado.
Código complejo (refactoring, depuración)
Mejora moderada (+10 %) en calidad, pero latencia duplicada. Probar según tu paciencia.
Generación creativa (texto largo, diálogo)
A menudo contraproducente: el modelo piensa demasiado y pierde espontaneidad.
i
Costo en tokens
Un bloque <think> típico contiene entre 500 y 2.000 tokens adicionales antes de la respuesta. En un 30B-A3B a 100 t/s es imperceptible. En un 14B a 30 t/s, añade entre 10 y 60 segundos de latencia —evalúa tus prioridades.

#Calidad en francés vs Llama 4

Hemos comparado las respuestas en francés de Qwen3-14B y Qwen3-30B-A3B con las de Llama 4 Scout (el modelo equivalente de Meta, lanzado en el mismo periodo) en tres ejercicios: redacción de un correo profesional, explicación divulgativa de un concepto técnico y análisis de un texto literario corto.

Qwen3-14B
Francés correcto, expresiones naturales, pero persisten algunos errores de género («la problème»). Vocabulario un poco monótono.
Qwen3-30B-A3B
Muy buen francés escrito. Sin errores estructurales, vocabulario variado, registro adecuado al contexto. Ligeramente inferior a Mistral Small 24B en los matices muy idiomáticos.
Llama 4 Scout
Francés impecable desde el punto de vista gramatical, pero con un tono más «traducido del inglés» que el de Qwen. Preferencias personales.

Veredicto práctico: para francés profesional, Qwen3-30B-A3B y Llama 4 Scout están empatados. La elección se basa en otros criterios (velocidad, tamaño, licencia). Para francés literario o muy idiomático, Mistral Small sigue un paso por encima.


#¿Qué Qwen 3 elegir según tu configuración?

6-8 GB de VRAM (RTX 3050, 3060 Ti, 4060)
Qwen3-8B en Q4_K_M. El 14B cabe en Q3, pero la calidad se degrada: quédate con el 8B sin esa pérdida de calidad.
12 GB de VRAM (RTX 3060 12, 4070, 5070)
Qwen3-14B en Q4_K_M es el punto óptimo indiscutible. Un contexto de 16k se maneja con comodidad.
16 GB (RTX 4080, 5070 Ti, 5080)
Qwen3-14B en Q5 o Q6 para un uso cómodo, o un 30B-A3B en Q3_K_M si quieres probar el MoE.
24 GB (RTX 3090, 4090, RX 7900 XTX)
Qwen3-30B-A3B en Q4_K_M. No hay debate, es el mejor modelo generalista local disponible hoy.
Mac de la serie M con 32-48 GB de memoria unificada
Qwen3-30B-A3B en Q4 o Q5. El MoE se adapta especialmente bien a la memoria unificada Apple.
Mac Studio Ultra 128 GB+
Salta directo a Qwen3-235B-A22B (~120 GB en Q4) si quieres el top de la gama. De lo contrario, el 30B-A3B en Q8 sigue siendo excelente.
→
¿Y el modo de pensamiento en todo esto?
Por defecto, déjalo desactivado. Actívalo cuando sea necesario al enfrentar problemas de matemáticas, lógica o razonamiento complejo. Para charlas cotidianas, solo añade latencia. La misma lógica en la siguiente generación: Qwen 3.8 27B tiende a razonar demasiado con su configuración de razonamiento por defecto — cambia a low para intercambios cotidianos.

#Para ir más allá

Si Qwen 3 es tu punto de partida, ten en cuenta que la generación siguiente ya ha tomado el relevo en nuestras clasificaciones: Qwen 3.5 9B se ha convertido en la opción predeterminada para las configuraciones de 8 GB (256k de contexto, visión) y Qwen 3.8 27B para las de 24 GB; los ajustes que aparecen a continuación siguen siendo válidos sin cambios para estos modelos. Algunas sugerencias para profundizar:

Elegir tu cuantización
Para entender exactamente qué pierdes entre Q4_K_M y Q5_K_M en Qwen 3, y cuándo tiene sentido optar por una cuantización de mayor precisión.
Personalizar con un Modelfile
Para fijar el modo de pensamiento, el contexto y un prompt de sistema en francés por defecto en tu instancia de Qwen 3, en lugar de reajustarlos en cada sesión.
Open WebUI con Ollama
Para pasar del terminal a una verdadera interfaz de chat con historial, markdown y archivos adjuntos, sin renunciar a la ejecución local.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.