Qwen 3 local: prueba completa y benchmarks reales
Qwen 3 se ha convertido en la referencia de pesos abiertos para muchas personas que ejecutan un LLM en local. Pero entre las versiones densas (8B, 14B, 32B) y la versión MoE 30B-A3B, es fácil perderse. Este benchmark de Qwen3 con Ollama prueba tres variantes en tres máquinas muy diferentes —RTX 4090, RTX 3060 de 12 GB y MacBook Pro M4 Pro— para ofrecer cifras reales y un veredicto sin rodeos.
#La gama Qwen 3: modelos densos vs MoE
Alibaba ha publicado Qwen 3 en dos familias distintas. Los modelos densos (Qwen3-1.7B, 4B, 8B, 14B, 32B) siguen la arquitectura clásica: todos los parámetros se usan en cada token. La familia MoE (Qwen3-30B-A3B, Qwen3-235B-A22B) activa solo una fracción de los expertos por token — por eso el sufijo A3B = 3 mil millones de parámetros activos sobre 30 totales.
En concreto, para quien usa el modelo en local, esto cambia dos cosas: la VRAM necesaria corresponde a los parámetros totales (el modelo entero debe caber en memoria), pero la velocidad corresponde a los parámetros activos. Un MoE 30B-A3B cabe en 19 GB en Q4, como un modelo denso de 32B, pero genera sus tokens a la velocidad de uno de 3B. Eso es lo que lo hace tan interesante.
#Configuración y equipo probado
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Tres máquinas cubren aproximadamente todo el espectro de la ejecución en local en 2026:
- RTX 4090 24 GB
- Equipo de torre con Windows 11, Ryzen 9 7950X, 64 GB DDR5. La gama alta de consumo.
- RTX 3060 12 GB
- Torre con Linux Ubuntu 24.04, Ryzen 5 5600X y 32 GB de DDR4. La configuración económica más popular.
- MacBook Pro M4 Pro 48 GB
- macOS 15, GPU de 16 núcleos, memoria unificada. Representativo de los portátiles de gama alta de Apple.
Backend idéntico en todos lados: Ollama (daemon en localhost:11434). Todos los modelos en Q4_K_M por defecto, contexto de 8192 tokens, prompt estandarizado de aproximadamente 500 tokens. Velocidad medida en 10 generaciones de 500 tokens en promedio.
#Qwen3-8B: el modelo denso de entrada de gama
Modelo denso de 8 mil millones de parámetros, ~5 GB en Q4_K_M. Diseñado para funcionar en cualquier lugar: 8 GB de VRAM son más que suficientes. Es el candidato natural cuando se descubre Qwen 3 en una RTX 3060 o en un portátil.
- RTX 4090
- ~95 tokens/sec. La tarjeta está muy infrautilizada: toda la VRAM disponible se aprovecha poco a este nivel.
- RTX 3060 12 GB
- ~52 tokens/seg. Muy cómodo, estamos muy por encima del umbral de fluidez (20 t/s).
- M4 Pro 48 GB
- ~38 tokens/seg. Una velocidad inferior a la de las RTX, pero perfectamente utilizable, y sin ruido de ventilador.
En cuanto a calidad, Qwen3-8B hace muy bien el trabajo en tareas comunes: resumen, reformulación, código simple, preguntas y respuestas. Se ve claramente superado cuando se entra en razonamiento de múltiples pasos o en código no trivial — allí se siente que se está usando un 8B. El francés es correcto pero no excelente, se observan algunos anglicismos y expresiones extrañas.
#Qwen3-14B: el equilibrio ideal entre los modelos densos
Modelo denso de 14B, aproximadamente 9 GB en Q4_K_M. Cabe sin problemas en 12 GB de VRAM con un contexto razonable. Es el modelo que recomendamos al 90 % de las personas que tienen una RTX 3060 de 12 GB, una 4070 o una equivalente.
- RTX 4090
- ~78 tokens/sec. Velocidad excelente, aún estamos lejos del límite de la GPU.
- RTX 3060 12 GB
- ~32 tokens/seg. Cómodo para chatear; el contexto de 8k cabe sin offload.
- M4 Pro 48 GB
- ~24 tokens/s. Justo en el límite de lo cómodo, pero utilizable en el día a día.
El salto de calidad respecto al 8B es notable. Código Python correcto en funciones de 50 a 80 líneas, razonamiento más sólido, francés claramente mejor (giros naturales, pocos errores de género). Es el primer modelo de la gama que realmente se parece a un asistente en la nube de gama baja en cuanto a coherencia.
#Qwen3-30B-A3B: el MoE que cambia todo
Es aquí donde se vuelve interesante. El 30B-A3B pesa aproximadamente 19 GB en Q4_K_M (= se necesitan 24 GB de VRAM para ejecutarlo cómodamente con contexto), pero solo genera con 3B de parámetros activos. Resultado: calidad de un 30B, velocidad de un 3B.
- RTX 4090
- ~110 tokens/segundo. Sí, más rápido que el 8B denso. Es la magia del MoE: menos cálculo por token.
- RTX 3060 12 GB
- No cabe en la VRAM. Descarga parcial a la CPU ≈ 8 t/s — se puede usar para probar, pero resulta frustrante.
- M4 Pro 48 GB
- ~45 tokens/seg. La memoria unificada brilla aquí: todo cabe en RAM, y el MoE compensa los FLOPS limitados.
La calidad es muy similar a la de un Qwen 32B denso. El 30B-A3B destaca especialmente en código (al mismo nivel que un Qwen3-Coder 30B-A3B en tareas intermedias de Python) y en razonamiento estructurado. En francés escrito, es francamente bueno; al nivel de un Mistral Small 24B, como referencia.
#Modo de pensamiento: ¿útil o no?
Qwen 3 introduce un modo de pensamiento que se puede activar y desactivar. Cuando está activado, el modelo genera primero un bloque <think>...</think> con su razonamiento antes de producir la respuesta final. Está inspirado en DeepSeek R1, pero es más modular: se puede activar o desactivar sobre la marcha.
Lo que se observa en 50 prompts probados:
- Tareas simples (chat, reformulación)
- Modo de pensamiento = pérdida de tiempo. Añade 2 a 5 segundos de latencia sin ganar calidad alguna. Desactiva este modo.
- Matemáticas, lógica, razonamiento en múltiples pasos
- Aumento neto en precisión: +20 a +30 % de respuestas correctas en problemas tipo GSM8K. Mantener activado.
- Código complejo (refactoring, depuración)
- Mejora moderada (+10 %) en calidad, pero latencia duplicada. Probar según tu paciencia.
- Generación creativa (texto largo, diálogo)
- A menudo contraproducente: el modelo piensa demasiado y pierde espontaneidad.
#Calidad en francés vs Llama 4
Hemos comparado las respuestas en francés de Qwen3-14B y Qwen3-30B-A3B con las de Llama 4 Scout (el modelo equivalente de Meta, lanzado en el mismo periodo) en tres ejercicios: redacción de un correo profesional, explicación divulgativa de un concepto técnico y análisis de un texto literario corto.
- Qwen3-14B
- Francés correcto, expresiones naturales, pero persisten algunos errores de género («la problème»). Vocabulario un poco monótono.
- Qwen3-30B-A3B
- Muy buen francés escrito. Sin errores estructurales, vocabulario variado, registro adecuado al contexto. Ligeramente inferior a Mistral Small 24B en los matices muy idiomáticos.
- Llama 4 Scout
- Francés impecable desde el punto de vista gramatical, pero con un tono más «traducido del inglés» que el de Qwen. Preferencias personales.
Veredicto práctico: para francés profesional, Qwen3-30B-A3B y Llama 4 Scout están empatados. La elección se basa en otros criterios (velocidad, tamaño, licencia). Para francés literario o muy idiomático, Mistral Small sigue un paso por encima.
#¿Qué Qwen 3 elegir según tu configuración?
- 6-8 GB de VRAM (RTX 3050, 3060 Ti, 4060)
- Qwen3-8B en Q4_K_M. El 14B cabe en Q3, pero la calidad se degrada: quédate con el 8B sin esa pérdida de calidad.
- 12 GB de VRAM (RTX 3060 12, 4070, 5070)
- Qwen3-14B en Q4_K_M es el punto óptimo indiscutible. Un contexto de 16k se maneja con comodidad.
- 16 GB (RTX 4080, 5070 Ti, 5080)
- Qwen3-14B en Q5 o Q6 para un uso cómodo, o un 30B-A3B en Q3_K_M si quieres probar el MoE.
- 24 GB (RTX 3090, 4090, RX 7900 XTX)
- Qwen3-30B-A3B en Q4_K_M. No hay debate, es el mejor modelo generalista local disponible hoy.
- Mac de la serie M con 32-48 GB de memoria unificada
- Qwen3-30B-A3B en Q4 o Q5. El MoE se adapta especialmente bien a la memoria unificada Apple.
- Mac Studio Ultra 128 GB+
- Salta directo a Qwen3-235B-A22B (~120 GB en Q4) si quieres el top de la gama. De lo contrario, el 30B-A3B en Q8 sigue siendo excelente.
#Para ir más allá
Si Qwen 3 es tu punto de partida, ten en cuenta que la generación siguiente ya ha tomado el relevo en nuestras clasificaciones: Qwen 3.5 9B se ha convertido en la opción predeterminada para las configuraciones de 8 GB (256k de contexto, visión) y Qwen 3.8 27B para las de 24 GB; los ajustes que aparecen a continuación siguen siendo válidos sin cambios para estos modelos. Algunas sugerencias para profundizar:
- Elegir tu cuantización
- Para entender exactamente qué pierdes entre Q4_K_M y Q5_K_M en Qwen 3, y cuándo tiene sentido optar por una cuantización de mayor precisión.
- Personalizar con un Modelfile
- Para fijar el modo de pensamiento, el contexto y un prompt de sistema en francés por defecto en tu instancia de Qwen 3, en lugar de reajustarlos en cada sesión.
- Open WebUI con Ollama
- Para pasar del terminal a una verdadera interfaz de chat con historial, markdown y archivos adjuntos, sin renunciar a la ejecución local.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.