Qwen3.6 35B-A3B en local: prueba y requisitos VRAM
Qwen3.6 35B-A3B es un modelo Mixture-of-Experts (MoE) de Alibaba: 35 mil millones de parámetros en total, pero solo 3 mil millones activados por token. En teoría, promete la calidad de un 30B+ con la velocidad de un 3B. En la práctica, la trampa está en otro lugar: la VRAM. Esta guía mide lo que realmente se necesita para ejecutar qwen3.6 en local con cada cuantización y cuántos tokens/segundo se obtienen en las tarjetas habituales.
#¿Por qué Qwen3.6 35B-A3B en local?
Tres razones concretas invitan a probar este modelo en lugar de un modelo denso clásico de 32B. Primero, la velocidad: solo los 3B activos participan en el cálculo de cada token, por lo que la inferencia es mucho más rápida que la de un Qwen 32B denso con VRAM equivalente. Segundo, la calidad: en los benchmarks públicos, el 35B-A3B está a la altura de un modelo denso de 14B–24B en razonamiento, código y francés.
Por último, es uno de los pocos modelos que ofrecen este equilibrio bajo una licencia permisiva que permite su uso en producción. Si buscas un asistente generalista preciso, que responda rápido y que quepa en una tarjeta de 24 GB, Qwen3.6 35B-A3B es hoy uno de los mejores candidatos.
#Arquitectura MoE en un minuto
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
En un modelo denso, cada token pasa por todas las capas y todas las neuronas. En un MoE, algunas capas feed-forward se reemplazan por un conjunto de expertos independientes, y una pequeña red «enrutadora» decide para cada token qué expertos activar (normalmente entre 2 y 8). El resto permanece inactivo.
- Coste computacional por token
- Proporcional a los parámetros activos (3B). Es por eso que genera rápido.
- Memoria (VRAM)
- Proporcional al total (35B). Todos los expertos deben cargarse, no se sabe de antemano cuál será llamado.
- Calidad
- Entre un 3B denso y un 35B denso. En tareas generales, en la práctica, se acerca a un 14B–24B denso.
- Sensibilidad al batch
- En un solo prompt a la vez, el MoE destaca. En batches muy grandes, la ventaja de cálculo se reduce porque finalmente se activan todos los expertos.
#Requisitos de hardware
- VRAM mínima
- 16 GB para probarlo (Q3, aceptando un offload parcial a la CPU). 20–24 GB para un uso fluido en Q4.
- VRAM holgada
- 32 GB (RTX 5090) o 48 GB (memoria unificada de Apple) para Q5/Q6 y un contexto amplio.
- RAM del sistema
- 32 GB mínimo si aceptas offload en CPU. 64 GB si cargas en RAM exclusivamente.
- Disco
- Reservar 22 GB para Q4_K_M, 70 GB para FP16. SSD NVMe altamente recomendado.
- Sistema operativo / entorno de ejecución
- Linux, macOS (Apple Silicon), Windows 11. Ollama ≥ 0.5.x o una versión reciente de llama.cpp (compilación posterior a marzo de 2026).
#VRAM real por cuantización
Estos son los consumos de memoria medidos con llama.cpp con un contexto de 8 k tokens (modelo + caché KV + sobrecarga). Los valores incluyen la memoria utilizada por el entorno de ejecución, no solo el tamaño del GGUF en disco.
- Q2_K (≈ 13 GB)
- Posible en RTX 4070 / 4060 Ti de 16 GB. Pérdida notable de calidad, especialmente en código y razonamiento multietapa. Reservar como solución provisional.
- Q3_K_M (≈ 17 GB)
- Cabe en una RX 7900 GRE / 4080 / 5070 Ti de 16 GB con un contexto modesto. Calidad todavía razonable para chat de uso general en francés.
- Q4_K_M (≈ 22 GB)
- El punto ideal. Cómodo en RTX 3090 / 4090 / 7900 XTX (24 GB) y RTX 5090 (32 GB). Recomendado por defecto.
- Q5_K_M (≈ 26 GB)
- Requiere 32 GB (RTX 5090) o un Mac de la serie M con 36 GB o más. La mejora de calidad respecto a Q4 es modesta, salvo en tareas de programación.
- Q6_K (≈ 30 GB)
- Reservado para RTX 5090, Mac Studio o configuraciones con varias GPU. Muy poca diferencia respecto a Q8 en las respuestas que recibe el usuario.
- Q8_0 (≈ 37 GB)
- Mac Studio M2/M3/M5 Ultra, o una configuración con dos GPU (2× 3090). Calidad casi equivalente a FP16.
- FP16 (≈ 70 GB)
- Investigación, fine-tuning, vLLM en producción. Fuera del alcance de la mayoría de las configuraciones locales.
#Instalación con Ollama
Ollama sigue siendo la vía más rápida. Si aún no lo tienes, instálalo (véase la guía de instalación correspondiente a tu sistema operativo). Una vez que el daemon esté en ejecución en el puerto 11434, basta con una sola orden.
La descarga pesa aproximadamente 21 GB. Al primer prompt, el modelo se carga en VRAM; los siguientes arranques son casi instantáneos siempre que el modelo permanezca activo en memoria.
La columna PROCESSOR debe mostrar 100% GPU. Si ves un mix CPU/GPU, es porque la VRAM es insuficiente: pasa a una cuantización más agresiva (Q3_K_M), reduce num_ctx o acepta la pérdida de velocidad.
#Instalación con llama.cpp
Para quienes desean controlar con precisión el posicionamiento de los expertos, el batch o el KV-cache, llama.cpp es más flexible. Se descarga un GGUF Q4_K_M desde Hugging Face (modelos publicados por el equipo Qwen o por bartowski/unsloth), luego se inicia el servidor compatible con OpenAI.
- -ngl 99
- Carga todas las capas en la GPU. Poner 0 para usar solo la CPU, o un valor parcial para repartir la carga.
- -c 16384
- Tamaño del contexto. Calcula unos 0,5 GB adicionales de caché KV por cada bloque de 4 k que supere el valor predeterminado.
- --flash-attn
- Activa Flash Attention si tu compilación lo admite (CUDA, Metal). Ahorro claro de memoria en contextos largos.
- --threads 8
- Sirve principalmente cuando parte del procesamiento se realiza en la CPU. Si todo se ejecuta en la GPU, tiene poco impacto.
#Velocidad de inferencia medida
Mediciones realizadas en Q4_K_M, contexto 4096, prompt corto (~200 tokens), generación de 512 tokens, batch 1. Los números incluyen la fase de evaluación del prompt y la generación.
- RTX 5090 32 GB
- ≈ 110–125 tok/s en generación. La fase de evaluación del prompt supera los 4000 tok/s. Cómodo hasta 32 k de contexto.
- RTX 4090 24 GB
- ≈ 80–95 tok/s. El modelo Q4 cabe con 16 k de contexto sin superar la VRAM disponible.
- RTX 3090 24 GB
- ≈ 55–70 tok/s. Excelente relación rendimiento/€ de segunda mano, pero menor ancho de banda de memoria que la 4090.
- Mac Studio M5 Max 64 GB
- ≈ 60–75 tok/s en Q4_K_M, ≈ 45–55 tok/s en Q8_0. Ideal para un servidor silencioso que funcione las 24 horas, los 7 días de la semana.
- Radeon RX 7900 XTX 24 GB (ROCm)
- ≈ 45–60 tok/s. Compatible con Ollama; llama.cpp con ROCm/Vulkan.
- RTX 4070 Ti Super 16 GB (Q3_K_M)
- ≈ 50–65 tok/s, contexto limitado a 4 k. A este nivel, un Qwen 14B denso sigue siendo a menudo más relevante.
#Optimizaciones útiles
- 01Activar Flash AttentionEn Ollama, es automático en GPUs recientes. En llama.cpp, añadir --flash-attn. Ahorro notable en VRAM a partir de 8 k de contexto.
- 02Cuantizar el KV-cachellama.cpp acepta --cache-type-k q8_0 --cache-type-v q8_0. Ahorra ~30 % de VRAM en la caché, con una pérdida de calidad casi nula.
- 03Reducir el número de expertos activosAlgunas variantes aceptan --override-kv qwen3moe.expert_used_count=2 (en lugar de 4 o 8 por defecto). Más rápido, ligera pérdida de calidad.
- 04Limitar num_ctx a lo que necesitas16 k bastan de sobra para la mayoría de los chats. 32 k+ solo se justifican para la síntesis de documentos largos.
- 05Preferir batch=1 para el chat interactivoEl MoE pierde parte de su ventaja con lotes grandes: si atiendes a varios usuarios simultáneamente, considera vLLM en lugar de Ollama.
#Solución de problemas
- OOM al cargar en RTX 4090
- Reduce num_ctx a 4096 y comprueba que no se esté ejecutando ningún otro proceso en la GPU (navegador, juego). Q4_K_M debería caber con entre 2 y 3 GB de margen.
- Generación a 5 tok/s en RTX 4090
- Parte del modelo se ejecuta en la CPU. ollama ps mostrará una combinación CPU/GPU. Cierra todo, reinicia Ollama o baja a Q3_K_M.
- Respuestas incoherentes en francés
- Comprueba que usas la variante Instruct y no Base. El enrutamiento MoE es sensible a la formulación del prompt de sistema: sé directo.
- Primer token muy lento (>10s)
- Fase de evaluación del prompt larga: es normal con un contexto amplio en un modelo MoE. Reutiliza la caché del prompt entre solicitudes (opción --prompt-cache de llama.cpp).
- Modelo no encontrado en Ollama
- La etiqueta exacta puede variar (qwen3.6 vs qwen3_6 vs qwen36). Busca en ollama.com/library antes de escribir el comando.
#Para ir más allá
Ahora que Qwen3.6 35B-A3B funciona en tu equipo, aquí tienes algunas ideas para llevar tu configuración más lejos:
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Para entender con precisión lo que sucede entre Q3, Q4 y Q5 en un modelo MoE.
- Open WebUI con Ollama
- Una interfaz similar a ChatGPT con historial y RAG, que funciona sobre tu Qwen3.6 local.
- Elegir tu GPU para IA local
- Si dudas entre una 3090 de segunda mano, una 4090 o una 5090 para este tipo de modelo MoE 30B+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.