Intermedio 11 minQwen

Qwen3.6 35B-A3B en local: prueba y requisitos VRAM

Qwen3.6 35B-A3B es un modelo Mixture-of-Experts (MoE) de Alibaba: 35 mil millones de parámetros en total, pero solo 3 mil millones activados por token. En teoría, promete la calidad de un 30B+ con la velocidad de un 3B. En la práctica, la trampa está en otro lugar: la VRAM. Esta guía mide lo que realmente se necesita para ejecutar qwen3.6 en local con cada cuantización y cuántos tokens/segundo se obtienen en las tarjetas habituales.

Por Mohamed Meguedmi·Actualización 2026-06-03·Probado en Windows, macOS y Linux

#¿Por qué Qwen3.6 35B-A3B en local?

Tres razones concretas invitan a probar este modelo en lugar de un modelo denso clásico de 32B. Primero, la velocidad: solo los 3B activos participan en el cálculo de cada token, por lo que la inferencia es mucho más rápida que la de un Qwen 32B denso con VRAM equivalente. Segundo, la calidad: en los benchmarks públicos, el 35B-A3B está a la altura de un modelo denso de 14B–24B en razonamiento, código y francés.

Por último, es uno de los pocos modelos que ofrecen este equilibrio bajo una licencia permisiva que permite su uso en producción. Si buscas un asistente generalista preciso, que responda rápido y que quepa en una tarjeta de 24 GB, Qwen3.6 35B-A3B es hoy uno de los mejores candidatos.

i
El nombre descodificado
35B = 35 mil millones de parámetros en total. A3B = 3 mil millones de parámetros «activos» por token. El enrutador MoE selecciona dinámicamente unos pocos expertos de entre unos 64 en cada paso, lo que reduce el coste de cálculo, pero no el de memoria.

#Arquitectura MoE en un minuto

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

En un modelo denso, cada token pasa por todas las capas y todas las neuronas. En un MoE, algunas capas feed-forward se reemplazan por un conjunto de expertos independientes, y una pequeña red «enrutadora» decide para cada token qué expertos activar (normalmente entre 2 y 8). El resto permanece inactivo.

Coste computacional por token
Proporcional a los parámetros activos (3B). Es por eso que genera rápido.
Memoria (VRAM)
Proporcional al total (35B). Todos los expertos deben cargarse, no se sabe de antemano cuál será llamado.
Calidad
Entre un 3B denso y un 35B denso. En tareas generales, en la práctica, se acerca a un 14B–24B denso.
Sensibilidad al batch
En un solo prompt a la vez, el MoE destaca. En batches muy grandes, la ventaja de cálculo se reduce porque finalmente se activan todos los expertos.
→
¿Por qué es interesante para el autoalojamiento?
En una RTX 4090 de 24 GB, un Qwen denso de 32B en Q4 suele tener un techo de entre 25 y 35 tok/s. Qwen3.6 35B-A3B, con la misma VRAM, funciona a unos 70–90 tok/s, con un nivel de respuesta comparable en la mayoría de las tareas no especializadas.

#Requisitos de hardware

VRAM mínima
16 GB para probarlo (Q3, aceptando un offload parcial a la CPU). 20–24 GB para un uso fluido en Q4.
VRAM holgada
32 GB (RTX 5090) o 48 GB (memoria unificada de Apple) para Q5/Q6 y un contexto amplio.
RAM del sistema
32 GB mínimo si aceptas offload en CPU. 64 GB si cargas en RAM exclusivamente.
Disco
Reservar 22 GB para Q4_K_M, 70 GB para FP16. SSD NVMe altamente recomendado.
Sistema operativo / entorno de ejecución
Linux, macOS (Apple Silicon), Windows 11. Ollama ≥ 0.5.x o una versión reciente de llama.cpp (compilación posterior a marzo de 2026).
!
MoE ≠ modelo pequeño
No te dejes engañar por los «3B activos»: aun así, hay que cargar todo el modelo en VRAM. Una RTX 4060 de 8 GB no basta, aunque la inferencia «solo calcule 3B». Todos los expertos deben seguir estando accesibles al instante.

#VRAM real por cuantización

Estos son los consumos de memoria medidos con llama.cpp con un contexto de 8 k tokens (modelo + caché KV + sobrecarga). Los valores incluyen la memoria utilizada por el entorno de ejecución, no solo el tamaño del GGUF en disco.

Q2_K (≈ 13 GB)
Posible en RTX 4070 / 4060 Ti de 16 GB. Pérdida notable de calidad, especialmente en código y razonamiento multietapa. Reservar como solución provisional.
Q3_K_M (≈ 17 GB)
Cabe en una RX 7900 GRE / 4080 / 5070 Ti de 16 GB con un contexto modesto. Calidad todavía razonable para chat de uso general en francés.
Q4_K_M (≈ 22 GB)
El punto ideal. Cómodo en RTX 3090 / 4090 / 7900 XTX (24 GB) y RTX 5090 (32 GB). Recomendado por defecto.
Q5_K_M (≈ 26 GB)
Requiere 32 GB (RTX 5090) o un Mac de la serie M con 36 GB o más. La mejora de calidad respecto a Q4 es modesta, salvo en tareas de programación.
Q6_K (≈ 30 GB)
Reservado para RTX 5090, Mac Studio o configuraciones con varias GPU. Muy poca diferencia respecto a Q8 en las respuestas que recibe el usuario.
Q8_0 (≈ 37 GB)
Mac Studio M2/M3/M5 Ultra, o una configuración con dos GPU (2× 3090). Calidad casi equivalente a FP16.
FP16 (≈ 70 GB)
Investigación, fine-tuning, vLLM en producción. Fuera del alcance de la mayoría de las configuraciones locales.
→
¿Qué cuantización elegir?
Para el 95 % de los usos, Q4_K_M es una buena opción predeterminada: preserva lo esencial de la calidad, ahorra VRAM y aumenta la velocidad de generación. No pases a Q5/Q6 salvo que hayas constatado explícitamente una pérdida de calidad en tus prompts.

#Instalación con Ollama

Ollama sigue siendo la vía más rápida. Si aún no lo tienes, instálalo (véase la guía de instalación correspondiente a tu sistema operativo). Una vez que el daemon esté en ejecución en el puerto 11434, basta con una sola orden.

Descargar e iniciar
ollama run qwen3.6:35b-a3b-q4_K_M

La descarga pesa aproximadamente 21 GB. Al primer prompt, el modelo se carga en VRAM; los siguientes arranques son casi instantáneos siempre que el modelo permanezca activo en memoria.

Verificar la asignación a la GPU
ollama ps

La columna PROCESSOR debe mostrar 100% GPU. Si ves un mix CPU/GPU, es porque la VRAM es insuficiente: pasa a una cuantización más agresiva (Q3_K_M), reduce num_ctx o acepta la pérdida de velocidad.

i
Expandir el contexto
Por defecto, Ollama limita el contexto a 2048 tokens. Para resumir documentos o mantener conversaciones largas, crea un Modelfile que fuerce num_ctx a 8192 o 16384; cada duplicación requiere unos cientos de MB adicionales de VRAM.
Modelfile mínimo
# fichier : Modelfile.qwen36-long
FROM qwen3.6:35b-a3b-q4_K_M
PARAMETER num_ctx 16384
PARAMETER temperature 0.7

# build
# ollama create qwen36-long -f Modelfile.qwen36-long

#Instalación con llama.cpp

Para quienes desean controlar con precisión el posicionamiento de los expertos, el batch o el KV-cache, llama.cpp es más flexible. Se descarga un GGUF Q4_K_M desde Hugging Face (modelos publicados por el equipo Qwen o por bartowski/unsloth), luego se inicia el servidor compatible con OpenAI.

Servidor llama.cpp
./llama-server \
  -m ./models/Qwen3.6-35B-A3B-Q4_K_M.gguf \
  --host 0.0.0.0 --port 8080 \
  -c 16384 \
  -ngl 99 \
  --flash-attn \
  --threads 8
-ngl 99
Carga todas las capas en la GPU. Poner 0 para usar solo la CPU, o un valor parcial para repartir la carga.
-c 16384
Tamaño del contexto. Calcula unos 0,5 GB adicionales de caché KV por cada bloque de 4 k que supere el valor predeterminado.
--flash-attn
Activa Flash Attention si tu compilación lo admite (CUDA, Metal). Ahorro claro de memoria en contextos largos.
--threads 8
Sirve principalmente cuando parte del procesamiento se realiza en la CPU. Si todo se ejecuta en la GPU, tiene poco impacto.
→
MoE y offload de expertos
Las compilaciones recientes de llama.cpp aceptan --override-tensor para colocar algunos expertos en RAM. En una 4070 de 12 GB, esto permite que Q4_K_M quepa (a costa de parte del rendimiento). Busca la documentación sobre "expert offload" si quieres profundizar.

#Velocidad de inferencia medida

Mediciones realizadas en Q4_K_M, contexto 4096, prompt corto (~200 tokens), generación de 512 tokens, batch 1. Los números incluyen la fase de evaluación del prompt y la generación.

RTX 5090 32 GB
≈ 110–125 tok/s en generación. La fase de evaluación del prompt supera los 4000 tok/s. Cómodo hasta 32 k de contexto.
RTX 4090 24 GB
≈ 80–95 tok/s. El modelo Q4 cabe con 16 k de contexto sin superar la VRAM disponible.
RTX 3090 24 GB
≈ 55–70 tok/s. Excelente relación rendimiento/€ de segunda mano, pero menor ancho de banda de memoria que la 4090.
Mac Studio M5 Max 64 GB
≈ 60–75 tok/s en Q4_K_M, ≈ 45–55 tok/s en Q8_0. Ideal para un servidor silencioso que funcione las 24 horas, los 7 días de la semana.
Radeon RX 7900 XTX 24 GB (ROCm)
≈ 45–60 tok/s. Compatible con Ollama; llama.cpp con ROCm/Vulkan.
RTX 4070 Ti Super 16 GB (Q3_K_M)
≈ 50–65 tok/s, contexto limitado a 4 k. A este nivel, un Qwen 14B denso sigue siendo a menudo más relevante.
i
MoE y contexto largo
La velocidad de generación sigue siendo alta, pero el tiempo de evaluación del prompt aumenta rápidamente cuando se introducen 16 k de contexto. Es normal: todos los expertos intervienen en algún momento durante el procesamiento del prompt. Para RAG, procesa tus consultas por lotes.

#Optimizaciones útiles

  1. 01
    Activar Flash Attention
    En Ollama, es automático en GPUs recientes. En llama.cpp, añadir --flash-attn. Ahorro notable en VRAM a partir de 8 k de contexto.
  2. 02
    Cuantizar el KV-cache
    llama.cpp acepta --cache-type-k q8_0 --cache-type-v q8_0. Ahorra ~30 % de VRAM en la caché, con una pérdida de calidad casi nula.
  3. 03
    Reducir el número de expertos activos
    Algunas variantes aceptan --override-kv qwen3moe.expert_used_count=2 (en lugar de 4 o 8 por defecto). Más rápido, ligera pérdida de calidad.
  4. 04
    Limitar num_ctx a lo que necesitas
    16 k bastan de sobra para la mayoría de los chats. 32 k+ solo se justifican para la síntesis de documentos largos.
  5. 05
    Preferir batch=1 para el chat interactivo
    El MoE pierde parte de su ventaja con lotes grandes: si atiendes a varios usuarios simultáneamente, considera vLLM en lugar de Ollama.

#Solución de problemas

OOM al cargar en RTX 4090
Reduce num_ctx a 4096 y comprueba que no se esté ejecutando ningún otro proceso en la GPU (navegador, juego). Q4_K_M debería caber con entre 2 y 3 GB de margen.
Generación a 5 tok/s en RTX 4090
Parte del modelo se ejecuta en la CPU. ollama ps mostrará una combinación CPU/GPU. Cierra todo, reinicia Ollama o baja a Q3_K_M.
Respuestas incoherentes en francés
Comprueba que usas la variante Instruct y no Base. El enrutamiento MoE es sensible a la formulación del prompt de sistema: sé directo.
Primer token muy lento (>10s)
Fase de evaluación del prompt larga: es normal con un contexto amplio en un modelo MoE. Reutiliza la caché del prompt entre solicitudes (opción --prompt-cache de llama.cpp).
Modelo no encontrado en Ollama
La etiqueta exacta puede variar (qwen3.6 vs qwen3_6 vs qwen36). Busca en ollama.com/library antes de escribir el comando.

#Para ir más allá

Ahora que Qwen3.6 35B-A3B funciona en tu equipo, aquí tienes algunas ideas para llevar tu configuración más lejos:

Elegir tu cuantización (Q4, Q5, Q8, FP16)
Para entender con precisión lo que sucede entre Q3, Q4 y Q5 en un modelo MoE.
Open WebUI con Ollama
Una interfaz similar a ChatGPT con historial y RAG, que funciona sobre tu Qwen3.6 local.
Elegir tu GPU para IA local
Si dudas entre una 3090 de segunda mano, una 4090 o una 5090 para este tipo de modelo MoE 30B+
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.