MoE explicado: por qué un 30B-A3B funciona como un pequeño modelo
Desde 2025, la mayoría de los grandes lanzamientos de modelos con pesos abiertos tienen algo en común: son modelos Mixture of Experts, o MoE. Aparecen nombres como Qwen3 30B-A3B, gpt-oss 120B o Llama 4 Scout 17B-A2B, con esa notación de dos números que despierta curiosidad. La idea es sencilla una vez explicada: un modelo MoE contiene muchos parámetros, pero solo activa una pequeña fracción en cada token. Como resultado, un modelo de «30 mil millones» puede funcionar a la velocidad de un modelo de 3 mil millones. Esta guía explica el mecanismo, descifra la notación y detalla el impacto real en tu VRAM y tu velocidad de generación.
#El problema que resuelve el MoE
Un modelo de lenguaje clásico se denomina «denso»: para generar cada palabra, hace pasar tu texto por todos sus parámetros. Un modelo denso de 32B utiliza sus 32 mil millones de parámetros en cada token. Eso es lo que lo hace potente, pero también lento y exigente en recursos: cuantos más parámetros tiene, más cálculo y memoria necesita, sin escapatoria.
Ahí está el dilema de ejecutar modelos en local. Queremos los conocimientos y la sutileza de un modelo grande, pero la velocidad y el bajo consumo de uno pequeño. En una tarjeta gráfica de consumo, un modelo denso de 70B está fuera de nuestro alcance o resulta desesperantemente lento. Mixture of Experts rompe ese compromiso al separar dos cosas que creíamos vinculadas: el tamaño del modelo y el coste de cada token.
#El principio: expertos activados bajo demanda
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
En un modelo Mixture of Experts, las grandes capas de cálculo ya no son un bloque único, sino un conjunto de subredes llamadas «expertos». Un modelo puede contener 64, 128, a veces más. Para cada token procesado, un pequeño selector —el «enrutador»— examina el contexto y elige solo 2, 4 u 8 expertos para activar. El resto de los expertos no realiza ningún cálculo para ese token.
A diferencia de lo que sugiere la palabra, estos expertos no son temáticos: no hay un «experto en francés» ni un «experto en código». El router se entrena al mismo tiempo que el modelo y distribuye el trabajo según patrones estadísticos que nadie controla manualmente. De un token a otro, la selección cambia. En una frase completa, casi todos los expertos acaban interviniendo, pero nunca todos al mismo tiempo.
- Expertos
- Subredes especializadas, todas presentes en memoria, pero de las que solo una minoría trabaja en cada token.
- Ruteador (gating)
- El componente ligero que decide, token por token, qué expertos activar.
- Expertos activos
- El número de expertos activados por token, normalmente entre 2 y 8. Es este número el que determina la velocidad.
- Parámetros activos
- El total de parámetros realmente utilizados por token — la fracción que cuenta para el cálculo.
#Decodificar la notación 30B-A3B
La notación que confunde a los principiantes es en realidad muy fácil de interpretar una vez que conoces la clave. Tomemos Qwen3 30B-A3B: el primer número es el total de parámetros del modelo; el segundo (después de la «A», de Active, «activo» en inglés) es el número de parámetros activos por token.
- 30B
- El modelo tiene un total de 30 mil millones de parámetros. Es esto lo que determina la memoria necesaria para cargarlo.
- A3B
- Solo unos 3 mil millones de parámetros están activos en cada token. Eso es lo que determina la velocidad de generación.
Es decir, 30B-A3B se lee «30 mil millones en reserva, 3 mil millones trabajando». El modelo tiene la riqueza de conocimientos de un 30B, pero genera aproximadamente a la velocidad de un 3B denso. Esta misma lógica se aplica a todos los demás lanzamientos recientes.
- Qwen3 30B-A3B
- 30 mil millones en total, 3 mil millones activos: el MoE para el gran público por excelencia.
- Llama 4 Scout 17B-A2B
- 17 mil millones en total, aproximadamente 2 mil millones activos por token, además de capacidades multimodales.
- gpt-oss 120B
- 120 mil millones en total, pero solo unos 5 mil millones activos: de ahí su sorprendente velocidad para su tamaño.
- DeepSeek V3.2 671B-A37B
- 671 mil millones en reserva, 37 mil millones activos: un gigante que «no cuesta» más que un modelo medio por token.
#VRAM: lo que realmente cambia
Este es el punto que peor se entiende, así que seamos claros. Todos los expertos de un MoE deben estar cargados en memoria, porque el enrutador puede llamar a cualquiera de ellos para el siguiente token. Por tanto, la VRAM necesaria depende del número total de parámetros, no del número de parámetros activos. Los requisitos de memoria de un 30B-A3B se calculan como los de un modelo denso de 30B.
- Qwen3 30B-A3B en Q4_K_M
- ≈ 18-19 GB de VRAM, como un modelo denso de 32B. Por tanto, está pensado para una RTX 4090 de 24 GB; en tarjetas de menor capacidad, parte del modelo se carga en la RAM.
- Llama 4 Scout 17B-A2B en Q4
- ≈ 10-11 GB, dentro del rango de una RTX 4070 de 12 GB o de una 3060 de 12 GB.
- gpt-oss 120B
- Varias decenas de GB: reservado para equipos potentes o para el offload a RAM/SSD.
La buena noticia del MoE en local no es, por tanto, la memoria, sino la relación calidad/velocidad con la misma cantidad de VRAM. Donde un modelo denso de 30B funciona con lentitud en tu tarjeta, un MoE 30B-A3B ocupa el mismo espacio y genera mucho más rápido. Y como los expertos inactivos no se utilizan en cada token, los MoE suelen tolerar bien la descarga de parte de los pesos en la RAM: lo que permanece en la GPU se utiliza de forma prioritaria.
#Velocidad: por qué es rápido
La velocidad de generación de un LLM depende principalmente del número de parámetros que se procesan en cada token. Como un MoE solo activa una pequeña fracción, la cantidad de cálculo por token se reduce drásticamente. En concreto, un 30B-A3B genera tokens a un ritmo cercano al de un modelo denso de 3B, al tiempo que responde con la profundidad de un 30B.
Eso es exactamente lo que explica la popularidad de los MoE en configuraciones modestas: se obtiene la calidad de un modelo grande sin sufrir su lentitud. El precio que hay que pagar está en otro lugar —en la memoria, como ya vimos, y en un mayor espacio ocupado en disco al descargarlos, puesto que hay que almacenar todos los expertos—.
- Lo que acelera
- Pocos parámetros activos por token → menos cálculo → más tokens por segundo.
- Lo que no cambia
- La VRAM y el tamaño del archivo, que dependen del número total de parámetros.
- La ganancia neta
- A igual memoria, un MoE ofrece más conocimiento con una velocidad comparable a la de un modelo denso mucho más pequeño.
#Las limitaciones que debes conocer
El MoE no es mágico y no vuelve obsoletos los modelos densos. Con el mismo número de parámetros activos, un modelo denso suele estar un peldaño por encima en finura de razonamiento: un 30B-A3B es excelente, pero un verdadero modelo denso de 30B que activara sus 30 mil millones de parámetros en cada token sería más potente, a costa de una lentitud prohibitiva al ejecutarlo localmente.
- Memoria no reducida
- Se necesita VRAM para el modelo completo. Un MoE no hace que un modelo grande quepa en una tarjeta pequeña.
- Calidad por token activa
- Con un número comparable de parámetros activos, un modelo denso bien entrenado suele mantener la ventaja en las tareas de razonamiento más exigentes.
- Descarga más pesada
- Se almacenan todos los expertos: el tamaño del archivo GGUF corresponde al total de parámetros, no solo a los activos.
- Sensibilidad a la cuantización
- El router y algunos expertos toleran mal una cuantización demasiado agresiva; permanece en Q4_K_M o superior.
#Los modelos MoE destacados para probar localmente
Aquí tienes los modelos Mixture of Experts que más sentido tienen para probar localmente en 2026, desde el más accesible hasta el más exigente.
- Qwen3 30B-A3B
- El mejor punto de entrada. Calidad sólida tanto en tareas generales como en código, velocidad notable, ~18 GB en Q4. La referencia para descubrir el MoE.
- Llama 4 Scout 17B-A2B
- MoE multimodal (texto + imagen) con contexto largo y menor consumo de VRAM. Ideal si tienes una tarjeta de 12 GB.
- gpt-oss 120B
- El modelo de pesos abiertos de OpenAI, con solo ~5B activos: sorprendentemente rápido para su tamaño, pero requiere una configuración potente.
- DeepSeek V3.2 671B-A37B
- El monstruo. Reservado para configuraciones con mucha RAM y una descarga intensiva de pesos a la RAM, para quienes sienten curiosidad por los modelos de gama más alta.
Si estás empezando, comienza con Qwen3 30B-A3B: es el MoE que mejor muestra las ventajas de la arquitectura en una sola tarjeta de consumo.
#Probar un MoE en 3 minutos
Si Ollama ya está instalado y escucha en su puerto predeterminado, dos comandos son suficientes para sentir la diferencia entre un MoE y uno denso.
- 01Descargar y ejecutar un MoEDescarga Qwen3 30B-A3B y conversa inmediatamente con él. La primera ejecución descarga el modelo (calcula varios GB).
- 02Observar la velocidadHaz una pregunta un poco larga y anota la velocidad de generación. A pesar de sus 30 mil millones de parámetros, responde al instante, a la velocidad de un modelo pequeño.
- 03Comparar con un modelo densoArranca un modelo denso de tamaño similar y plantea la misma pregunta. El MoE debería generar claramente más rápido, con una cantidad de VRAM comparable.
#Para ir más allá
El MoE se entiende mejor al relacionarlo con otros conceptos básicos de la ejecución local. Estas guías amplían directamente esta guía:
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- El MoE es sensible a una cuantización demasiado agresiva: esta guía ayuda a encontrar el equilibrio adecuado entre calidad y memoria.
- Instalar Ollama: Windows, macOS y Linux
- Para poner en marcha el daemon local en el puerto 11434 antes de descargar tu primer MoE.
- Llama 4 Scout en local: instalación y primeras pruebas con Ollama
- Un MoE multimodal detallado paso a paso, para ver la teoría de esta guía en acción.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.