Principiante 8 minConceptos

MoE explicado: por qué un 30B-A3B funciona como un pequeño modelo

Desde 2025, la mayoría de los grandes lanzamientos de modelos con pesos abiertos tienen algo en común: son modelos Mixture of Experts, o MoE. Aparecen nombres como Qwen3 30B-A3B, gpt-oss 120B o Llama 4 Scout 17B-A2B, con esa notación de dos números que despierta curiosidad. La idea es sencilla una vez explicada: un modelo MoE contiene muchos parámetros, pero solo activa una pequeña fracción en cada token. Como resultado, un modelo de «30 mil millones» puede funcionar a la velocidad de un modelo de 3 mil millones. Esta guía explica el mecanismo, descifra la notación y detalla el impacto real en tu VRAM y tu velocidad de generación.

Por Mohamed Meguedmi·Actualización 2026-08-02·Probado en Windows, macOS y Linux

#El problema que resuelve el MoE

Un modelo de lenguaje clásico se denomina «denso»: para generar cada palabra, hace pasar tu texto por todos sus parámetros. Un modelo denso de 32B utiliza sus 32 mil millones de parámetros en cada token. Eso es lo que lo hace potente, pero también lento y exigente en recursos: cuantos más parámetros tiene, más cálculo y memoria necesita, sin escapatoria.

Ahí está el dilema de ejecutar modelos en local. Queremos los conocimientos y la sutileza de un modelo grande, pero la velocidad y el bajo consumo de uno pequeño. En una tarjeta gráfica de consumo, un modelo denso de 70B está fuera de nuestro alcance o resulta desesperantemente lento. Mixture of Experts rompe ese compromiso al separar dos cosas que creíamos vinculadas: el tamaño del modelo y el coste de cada token.

i
Intuición en una frase
Un modelo denso hace trabajar a todos en cada pregunta. Un MoE despierta solo a los pocos especialistas pertinentes y deja dormir a los demás.

#El principio: expertos activados bajo demanda

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

En un modelo Mixture of Experts, las grandes capas de cálculo ya no son un bloque único, sino un conjunto de subredes llamadas «expertos». Un modelo puede contener 64, 128, a veces más. Para cada token procesado, un pequeño selector —el «enrutador»— examina el contexto y elige solo 2, 4 u 8 expertos para activar. El resto de los expertos no realiza ningún cálculo para ese token.

A diferencia de lo que sugiere la palabra, estos expertos no son temáticos: no hay un «experto en francés» ni un «experto en código». El router se entrena al mismo tiempo que el modelo y distribuye el trabajo según patrones estadísticos que nadie controla manualmente. De un token a otro, la selección cambia. En una frase completa, casi todos los expertos acaban interviniendo, pero nunca todos al mismo tiempo.

Expertos
Subredes especializadas, todas presentes en memoria, pero de las que solo una minoría trabaja en cada token.
Ruteador (gating)
El componente ligero que decide, token por token, qué expertos activar.
Expertos activos
El número de expertos activados por token, normalmente entre 2 y 8. Es este número el que determina la velocidad.
Parámetros activos
El total de parámetros realmente utilizados por token — la fracción que cuenta para el cálculo.
→
Una imagen mental
Imagina un consultorio de 128 médicos. El paciente es atendido por un orientador que lo dirige hacia los 4 especialistas más pertinentes. El consultorio es enorme (muchos conocimientos disponibles), pero cada consulta solo involucra a 4 personas (bajo costo por paciente).

#Decodificar la notación 30B-A3B

La notación que confunde a los principiantes es en realidad muy fácil de interpretar una vez que conoces la clave. Tomemos Qwen3 30B-A3B: el primer número es el total de parámetros del modelo; el segundo (después de la «A», de Active, «activo» en inglés) es el número de parámetros activos por token.

30B
El modelo tiene un total de 30 mil millones de parámetros. Es esto lo que determina la memoria necesaria para cargarlo.
A3B
Solo unos 3 mil millones de parámetros están activos en cada token. Eso es lo que determina la velocidad de generación.

Es decir, 30B-A3B se lee «30 mil millones en reserva, 3 mil millones trabajando». El modelo tiene la riqueza de conocimientos de un 30B, pero genera aproximadamente a la velocidad de un 3B denso. Esta misma lógica se aplica a todos los demás lanzamientos recientes.

Qwen3 30B-A3B
30 mil millones en total, 3 mil millones activos: el MoE para el gran público por excelencia.
Llama 4 Scout 17B-A2B
17 mil millones en total, aproximadamente 2 mil millones activos por token, además de capacidades multimodales.
gpt-oss 120B
120 mil millones en total, pero solo unos 5 mil millones activos: de ahí su sorprendente velocidad para su tamaño.
DeepSeek V3.2 671B-A37B
671 mil millones en reserva, 37 mil millones activos: un gigante que «no cuesta» más que un modelo medio por token.
!
La trampa al interpretar las cifras
El segundo número no reduce la memoria: un 30B-A3B ocupa el espacio de un 30B, no de un 3B. El «A3B» acelera el cálculo, no comprime el modelo. Es la confusión número 1 entre los principiantes.

#VRAM: lo que realmente cambia

Este es el punto que peor se entiende, así que seamos claros. Todos los expertos de un MoE deben estar cargados en memoria, porque el enrutador puede llamar a cualquiera de ellos para el siguiente token. Por tanto, la VRAM necesaria depende del número total de parámetros, no del número de parámetros activos. Los requisitos de memoria de un 30B-A3B se calculan como los de un modelo denso de 30B.

Qwen3 30B-A3B en Q4_K_M
≈ 18-19 GB de VRAM, como un modelo denso de 32B. Por tanto, está pensado para una RTX 4090 de 24 GB; en tarjetas de menor capacidad, parte del modelo se carga en la RAM.
Llama 4 Scout 17B-A2B en Q4
≈ 10-11 GB, dentro del rango de una RTX 4070 de 12 GB o de una 3060 de 12 GB.
gpt-oss 120B
Varias decenas de GB: reservado para equipos potentes o para el offload a RAM/SSD.

La buena noticia del MoE en local no es, por tanto, la memoria, sino la relación calidad/velocidad con la misma cantidad de VRAM. Donde un modelo denso de 30B funciona con lentitud en tu tarjeta, un MoE 30B-A3B ocupa el mismo espacio y genera mucho más rápido. Y como los expertos inactivos no se utilizan en cada token, los MoE suelen tolerar bien la descarga de parte de los pesos en la RAM: lo que permanece en la GPU se utiliza de forma prioritaria.

i
Indicador de VRAM en Q4
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Para un MoE, aplica estos valores de referencia al primer número (el total), nunca al número activo.

#Velocidad: por qué es rápido

La velocidad de generación de un LLM depende principalmente del número de parámetros que se procesan en cada token. Como un MoE solo activa una pequeña fracción, la cantidad de cálculo por token se reduce drásticamente. En concreto, un 30B-A3B genera tokens a un ritmo cercano al de un modelo denso de 3B, al tiempo que responde con la profundidad de un 30B.

Eso es exactamente lo que explica la popularidad de los MoE en configuraciones modestas: se obtiene la calidad de un modelo grande sin sufrir su lentitud. El precio que hay que pagar está en otro lugar —en la memoria, como ya vimos, y en un mayor espacio ocupado en disco al descargarlos, puesto que hay que almacenar todos los expertos—.

Lo que acelera
Pocos parámetros activos por token → menos cálculo → más tokens por segundo.
Lo que no cambia
La VRAM y el tamaño del archivo, que dependen del número total de parámetros.
La ganancia neta
A igual memoria, un MoE ofrece más conocimiento con una velocidad comparable a la de un modelo denso mucho más pequeño.

#Las limitaciones que debes conocer

El MoE no es mágico y no vuelve obsoletos los modelos densos. Con el mismo número de parámetros activos, un modelo denso suele estar un peldaño por encima en finura de razonamiento: un 30B-A3B es excelente, pero un verdadero modelo denso de 30B que activara sus 30 mil millones de parámetros en cada token sería más potente, a costa de una lentitud prohibitiva al ejecutarlo localmente.

Memoria no reducida
Se necesita VRAM para el modelo completo. Un MoE no hace que un modelo grande quepa en una tarjeta pequeña.
Calidad por token activa
Con un número comparable de parámetros activos, un modelo denso bien entrenado suele mantener la ventaja en las tareas de razonamiento más exigentes.
Descarga más pesada
Se almacenan todos los expertos: el tamaño del archivo GGUF corresponde al total de parámetros, no solo a los activos.
Sensibilidad a la cuantización
El router y algunos expertos toleran mal una cuantización demasiado agresiva; permanece en Q4_K_M o superior.
→
¿Cómo elegir en la práctica?
¿Tienes poca VRAM y necesitas velocidad con un buen nivel de conocimientos? Un MoE destaca. ¿Priorizas el razonamiento más preciso y dispones de una cantidad holgada de VRAM? Un modelo denso de tamaño equivalente en parámetros activos puede valer más la pena.

#Los modelos MoE destacados para probar localmente

Aquí tienes los modelos Mixture of Experts que más sentido tienen para probar localmente en 2026, desde el más accesible hasta el más exigente.

Qwen3 30B-A3B
El mejor punto de entrada. Calidad sólida tanto en tareas generales como en código, velocidad notable, ~18 GB en Q4. La referencia para descubrir el MoE.
Llama 4 Scout 17B-A2B
MoE multimodal (texto + imagen) con contexto largo y menor consumo de VRAM. Ideal si tienes una tarjeta de 12 GB.
gpt-oss 120B
El modelo de pesos abiertos de OpenAI, con solo ~5B activos: sorprendentemente rápido para su tamaño, pero requiere una configuración potente.
DeepSeek V3.2 671B-A37B
El monstruo. Reservado para configuraciones con mucha RAM y una descarga intensiva de pesos a la RAM, para quienes sienten curiosidad por los modelos de gama más alta.

Si estás empezando, comienza con Qwen3 30B-A3B: es el MoE que mejor muestra las ventajas de la arquitectura en una sola tarjeta de consumo.

#Probar un MoE en 3 minutos

Si Ollama ya está instalado y escucha en su puerto predeterminado, dos comandos son suficientes para sentir la diferencia entre un MoE y uno denso.

  1. 01
    Descargar y ejecutar un MoE
    Descarga Qwen3 30B-A3B y conversa inmediatamente con él. La primera ejecución descarga el modelo (calcula varios GB).
  2. 02
    Observar la velocidad
    Haz una pregunta un poco larga y anota la velocidad de generación. A pesar de sus 30 mil millones de parámetros, responde al instante, a la velocidad de un modelo pequeño.
  3. 03
    Comparar con un modelo denso
    Arranca un modelo denso de tamaño similar y plantea la misma pregunta. El MoE debería generar claramente más rápido, con una cantidad de VRAM comparable.
Terminal
# Lancer un MoE et discuter avec
ollama run qwen3:30b-a3b

# Pour comparer avec un dense de taille voisine
ollama run qwen3:32b
i
Comprobar la velocidad de generación
Agrega la opción --verbose (ollama run qwen3:30b-a3b --verbose) para ver los tokens/segundo al final de la respuesta y comparar objetivamente modelos MoE y densos en tu máquina.

#Para ir más allá

El MoE se entiende mejor al relacionarlo con otros conceptos básicos de la ejecución local. Estas guías amplían directamente esta guía:

Elegir tu cuantización (Q4, Q5, Q8, FP16)
El MoE es sensible a una cuantización demasiado agresiva: esta guía ayuda a encontrar el equilibrio adecuado entre calidad y memoria.
Instalar Ollama: Windows, macOS y Linux
Para poner en marcha el daemon local en el puerto 11434 antes de descargar tu primer MoE.
Llama 4 Scout en local: instalación y primeras pruebas con Ollama
Un MoE multimodal detallado paso a paso, para ver la teoría de esta guía en acción.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.