Principiante 12 minBases

Arquitectura de un LLM: el transformer explicado simplement

Se habla por todas partes de «transformer», de «atención» y de «parámetros» sin explicar nunca qué significan estos términos. Esta guía abre el capó de un LLM y explica su arquitectura con analogías sencillas, sin una sola ecuación. Al final, entenderás la arquitectura de un LLM desde dentro y, sobre todo, por qué estas decisiones de diseño determinan la VRAM que necesita el modelo y la velocidad a la que responde en tu máquina.

Por Mohamed Meguedmi·Actualización 2026-09-12·Probado en Windows, macOS y Linux

#¿Por qué entender la arquitectura de un LLM?

Se puede ejecutar un LLM localmente sin saber nada de su funcionamiento interno — un ollama run suffit.. Pero cuanto se quiere elegir el buen modelo para la máquina, todos los términos técnicos se convierten en obstáculos: «32 capas», «7 mil millones de parámetros», «MoE 8x7B», «atención a 32 cabezas». Son estos números los que deciden si un modelo cabe en tu tarjeta gráfica o sobrecarga tu procesador.

La buena noticia: la arquitectura que domina todos los LLM actuales —el transformer— se basa en unas pocas ideas que se pueden explicar sin matemáticas. Entender estas ideas es pasar de «copio un comando sin entenderlo» a «sé por qué este modelo necesita 9 GB de VRAM y no 40».

i
Ninguna fórmula en esta guía
Todo se explica mediante analogías. Si buscas los detalles matemáticos (producto escalar, softmax, codificación posicional), esta guía no está pensada para eso: busca darte una intuición acertada, la que basta para elegir y ejecutar un modelo en local.

#El transformer en una imagen

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Un LLM moderno es un transformer: una máquina que recibe un texto de entrada y predice la palabra siguiente, una y otra vez. El nombre proviene del artículo «Attention Is All You Need» (Google, 2017), que introdujo esta arquitectura. Todos los modelos que encuentres — Llama, Qwen, Mistral, Gemma, DeepSeek, Phi — son variantes de él.

Imagina una línea de producción. En la entrada, tu frase dividida en fragmentos. Cada estación de la línea (una «capa») enriquece la comprensión del texto, teniendo en cuenta el contexto. En la salida, el modelo propone el siguiente fragmento más probable. Se repite el proceso para cada nuevo fragmento generado. Es todo — el resto son detalles sobre lo que hace cada estación.

Entrada
Tu texto, dividido en tokens (pequeños fragmentos de palabras)
Apilamiento de capas
Cada capa mejora la representación del texto. Un modelo tiene decenas de capas.
Atención
El mecanismo central de cada capa: hace que cada palabra «mire» hacia las demás.
Salida
Una probabilidad para cada token posible; el modelo elige uno, lo añade al texto y vuelve a empezar.

#De tus palabras a los tokens

Un LLM no ve letras ni siquiera palabras enteras: ve tokens. Un token es un fragmento de texto frecuente: a veces una palabra corta entera (« chat »), a veces un fragmento de palabra (« anti », « constitution »), a veces un espacio o un signo de puntuación. En francés, calcula aproximadamente 3 tokens por cada 2 palabras.

Cada token se convierte luego en una lista de números, llamada « embedding ». Es la traducción del texto a un idioma que la máquina puede manipular: coordenadas en un espacio donde las palabras cercanas en sentido están próximas geográficamente. «Rey» y «reina» están cerca; «rey» y «brócoli» están lejos.

→
La relación con la ventana de contexto
La «ventana de contexto» de un modelo (por ejemplo, 8k, 32k, 128k) se mide en tokens, no en palabras. Un contexto de 8.000 tokens ≈ 6.000 palabras en francés, es decir, unas diez páginas. Es la cantidad de texto que el modelo puede «tener en mente» de una sola vez.

#La atención, el corazón del transformer

La atención es la idea que lo cambió todo. Toma la frase «El ratón se comió el queso porque él tenía hambre». ¿A quién se refiere «él»? Al ratón, obviamente. Para saberlo, hay que relacionar «él» con «ratón», varias palabras antes. Eso es exactamente lo que hace la atención: para cada palabra, decide qué otras palabras de la frase son relevantes y en qué medida tenerlas en cuenta.

Analogía: en una reunión, cuando oyes un pronombre ambiguo, tu cerebro revisa lo dicho antes para saber de quién se habla. La atención funciona de la misma manera, en paralelo, para todas las palabras al mismo tiempo. Cada palabra «plantea una pregunta» (¿qué necesito para ser comprendida?) y «recibe respuestas» de las demás palabras, ponderadas por su pertinencia.

A menudo se habla de «cabezas de atención» (attention heads). Una cabeza es una forma de observar las relaciones; tener varias (32 cabezas, 64 cabezas…) permite al modelo seguir varios tipos de vínculos al mismo tiempo: la gramática por un lado, el tema del texto por otro y las referencias temporales por otro.

i
Por qué la atención consume tanta memoria
Cada palabra mira a todas las demás. Cuanto más largo es el contexto, más se dispara el número de relaciones que hay que almacenar (el «KV cache»). Por eso, un contexto muy grande (128k tokens) puede consumir tanta VRAM como los propios pesos del modelo.

#Las capas apiladas

Una sola capa de atención comprende relaciones simples. La potencia viene de apilar las capas: la salida de una capa se convierte en la entrada de la siguiente. Un modelo pequeño tiene unas veinte capas, uno grande varias decenas. Cada capa combina dos bloques: la atención (que conecta las palabras entre sí) y una red «feed-forward» (que procesa cada palabra individualmente, como un minicerebro que reflexiona sobre lo que acaba de leer).

Analogía: la lectura a varios niveles. La primera capa detecta palabras y gramática. Las capas intermedias construyen el significado de las frases. Las últimas capturan la intención, el tono, lo que debe venir a continuación. Cuantas más capas, más capacidad de razonamiento profundo — pero más cálculo se realiza por cada token generado.

Bloque de atención
Conecta las palabras entre sí (el contexto).
Bloque feed-forward
Transforma cada palabra en profundidad (los «conocimientos» del modelo).
Número de capas
La «profundidad». Cuantas más haya, más capaz —y más lento— será el modelo.
Anchura (dimensión oculta)
El tamaño de las listas de números. Cuanto mayor sea, más «ancho» y pesado será el modelo.

#¿Qué son exactamente los parámetros?

Cuando lees « 7B » o « 70B », la B significa « mil millones » (billion en inglés) y se refiere al número de parámetros. Un parámetro es un número ajustable dentro del modelo — uno de los innumerables controles ajustados durante el entrenamiento. Estos controles codifican todo lo que el modelo « sabe »: gramática, hechos, estilos, razonamientos.

Analogía: imagina una mesa de mezclas gigante con miles de millones de controles deslizantes. El entrenamiento consiste en ajustar cada control para que, a partir de miles de millones de ejemplos de texto, el modelo prediga correctamente la siguiente palabra. Una vez fijados, estos ajustes son los «pesos» (weights) que descargas cuando haces un ollama pull.

Cuantos más parámetros tenga un modelo, más podrá memorizar y aportar matices, pero más memoria ocupará y más lento será, porque cada token generado pasa por todos esos parámetros. Es la relación directa entre la cifra «7B» y los requisitos de hardware de tu máquina.

→
Parámetros ≠ bytes
Un parámetro no ocupa 1 byte. En precisión nativa (FP16), ocupa 2. Un modelo de 7B pesa entonces aproximadamente 14 GB en FP16. La cuantización reduce este tamaño al almacenar cada parámetro en menos bits — allí entran en juego Q4, Q5, Q8 (ver más abajo).

#Denso vs MoE: dos formas de estructurar el modelo

Hasta ahora, se ha descrito un transformador «denso»: cada token atraviesa todos los parámetros. Simple, pero costoso: un 70B denso utiliza sus 70 mil millones de parámetros con cada palabra generada.

La arquitectura MoE (Mixture of Experts) rompe esta regla. En lugar de un solo bloque feed-forward grande por capa, utiliza varios (los «expertos») y activa solo algunos para cada token, seleccionados por un pequeño componente de enrutamiento (el «router»). Analogía: en lugar de un médico generalista que responde a todo, una consulta de especialistas donde solo se consulta a los dos médicos pertinentes para tu caso.

Dense
Todos los parámetros intervienen en cada token. Ej.: Llama 3 8B, Qwen 14B, Gemma 27B.
MoE
Muchos parámetros en total, pero pocos activos por token. Ej.: Mixtral 8x7B, DeepSeek V3, Llama 4 Scout.
Notación MoE
« 30B-A3B » = 30 mil millones de parámetros en total, pero solo 3 mil millones activos (A = activos) por token.

La consecuencia es importante para la ejecución local: un MoE se comporta como un modelo pequeño en cuanto a velocidad (pocos parámetros activos), pero conserva los conocimientos de un modelo grande (muchos parámetros en total). El problema es la VRAM: hay que cargar todos los expertos en memoria, aunque solo se active una fracción de ellos a la vez.


#Por qué todo esto determina la VRAM y la velocidad

Llegamos al punto clave en la práctica. Dos recursos importan para el uso local: la memoria (para que quepa el modelo) y la capacidad de cálculo (para responder rápido). La arquitectura determina ambos.

#La memoria: los pesos deben caber

Para ser rápido, un modelo debe caber completamente en la VRAM de tu GPU (o en la memoria unificada de un Mac Apple Silicon). De lo contrario, una parte pasa a ejecutarse en el procesador y a almacenarse en la RAM, y la velocidad cae drásticamente. El tamaño depende del número de parámetros y de la cuantización.

3B en Q4
≈ 2 GB de VRAM
7B en Q4
≈ 5 GB
14B en Q4
≈ 9 GB
32B en Q4
≈ 19 GB
70B en Q4
≈ 40 GB

Añade la memoria del contexto (la caché KV), que crece con la longitud del prompt. Un contexto largo puede requerir varios gigabytes adicionales: no lo olvides cuando estés justo al límite de tu tarjeta.

#La velocidad: cuántos parámetros activos por token

La velocidad de generación (tokens por segundo) depende principalmente de los parámetros realmente activados en cada token. Por eso, un modelo 8B denso y un 30B-A3B MoE pueden tener una velocidad comparable: ambos activan solo alrededor de 3 a 8 mil millones de parámetros por token. El MoE simplemente necesitará mucha más VRAM para alojar a todos sus expertos.

!
El error común de desbordamiento
Un modelo que «casi cabe» en tu VRAM no cabe. En cuanto parte de las capas se transfiere a la CPU, la velocidad se reduce entre 5 y 20 veces. Es preferible un modelo algo más pequeño (o una cuantización más agresiva) que quepa al 100 % en la GPU.
RTX 3060 12 GB
Permite trabajar cómodamente con modelos de hasta 14B en Q4. Tarjeta ideal para empezar.
RTX 4070 / 4080 (12–16 GB)
Un modelo de 14B cabe con holgura; uno de 32B en Q4 cabe muy justo en la 4080.
RTX 4090 24 GB
32B en Q4 funciona con holgura; 70B queda fuera de alcance si se ejecuta íntegramente en la GPU.
Mac M4 Pro con 24–48 GB de memoria unificada
La memoria unificada funciona como VRAM: hasta un 70B en Q4 en configuraciones de 48 GB.

#Leer una ficha de modelo línea por línea

Ahora tienes las claves para desentrañar una ficha técnica. Tomemos un ejemplo típico, como el que se encuentra en Hugging Face o en la biblioteca Ollama:

Ficha del modelo (extracto típico)
{
  "architecture": "transformer (decoder-only)",
  "parameters": "14B",
  "type": "dense",
  "layers": 40,
  "attention_heads": 40,
  "context_length": 32768,
  "quantization": "Q4_K_M",
  "size_on_disk": "9 GB"
}
arquitectura: solo decodificador
El estándar de los LLM generativos: el modelo solo predice la continuación del texto (sin una parte «codificador» separada).
parameters: 14B
14 mil millones de parámetros. Consumo de memoria: ~9 GB en Q4, se necesita al menos una tarjeta de 12 GB.
type: dense
Todos los parámetros están activos por token. Si fuera un MoE, verías una notación tipo 30B-A3B.
layers: 40
40 capas apiladas. Esa es la profundidad: cuantas más capas hay, más fino es el razonamiento y más lento es el modelo.
attention_heads: 40
40 cabezas de atención por capa: otras tantas formas de conectar las palabras en paralelo.
context_length: 32768
32k tokens de contexto, es decir ~24 000 palabras. Cuidado: rellenar este contexto consume además VRAM.
cuantización: Q4_K_M
Precisión reducida a ~4 bits por parámetro. El mejor equilibrio calidad/tamaño para el uso local.
size_on_disk: 9 GB
Lo que descargas y lo que hay que cargar en memoria para alcanzar la velocidad máxima.

Con estas siete líneas, ya puedes responder a la única pregunta que importa: «¿funciona bien en mi máquina?». Aquí: 14B en Q4 = ~9 GB de peso + el contexto → una RTX 3060 de 12 GB o mejor, y funciona rápido.

→
El hábito que conviene mantener
Dos cifras bastan para un primer filtro: el número de parámetros (y si el modelo es denso o MoE) para la VRAM, y la cuantización para el tamaño real. El resto (capas, cabezas, contexto) afina la evaluación, pero no cambia la viabilidad básica.

#Para ir más allá

Ahora conoces la anatomía de un LLM. Tres guías permiten profundizar de forma natural en estas bases: la primera detalla la notación MoE y su impacto concreto, la segunda explica la elección de cuantización que determina el tamaño en disco y la tercera retoma la ventana de contexto mencionada aquí.


¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.