Configuración de PC IA: presupuesto de 32 GB VRAM
Con 32 GB de VRAM, cargamos un modelo denso de 32 mil millones de parámetros en Q4 (aproximadamente 19 a 20 GB) o Qwen3-Coder 30B-A3B (19 GB), pero no un modelo de 30 mil millones en Q8 (aproximadamente 32 GB) ni un 70B en Q4 (aproximadamente 40 GB). Se alcanzan 32 GB con una tarjeta de 32 GB, o 48 GB con dos tarjetas de 24 GB.
Esta página indica cuánta VRAM se debe buscar según el modelo, compara una tarjeta única de 32 GB, dos tarjetas de 24 GB y una tarjeta de 24 GB, dimensiona la alimentación, la RAM, el almacenamiento y el gabinete, y corrige un error común: un modelo de 30B en Q8 no cabe en 32 GB.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#Lo que realmente permite tener 32 GB de VRAM
Con 32 GB de VRAM, se puede cargar con holgura un modelo denso de 32 mil millones de parámetros en Q4 (unos 19 a 20 GB de pesos) con varios miles de tokens de contexto, o un modelo de expertos de 30 mil millones como Qwen3-Coder 30B-A3B, que la biblioteca de Ollama anuncia con un tamaño de 19 GB. No se puede cargar un modelo de 30 mil millones de parámetros en Q8: ocupa unos 32 GB, tanto como toda la capacidad de la tarjeta, sin espacio para el contexto ni para la memoria reservada por el controlador. Un 70B en Q4, de unos 40 GB, tampoco cabe. Los 32 GB se consiguen con una sola tarjeta de 32 GB o con dos tarjetas de 24 GB, dos opciones que implican compromisos muy distintos.
| Modelo | Tamaño del modelo | 24 GB (1 tarjeta) | 32 GB (1 tarjeta) | 48 GB (2 × 24 GB) |
|---|---|---|---|---|
| Qwen3-Coder 30B-A3B en Q4 | ≈ 19 GB | Sí, contexto medio | Sí, contexto largo | Sí |
| Modelo denso de 32B en Q4 | ≈ 19 a 20 GB | Cabe justo, con contexto corto | Sí | Sí |
| Modelo denso de 32B en Q8 | ≈ 34 GB | No | No | Sí, contexto medio |
| Modelo de 30B en Q8 | ≈ 32 GB | No | No, no hay margen | Sí |
| 70B en Q4 | ≈ 40 GB | No | No | Sí, contexto corto |
El Q8 pesa aproximadamente un byte por parámetro: por eso un modelo de 30 mil millones de parámetros no cabe en 32 GB. Como la tarjeta no puede dedicar toda su memoria al modelo, hay que procurar que el tamaño del modelo sea al menos entre 3 y 4 GB inferior a la capacidad de VRAM para dejar espacio para la caché KV. La calculadora de VRAM del sitio realiza este cálculo para un modelo y un contexto dados.
#La tarjeta gráfica: tres vías para alcanzar entre 24 y 48 GB
#Ruta A: una tarjeta de 32 GB
La RTX 5090 incluye 32 GB de GDDR7 en una interfaz de 512 bits, según NVIDIA. Su potencia gráfica total alcanza 575 W y NVIDIA indica 1.000 W para la potencia requerida del sistema. Se alimenta mediante cuatro cables PCIe de 8 pines a través del adaptador proporcionado, o mediante un cable PCIe Gen 5 de 600 W. Un solo GPU evita cualquier configuración de múltiples tarjetas: es la vía más sencilla y la que ofrece la mejor velocidad por modelo, ya que la memoria no se distribuye entre tarjetas.
#Opción B: dos tarjetas de 24 GB
La RTX 3090 ofrece 24 GB de GDDR6X; NVIDIA indica una potencia de tarjeta de 350 W y una potencia de sistema requerida de 750 W para una sola tarjeta. Dos tarjetas dan 48 GB distribuidos, con 700 W solo para las tarjetas. En llama.cpp, la opción de distribución es --split-mode: por defecto, el modo layer divide las capas entre las GPU, y --tensor-split fija la proporción asignada a cada tarjeta. El modo tensor se describe como experimental. La distribución no acelera la generación como lo haría una única tarjeta más rápida: sirve principalmente para que quepa un modelo más grande.
#Vía C: una sola tarjeta de 24 GB, presupuesto ajustado
Una RTX 3090 o 4090 de segunda mano, con 24 GB, ya permite ejecutar un modelo MoE de 30 mil millones de parámetros en Q4 y uno denso de 27 a 32 mil millones con un contexto corto. Es una opción para un presupuesto limitado a unos pocos miles de euros: los precios cambian cada semana, así que el seguimiento de /prix-gpu-ia es la única referencia fiable. El margen se reduce rápidamente al aumentar el contexto: la caché KV de varios gigabytes consume los 4 a 5 GB restantes.
| Criterio | Una tarjeta de 32 GB | Dos tarjetas de 24 GB | Una tarjeta de 24 GB |
|---|---|---|---|
| VRAM útil | 32 GB | 48 GB distribuidos | 24 GB |
| Complejidad | Ninguna | Distribución que debe configurarse, dos tarjetas voluminosas | Ninguna |
| Potencia de las tarjetas | 575 W (RTX 5090) | 2 × 350 W (RTX 3090) | 350 W (RTX 3090) |
| Alimentación | Al menos 1 000 W (NVIDIA) | Se recomiendan al menos 1 200 W (cálculo de esta guía) | 750 W (NVIDIA) |
| Modelo más grande en Q4 | 32B con contexto | 70B con contexto corto | 30B expertos, 32B corto |
#El contexto: la memoria que la VRAM deja disponible para la caché KV
El peso del modelo no lo dice todo: cada token de contexto añade una entrada a la caché KV, almacenada también en VRAM. La ficha de Qwen3-Coder-30B-A3B indica 48 capas y atención agrupada con 32 cabezas de consulta y 4 cabezas KV. Esta estructura divide entre ocho el tamaño de la caché KV respecto a un modelo que tuviera tantas cabezas KV como cabezas de consulta, lo que explica que un modelo así admita contextos muy largos en una tarjeta de 24 o 32 GB. No todos los modelos son tan eficientes: cuantas más cabezas KV tiene un modelo, más rápido crece su caché con el contexto.
La regla práctica sigue siendo la misma: empieza por el tamaño del modelo, añade de 3 a 4 GB de margen y después comprueba cuánto queda para el contexto deseado. Si falta margen, aplica cuantización a la caché KV en lugar de reducir la cuantización del modelo: la guía específica explica ese equilibrio.
#CPU, RAM y placa base: no desperdiciar el presupuesto
Durante la generación en GPU, el procesador trabaja poco: carga los modelos, tokeniza, prepara el contexto y ejecuta el sistema. Un procesador de gama media basta, y el dinero se invierte mejor en la VRAM. La placa base cuenta más: para dos tarjetas de 24 GB, se necesitan dos slots PCIe x16 físicamente separados y suficiente espacio para tarjetas gruesas (NVIDIA describe a la RTX 3090 Founders Edition como una tarjeta de tres slots). El número de líneas PCIe por slot influye poco en la generación, una vez cargado el modelo.
En cuanto a la memoria del sistema, 32 GB es el mínimo para un PC equipado con una tarjeta de 32 GB; 64 GB resulta más cómodo si mantienes un IDE, un navegador y un contenedor abiertos mientras el modelo está en ejecución, o si pasas parte del modelo al procesador. En este último caso, la velocidad depende de la RAM: ver la guía sobre LLM sin GPU. Una búsqueda frecuente, «LLM 32 GB RAM», suele referirse a esta situación: con 32 GB de RAM y sin tarjeta gráfica, los modelos de 7 a 14 mil millones de parámetros en Q4 siguen siendo utilizables; un 32B en Q4 (aproximadamente 19 a 20 GB) cabe, pero genera lentamente.
#Fuente de alimentación: la partida en la que no debes escatimar
NVIDIA indica una potencia requerida para el sistema de 1.000 W para una RTX 5090 y de 750 W para una RTX 3090. Para dos RTX 3090, el cálculo es sencillo: 2 × 350 W de las tarjetas, más unos 250 W para el procesador, la placa base, los discos y los ventiladores, suman unos 950 W bajo carga, con picos por encima de esa cifra. Una fuente de alimentación de 1.200 W o más deja un margen adecuado; es una recomendación de esta guía, no una especificación de Apple o NVIDIA. Comprueba también el número de conectores PCIe de 8 pines: una RTX 5090 requiere cuatro mediante el adaptador, o un cable PCIe Gen 5 de 600 W.
#Almacenamiento: la velocidad de carga, no la capacidad
Un modelo de 20 a 40 GB se carga cada vez que se cambia de modelo. Cálculo con suposiciones ajustables: a 200 MB/s, la velocidad típica de un disco duro, 40 GB requieren aproximadamente 200 segundos; a 3,5 GB/s, la velocidad de un SSD NVMe, aproximadamente 12 segundos. Un SSD NVMe de 2 TB basta para una decena de modelos y un índice de RAG; un segundo disco sirve para respaldos. El beneficio de un SSD PCIe 5.0 en la generación es nulo: se ejecuta en VRAM.
#Carcasa y refrigeración
Una tarjeta de 575 W genera tanto calor como un pequeño radiador: la caja debe evacuar el aire caliente más rápido de lo que entra, con una entrada de aire frontal y ventiladores en la parte trasera y superior. Dos tarjetas gruesas colocadas una junto a la otra se calientan mutuamente: deja una ranura libre entre ellas o elige modelos más delgados. La guía sobre el comportamiento térmico durante la inferencia detalla las temperaturas que debes vigilar y las curvas de los ventiladores.
- ¿Qué LLM para 32 GB de VRAM?
- ¿Qué LLM para 24 GB de VRAM?
- ¿Qué LLM en RTX 5090?
- ¿Qué LLM en RTX 3090 y 3090 Ti?
- LLM multi-GPU con llama.cpp
- Precios de las tarjetas gráficas para IA local
#Validar la configuración antes de comprar
- 01Partir del modelo, no de la tarjetaElige el modelo y la cuantización deseados y añade de 3 a 4 GB para la caché KV y el controlador: el total da la VRAM mínima. La calculadora de VRAM del sitio realiza este cálculo.
- 02Elegir la configuración de GPUUna tarjeta de 32 GB por simplicidad, dos tarjetas de 24 GB si el presupuesto es prioritario y si el chasis y la placa madre lo permiten, una sola tarjeta de 24 GB para un presupuesto ajustado.
- 03Dimensionar la fuente de alimentaciónElige al menos la potencia del sistema que NVIDIA indica para la tarjeta y añade margen para dos tarjetas. Cuenta los conectores PCIe.
- 04Verificar la carcasaLongitud, grosor y circulación de aire para cada tarjeta. Dos tarjetas gruesas requieren un gabinete amplio y una placa base con slots espaciados.
- 05Después de ensamblar, controlar la cargaEl comando nvidia-smi muestra la VRAM utilizada y la potencia consumida por cada tarjeta; ollama ps indica si el modelo se ejecuta íntegramente en la GPU.
- Fuente: NVIDIA, ficha de la GeForce RTX 5090
- Fuente: NVIDIA, ficha de la GeForce RTX 3090 y RTX 3090 Ti
- Fuente: ficha de Hugging Face de Qwen3-Coder-30B-A3B
- Fuente: biblioteca Ollama, Qwen3-Coder
#Preguntas frecuentes
¿32 GB de VRAM son suficientes para un modelo de 32 mil millones de parámetros?+
¿RTX 5090 o dos RTX 3090 para 32 GB de VRAM?+
¿Qué configuración para ejecutar Qwen3-Coder 30B-A3B?+
¿Son suficientes 32 GB de RAM para un LLM sin tarjeta gráfica?+
¿Qué fuente de alimentación elegir para una RTX 5090?+
¿Dónde encontrar los precios actuales de las tarjetas gráficas para la IA?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.