Intermedio 11 minBuild

Configuración de PC IA: presupuesto de 32 GB VRAM

Respuesta directa

Con 32 GB de VRAM, cargamos un modelo denso de 32 mil millones de parámetros en Q4 (aproximadamente 19 a 20 GB) o Qwen3-Coder 30B-A3B (19 GB), pero no un modelo de 30 mil millones en Q8 (aproximadamente 32 GB) ni un 70B en Q4 (aproximadamente 40 GB). Se alcanzan 32 GB con una tarjeta de 32 GB, o 48 GB con dos tarjetas de 24 GB.

Esta página indica cuánta VRAM se debe buscar según el modelo, compara una tarjeta única de 32 GB, dos tarjetas de 24 GB y una tarjeta de 24 GB, dimensiona la alimentación, la RAM, el almacenamiento y el gabinete, y corrige un error común: un modelo de 30B en Q8 no cabe en 32 GB.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux
Hardware recomendado

Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#Lo que realmente permite tener 32 GB de VRAM

Con 32 GB de VRAM, se puede cargar con holgura un modelo denso de 32 mil millones de parámetros en Q4 (unos 19 a 20 GB de pesos) con varios miles de tokens de contexto, o un modelo de expertos de 30 mil millones como Qwen3-Coder 30B-A3B, que la biblioteca de Ollama anuncia con un tamaño de 19 GB. No se puede cargar un modelo de 30 mil millones de parámetros en Q8: ocupa unos 32 GB, tanto como toda la capacidad de la tarjeta, sin espacio para el contexto ni para la memoria reservada por el controlador. Un 70B en Q4, de unos 40 GB, tampoco cabe. Los 32 GB se consiguen con una sola tarjeta de 32 GB o con dos tarjetas de 24 GB, dos opciones que implican compromisos muy distintos.

Lo que cabe según la VRAM disponible (solo los pesos, según las referencias del sitio; hay que añadir el contexto)
ModeloTamaño del modelo24 GB (1 tarjeta)32 GB (1 tarjeta)48 GB (2 × 24 GB)
Qwen3-Coder 30B-A3B en Q4≈ 19 GBSí, contexto medioSí, contexto largoSí
Modelo denso de 32B en Q4≈ 19 a 20 GBCabe justo, con contexto cortoSíSí
Modelo denso de 32B en Q8≈ 34 GBNoNoSí, contexto medio
Modelo de 30B en Q8≈ 32 GBNoNo, no hay margenSí
70B en Q4≈ 40 GBNoNoSí, contexto corto

El Q8 pesa aproximadamente un byte por parámetro: por eso un modelo de 30 mil millones de parámetros no cabe en 32 GB. Como la tarjeta no puede dedicar toda su memoria al modelo, hay que procurar que el tamaño del modelo sea al menos entre 3 y 4 GB inferior a la capacidad de VRAM para dejar espacio para la caché KV. La calculadora de VRAM del sitio realiza este cálculo para un modelo y un contexto dados.

#La tarjeta gráfica: tres vías para alcanzar entre 24 y 48 GB

#Ruta A: una tarjeta de 32 GB

La RTX 5090 incluye 32 GB de GDDR7 en una interfaz de 512 bits, según NVIDIA. Su potencia gráfica total alcanza 575 W y NVIDIA indica 1.000 W para la potencia requerida del sistema. Se alimenta mediante cuatro cables PCIe de 8 pines a través del adaptador proporcionado, o mediante un cable PCIe Gen 5 de 600 W. Un solo GPU evita cualquier configuración de múltiples tarjetas: es la vía más sencilla y la que ofrece la mejor velocidad por modelo, ya que la memoria no se distribuye entre tarjetas.

#Opción B: dos tarjetas de 24 GB

La RTX 3090 ofrece 24 GB de GDDR6X; NVIDIA indica una potencia de tarjeta de 350 W y una potencia de sistema requerida de 750 W para una sola tarjeta. Dos tarjetas dan 48 GB distribuidos, con 700 W solo para las tarjetas. En llama.cpp, la opción de distribución es --split-mode: por defecto, el modo layer divide las capas entre las GPU, y --tensor-split fija la proporción asignada a cada tarjeta. El modo tensor se describe como experimental. La distribución no acelera la generación como lo haría una única tarjeta más rápida: sirve principalmente para que quepa un modelo más grande.

#Vía C: una sola tarjeta de 24 GB, presupuesto ajustado

Una RTX 3090 o 4090 de segunda mano, con 24 GB, ya permite ejecutar un modelo MoE de 30 mil millones de parámetros en Q4 y uno denso de 27 a 32 mil millones con un contexto corto. Es una opción para un presupuesto limitado a unos pocos miles de euros: los precios cambian cada semana, así que el seguimiento de /prix-gpu-ia es la única referencia fiable. El margen se reduce rápidamente al aumentar el contexto: la caché KV de varios gigabytes consume los 4 a 5 GB restantes.

Comparar las tres vías
CriterioUna tarjeta de 32 GBDos tarjetas de 24 GBUna tarjeta de 24 GB
VRAM útil32 GB48 GB distribuidos24 GB
ComplejidadNingunaDistribución que debe configurarse, dos tarjetas voluminosasNinguna
Potencia de las tarjetas575 W (RTX 5090)2 × 350 W (RTX 3090)350 W (RTX 3090)
AlimentaciónAl menos 1 000 W (NVIDIA)Se recomiendan al menos 1 200 W (cálculo de esta guía)750 W (NVIDIA)
Modelo más grande en Q432B con contexto70B con contexto corto30B expertos, 32B corto

#El contexto: la memoria que la VRAM deja disponible para la caché KV

El peso del modelo no lo dice todo: cada token de contexto añade una entrada a la caché KV, almacenada también en VRAM. La ficha de Qwen3-Coder-30B-A3B indica 48 capas y atención agrupada con 32 cabezas de consulta y 4 cabezas KV. Esta estructura divide entre ocho el tamaño de la caché KV respecto a un modelo que tuviera tantas cabezas KV como cabezas de consulta, lo que explica que un modelo así admita contextos muy largos en una tarjeta de 24 o 32 GB. No todos los modelos son tan eficientes: cuantas más cabezas KV tiene un modelo, más rápido crece su caché con el contexto.

La regla práctica sigue siendo la misma: empieza por el tamaño del modelo, añade de 3 a 4 GB de margen y después comprueba cuánto queda para el contexto deseado. Si falta margen, aplica cuantización a la caché KV en lugar de reducir la cuantización del modelo: la guía específica explica ese equilibrio.

#CPU, RAM y placa base: no desperdiciar el presupuesto

Durante la generación en GPU, el procesador trabaja poco: carga los modelos, tokeniza, prepara el contexto y ejecuta el sistema. Un procesador de gama media basta, y el dinero se invierte mejor en la VRAM. La placa base cuenta más: para dos tarjetas de 24 GB, se necesitan dos slots PCIe x16 físicamente separados y suficiente espacio para tarjetas gruesas (NVIDIA describe a la RTX 3090 Founders Edition como una tarjeta de tres slots). El número de líneas PCIe por slot influye poco en la generación, una vez cargado el modelo.

En cuanto a la memoria del sistema, 32 GB es el mínimo para un PC equipado con una tarjeta de 32 GB; 64 GB resulta más cómodo si mantienes un IDE, un navegador y un contenedor abiertos mientras el modelo está en ejecución, o si pasas parte del modelo al procesador. En este último caso, la velocidad depende de la RAM: ver la guía sobre LLM sin GPU. Una búsqueda frecuente, «LLM 32 GB RAM», suele referirse a esta situación: con 32 GB de RAM y sin tarjeta gráfica, los modelos de 7 a 14 mil millones de parámetros en Q4 siguen siendo utilizables; un 32B en Q4 (aproximadamente 19 a 20 GB) cabe, pero genera lentamente.

#Fuente de alimentación: la partida en la que no debes escatimar

NVIDIA indica una potencia requerida para el sistema de 1.000 W para una RTX 5090 y de 750 W para una RTX 3090. Para dos RTX 3090, el cálculo es sencillo: 2 × 350 W de las tarjetas, más unos 250 W para el procesador, la placa base, los discos y los ventiladores, suman unos 950 W bajo carga, con picos por encima de esa cifra. Una fuente de alimentación de 1.200 W o más deja un margen adecuado; es una recomendación de esta guía, no una especificación de Apple o NVIDIA. Comprueba también el número de conectores PCIe de 8 pines: una RTX 5090 requiere cuatro mediante el adaptador, o un cable PCIe Gen 5 de 600 W.

!
No ahorrar en la fuente de alimentación
Una fuente de alimentación insuficiente apaga el PC bajo carga y, en el peor de los casos, daña la tarjeta o la placa base. La generación con un LLM mantiene la GPU cerca de su potencia máxima durante largos minutos, a diferencia de un juego, cuya carga varía: dimensiona la fuente para soportar el pico de forma continua.

#Almacenamiento: la velocidad de carga, no la capacidad

Un modelo de 20 a 40 GB se carga cada vez que se cambia de modelo. Cálculo con suposiciones ajustables: a 200 MB/s, la velocidad típica de un disco duro, 40 GB requieren aproximadamente 200 segundos; a 3,5 GB/s, la velocidad de un SSD NVMe, aproximadamente 12 segundos. Un SSD NVMe de 2 TB basta para una decena de modelos y un índice de RAG; un segundo disco sirve para respaldos. El beneficio de un SSD PCIe 5.0 en la generación es nulo: se ejecuta en VRAM.

#Carcasa y refrigeración

Una tarjeta de 575 W genera tanto calor como un pequeño radiador: la caja debe evacuar el aire caliente más rápido de lo que entra, con una entrada de aire frontal y ventiladores en la parte trasera y superior. Dos tarjetas gruesas colocadas una junto a la otra se calientan mutuamente: deja una ranura libre entre ellas o elige modelos más delgados. La guía sobre el comportamiento térmico durante la inferencia detalla las temperaturas que debes vigilar y las curvas de los ventiladores.

#Validar la configuración antes de comprar

  1. 01
    Partir del modelo, no de la tarjeta
    Elige el modelo y la cuantización deseados y añade de 3 a 4 GB para la caché KV y el controlador: el total da la VRAM mínima. La calculadora de VRAM del sitio realiza este cálculo.
  2. 02
    Elegir la configuración de GPU
    Una tarjeta de 32 GB por simplicidad, dos tarjetas de 24 GB si el presupuesto es prioritario y si el chasis y la placa madre lo permiten, una sola tarjeta de 24 GB para un presupuesto ajustado.
  3. 03
    Dimensionar la fuente de alimentación
    Elige al menos la potencia del sistema que NVIDIA indica para la tarjeta y añade margen para dos tarjetas. Cuenta los conectores PCIe.
  4. 04
    Verificar la carcasa
    Longitud, grosor y circulación de aire para cada tarjeta. Dos tarjetas gruesas requieren un gabinete amplio y una placa base con slots espaciados.
  5. 05
    Después de ensamblar, controlar la carga
    El comando nvidia-smi muestra la VRAM utilizada y la potencia consumida por cada tarjeta; ollama ps indica si el modelo se ejecuta íntegramente en la GPU.
Terminal
nvidia-smi
ollama ps

#Preguntas frecuentes

FAQ
¿32 GB de VRAM son suficientes para un modelo de 32 mil millones de parámetros?+
Sí, en Q4: el modelo ocupa aproximadamente entre 19 y 20 GB, lo que deja 12 GB para el contexto y el controlador. En Q8, con unos 34 GB, no cabe. Puedes optar por una cuantización intermedia, Q5 o Q6, si aceptas un contexto más corto. La calculadora de VRAM del sitio te da la respuesta para tu modelo.
¿RTX 5090 o dos RTX 3090 para 32 GB de VRAM?+
La RTX 5090 aporta 32 GB en una sola tarjeta, sin configuración multi-GPU, con 575 W. Dos RTX 3090 dan 48 GB distribuidos, con 700 W entre las dos tarjetas, y se necesita una fuente de alimentación de al menos 1 200 W más una placa base adecuada. Elige la 5090 por la simplicidad, las dos 3090 para cargar un 70B.
¿Qué configuración para ejecutar Qwen3-Coder 30B-A3B?+
El modelo cuenta con 30,5 mil millones de parámetros, de los cuales 3,3 mil millones están activos, y la biblioteca Ollama anuncia 19 GB para su versión predeterminada. Una tarjeta de 24 GB lo carga con un contexto medio; con 32 GB queda margen para un contexto largo. En Q8, con unos 32 GB, no cabe en una sola tarjeta de 32 GB.
¿Son suficientes 32 GB de RAM para un LLM sin tarjeta gráfica?+
Sí para modelos de 7 a 14 mil millones de parámetros en Q4, que pesan entre 5 y 9 GB. Un modelo de 32 mil millones en Q4 (alrededor de 19 a 20 GB) también cabe, pero genera lentamente, ya que la velocidad depende del ancho de banda de la RAM. La guía del LLM sin GPU detalla los modelos por niveles de RAM.
¿Qué fuente de alimentación elegir para una RTX 5090?+
NVIDIA indica que se requieren 1 000 W de potencia para el sistema, con cuatro conectores PCIe de 8 pines mediante el adaptador proporcionado o un cable PCIe Gen 5 de 600 W. Elige una fuente de alimentación de buena calidad de al menos 1 000 W, con ese cable nativo si es posible, y evita alargar el cable con adaptadores adicionales.
¿Dónde encontrar los precios actuales de las tarjetas gráficas para la IA?+
El sitio consulta periódicamente el precio más bajo de las tarjetas gráficas para IA local y el precio por gigabyte de VRAM. Esta página no muestra precios: cambian cada semana. Consulta la página de precios antes de decidir entre una tarjeta de 32 GB y dos tarjetas de 24 GB de ocasión.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.