¿Qué LLM para 32 GB de VRAM? ?
Con 32 GB de VRAM, cargas completamente un modelo denso de 27 a 32B en Q4 (16 a 20 GB) con un contexto largo, un MoE de 30-35B (19 a 21 GB) o gpt-oss-20b (14 GB) con mucho margen. El modelo que no cabe es el 70B: ocupa entre 40 y 43 GB en Q4, por lo que necesariamente queda en parte en la memoria RAM, donde la velocidad cae en picado. Cuenta siempre la caché de contexto además de los pesos.
Los 32 GB de VRAM son el umbral en el que dejas de tener que elegir entre el tamaño del modelo y la longitud del contexto. Esta página indica qué cabe realmente en la memoria, qué cambia según la tarjeta (RTX 5090 o Radeon AI PRO R9700), por qué un modelo de 70B o de 123B sigue sin poder usarse con comodidad y cuándo la memoria unificada de un Mac o una segunda tarjeta es una mejor compra.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#32 GB de VRAM: qué cambia con esta capacidad respecto a 24 GB
Un modelo en Q4 ocupa aproximadamente 0,6 GB por cada mil millones de parámetros, más la caché de contexto, que crece con la longitud de la conversación. Con 24 GB, cabe un modelo denso de 27 a 32B en Q4 (16 a 20 GB), pero el contexto debe mantenerse corto. Con 32 GB, quedan de 12 a 16 GB para el contexto, las activaciones y el sistema: ese presupuesto permite ventanas de 32.000 a 128.000 tokens en un modelo de 27B, o un MoE de 30-35B con un margen cómodo.
| Modelo | Pesos Q4 | Memoria restante para el contexto y el sistema | Veredicto |
|---|---|---|---|
| gpt-oss-20b | 14 GB | 18 GB | Margen muy amplio, contexto largo |
| Qwen 3.5 27B / Qwen 3.8 27B | 16 GB | 16 GB | Cómodo, contexto largo posible |
| Gemma 4 31B | 18 GB | 14 GB | Cómodo |
| Qwen 3 32B | 19-20 GB | 12 GB | Bien, contexto a monitorear |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | 13 GB | Bien, muy rápido para su tamaño |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | 11 GB | Bien, contexto medio |
| Llama 3.3 70B | 43 GB | negativo | No cabe: offload obligatorio |
Estos valores son tamaños de archivos, no requisitos totales: la calculadora del sitio añade la caché para un modelo y un contexto determinados. La caché también puede cuantizarse en q8_0, lo que, según las preguntas frecuentes de Ollama, reduce su tamaño aproximadamente a la mitad respecto a f16, siempre que se active Flash Attention.
#Qué tarjetas ofrecen 32 GB y por qué importa el ancho de banda
Dos tarjetas de escritorio se distinguen. La GeForce RTX 5090 incluye 32 GB de GDDR7 en un bus de 512 bits, con 1.792 GB/s de ancho de banda según NVIDIA. La Radeon AI PRO R9700 de AMD también ofrece 32 GB, pero en GDDR6 en un bus de 256 bits, a 640 GB/s según AMD, para un ordenador de escritorio y uso profesional. La capacidad es idéntica; la velocidad de generación no lo es.
| Tarjeta | Memoria | Ancho de banda | Límite para un modelo de 19 GB |
|---|---|---|---|
| GeForce RTX 5090 | 32 GB GDDR7, 512 bits | 1 792 GB/s | aproximadamente 94 t/s |
| Radeon AI PRO R9700 | 32 GB GDDR6, 256 bits | 640 GB/s | aproximadamente 34 t/s |
El límite se calcula dividiendo el ancho de banda entre los pesos leídos en cada token; nunca se alcanza por completo, pero la relación sigue siendo válida: con el mismo modelo, la RTX 5090 genera a más del doble de velocidad que la R9700. En una tarjeta AMD, el controlador y la pila de software (ROCm, Vulkan) también cuentan; la guía dedicada a las tarjetas AMD detalla las limitaciones. Cada tarjeta concreta tiene su propia página: la de la RTX 5090 ofrece los detalles de esa tarjeta.
Otras dos vías permiten alcanzar 32 GB. Dos tarjetas de 16 GB se reparten un modelo con llama.cpp, pero la conexión PCIe ralentiza los intercambios y el modelo debe dividirse adecuadamente; la guía multi-GPU explica el método. Un Mac con memoria unificada de 32 GB o más es una tercera opción, con un ancho de banda menor pero sin límite de VRAM dedicada.
Los precios cambian rápido: el seguimiento del sitio revisa cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, con el precio por GB de VRAM.
- Seguimiento de precios de tarjetas gráficas para IA local
- LLM en RTX 5090
- Configuración multi-GPU con llama.cpp
#Los modelos que conviene elegir con 32 GB
- Modelos densos de 27 a 32B
- La opción para priorizar la calidad: Qwen 3.5 27B o 3.8 27B (16 GB en Q4), Gemma 4 31B (18 GB), Qwen 3 32B (19 a 20 GB). Dejan espacio para un contexto largo y se adaptan bien a cuantizaciones más finas (Q5, Q6) si quieres más calidad.
- MoE 30-35B
- Qwen3-Coder 30B-A3B (19 GB) y Qwen 3.6 35B-A3B (21 GB) solo activan unos 3 mil millones de parámetros por token: ofrecen la mayor velocidad para su tamaño y son la opción adecuada para el código y los agentes.
- gpt-oss-20b
- 14 GB en la biblioteca Ollama ; la página Ollama indica que puede ejecutarse en sistemas con al menos 16 GB de memoria. En 32 GB, ofrece un contexto inmenso y permite mantener cargado simultáneamente un segundo modelo.
- Modelo de código de 24B
- Devstral Small 2 24B (14 GB): un especialista en agentes de código que deja espacio para dos modelos residentes.
Para elegir, hazte tres preguntas. ¿Debe el modelo adaptarse a un contexto largo (documentos, repositorio de código)? Elige un modelo denso de 27 B en Q4, que deja 16 GB para la caché. ¿Necesitas velocidad (agentes, bucles de herramientas)? El MoE. ¿Simplemente quieres más calidad que con 24 GB? Pasa de Q4 a Q6 en un modelo de 27 a 32B: hay espacio.
#Verificar que el modelo realmente quepa en la tarjeta
Un modelo que «se carga» no necesariamente está por completo en la GPU. Ollama reparte silenciosamente las capas entre la tarjeta y la memoria RAM cuando falta VRAM, y la velocidad cae sin ningún mensaje de error. La FAQ oficial indica que el comando ollama ps muestra en la columna Processor dónde se ha cargado el modelo: 100 % GPU significa que está íntegramente en la GPU; una distribución como 30 %/70 % CPU/GPU indica que parte del modelo se ha descargado a la RAM.
- 01Cargar el modelo con el contexto objetivoEjecuta el modelo con el tamaño de contexto que realmente necesitas para tu uso, no con el valor predeterminado: es la caché de contexto la que hace que se supere la capacidad de memoria.
- 02Leer la columna ProcessorEjecuta ollama ps en otro terminal. Busca que indique 100 % GPU; cualquier parte ejecutada en la CPU reduce la velocidad.
- 03Reducir si es necesarioSi el modelo supera el límite, reduce el contexto, activa la cuantización de la caché en q8_0 con Flash Attention o pasa a una cuantización más ligera.
- 04Controlar la VRAM restanteEn Windows o Linux, nvidia-smi muestra la memoria utilizada; deja un margen de uno a dos GB para la visualización y los picos.
- 05Medir con tu uso realCompara el rendimiento con un prompt corto y con tu prompt real: el segundo número es el que cuenta.
#70B y 123B: ¿por qué el offload no hace que estos modelos sean utilizables?
Llama 3.3 70B pesa 43 GB en la biblioteca de Ollama, y Mistral Large 123B, 73 GB. Con 32 GB de VRAM, por tanto, hay que mantener al menos 11 GB del 70B y 41 GB del 123B en la RAM del sistema. Por cada token, el procesador lee estas capas a la velocidad de la memoria del sistema: aproximadamente 102 GB/s como máximo con DDR5-6400 de doble canal (6 400 MT/s × 8 bytes × 2). Al dividir ese ancho de banda entre 41 GB, el límite del 123B es de aproximadamente 2,5 tokens por segundo; para el 70B, con 11 GB en RAM, es de aproximadamente 9 tokens por segundo. Son límites máximos, no mediciones: muestran sobre todo que la velocidad no se degrada de forma progresiva, sino por escalones, en cuanto las capas salen de la tarjeta.
| Modelo | Tamaño en Ollama | Parte en RAM del sistema | Límite de RAM (102 GB/s) |
|---|---|---|---|
| Llama 3.3 70B | 43 GB | aproximadamente 11 GB (34 %) | aproximadamente 9 t/s |
| Mistral Large 123B | 73 GB | aproximadamente 41 GB (56 %) | aproximadamente 2,5 t/s |
Este cálculo supone que la tarjeta mantiene 32 GB de pesos; en la práctica, la caché de contexto también ocupa espacio, por lo que una mayor parte de los pesos pasa a la RAM y el límite baja. Los MoE se comportan mejor: llama.cpp ofrece una opción para mantener los expertos de ciertas capas en el procesador (--n-cpu-moe), para configuraciones que no pueden cargar el modelo completo en la GPU. Esta opción permite ejecutar un modelo que no cabe, pero un usuario del repositorio llama.cpp señala una pérdida de velocidad de aproximadamente el 80 % al colocar todos los expertos en la CPU: es una solución de último recurso.
El valor de --n-cpu-moe depende de tu memoria; hay que encontrarlo mediante pruebas. Para un 70B denso, la respuesta correcta con 32 GB es casi siempre un modelo más pequeño o más memoria, no el offload.
#Ajustar un modelo con 32 GB: lo que cabe y lo que no
El ajuste fino con QLoRA mantiene los pesos del modelo en 4 bits y solo entrena pequeños adaptadores. Solo los pesos de un 70B ya ocupan 40 GB, por lo que un ajuste con QLoRA sobre un 70B no cabe en 32 GB. Un 32B en 4 bits ocupa aproximadamente entre 19 y 20 GB: quedan 12 GB para las activaciones, el optimizador y los adaptadores, lo cual es factible con un contexto corto y un lote de 1, sin margen de seguridad. Un modelo de entre 7B y 14B funciona con holgura. Son órdenes de magnitud que debes confirmar en la herramienta que utilices.
#32 GB de VRAM o otra solución: el cuadro de decisión
| Necesidad | Solución | Por qué |
|---|---|---|
| Modelo denso de 27-32B, contexto largo, velocidad máxima | Tarjeta NVIDIA de 32 GB | Ancho de banda alto, ecosistema CUDA |
| Misma capacidad con menor consumo eléctrico | Radeon AI PRO R9700 | Los mismos 32 GB, menor ancho de banda teórico |
| Modelos de 64 GB y más, uso ocasional | Mac con memoria unificada de 64 GB o más | Capacidad sin offload, velocidad más baja |
| Presupuesto limitado, MoE de 30B | A menudo una tarjeta de 24 GB basta | El MoE de 19 GB cabe con un contexto moderado |
- ¿Qué LLM para 24 GB de VRAM?
- Mac Studio de 64 a 512 GB
- Fuente: NVIDIA, anuncio de RTX 50
- Fuente: AMD, Radeon AI PRO R9700
- Fuente: biblioteca Ollama, Mistral Large
#Preguntas frecuentes
¿Cuál es el mejor LLM para 32 GB de VRAM?+
¿Bastan 32 GB de VRAM para Mistral Large 123B?+
¿RTX 5090 o Mac Studio con 64 GB para la IA local?+
¿Añadir una segunda tarjeta de 16 GB equivale a tener una tarjeta de 32 GB?+
¿Se pueden cargar dos modelos al mismo tiempo en 32 GB?+
¿Qué cuantización elegir en 32 GB?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.