Avanzado 11 minPor VRAM

¿Qué LLM para 32 GB de VRAM? ?

Respuesta directa

Con 32 GB de VRAM, cargas completamente un modelo denso de 27 a 32B en Q4 (16 a 20 GB) con un contexto largo, un MoE de 30-35B (19 a 21 GB) o gpt-oss-20b (14 GB) con mucho margen. El modelo que no cabe es el 70B: ocupa entre 40 y 43 GB en Q4, por lo que necesariamente queda en parte en la memoria RAM, donde la velocidad cae en picado. Cuenta siempre la caché de contexto además de los pesos.

Los 32 GB de VRAM son el umbral en el que dejas de tener que elegir entre el tamaño del modelo y la longitud del contexto. Esta página indica qué cabe realmente en la memoria, qué cambia según la tarjeta (RTX 5090 o Radeon AI PRO R9700), por qué un modelo de 70B o de 123B sigue sin poder usarse con comodidad y cuándo la memoria unificada de un Mac o una segunda tarjeta es una mejor compra.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#32 GB de VRAM: qué cambia con esta capacidad respecto a 24 GB

Un modelo en Q4 ocupa aproximadamente 0,6 GB por cada mil millones de parámetros, más la caché de contexto, que crece con la longitud de la conversación. Con 24 GB, cabe un modelo denso de 27 a 32B en Q4 (16 a 20 GB), pero el contexto debe mantenerse corto. Con 32 GB, quedan de 12 a 16 GB para el contexto, las activaciones y el sistema: ese presupuesto permite ventanas de 32.000 a 128.000 tokens en un modelo de 27B, o un MoE de 30-35B con un margen cómodo.

Presupuesto de memoria de 32 GB para algunos modelos comunes (pesos en Q4, sin incluir el contexto)
ModeloPesos Q4Memoria restante para el contexto y el sistemaVeredicto
gpt-oss-20b14 GB18 GBMargen muy amplio, contexto largo
Qwen 3.5 27B / Qwen 3.8 27B16 GB16 GBCómodo, contexto largo posible
Gemma 4 31B18 GB14 GBCómodo
Qwen 3 32B19-20 GB12 GBBien, contexto a monitorear
Qwen3-Coder 30B-A3B (MoE)19 GB13 GBBien, muy rápido para su tamaño
Qwen 3.6 35B-A3B (MoE)21 GB11 GBBien, contexto medio
Llama 3.3 70B43 GBnegativoNo cabe: offload obligatorio

Estos valores son tamaños de archivos, no requisitos totales: la calculadora del sitio añade la caché para un modelo y un contexto determinados. La caché también puede cuantizarse en q8_0, lo que, según las preguntas frecuentes de Ollama, reduce su tamaño aproximadamente a la mitad respecto a f16, siempre que se active Flash Attention.

#Qué tarjetas ofrecen 32 GB y por qué importa el ancho de banda

Dos tarjetas de escritorio se distinguen. La GeForce RTX 5090 incluye 32 GB de GDDR7 en un bus de 512 bits, con 1.792 GB/s de ancho de banda según NVIDIA. La Radeon AI PRO R9700 de AMD también ofrece 32 GB, pero en GDDR6 en un bus de 256 bits, a 640 GB/s según AMD, para un ordenador de escritorio y uso profesional. La capacidad es idéntica; la velocidad de generación no lo es.

Dos tarjetas de 32 GB: misma capacidad, pero rendimiento teórico muy diferente
TarjetaMemoriaAncho de bandaLímite para un modelo de 19 GB
GeForce RTX 509032 GB GDDR7, 512 bits1 792 GB/saproximadamente 94 t/s
Radeon AI PRO R970032 GB GDDR6, 256 bits640 GB/saproximadamente 34 t/s

El límite se calcula dividiendo el ancho de banda entre los pesos leídos en cada token; nunca se alcanza por completo, pero la relación sigue siendo válida: con el mismo modelo, la RTX 5090 genera a más del doble de velocidad que la R9700. En una tarjeta AMD, el controlador y la pila de software (ROCm, Vulkan) también cuentan; la guía dedicada a las tarjetas AMD detalla las limitaciones. Cada tarjeta concreta tiene su propia página: la de la RTX 5090 ofrece los detalles de esa tarjeta.

Otras dos vías permiten alcanzar 32 GB. Dos tarjetas de 16 GB se reparten un modelo con llama.cpp, pero la conexión PCIe ralentiza los intercambios y el modelo debe dividirse adecuadamente; la guía multi-GPU explica el método. Un Mac con memoria unificada de 32 GB o más es una tercera opción, con un ancho de banda menor pero sin límite de VRAM dedicada.

Los precios cambian rápido: el seguimiento del sitio revisa cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, con el precio por GB de VRAM.

#Los modelos que conviene elegir con 32 GB

Modelos densos de 27 a 32B
La opción para priorizar la calidad: Qwen 3.5 27B o 3.8 27B (16 GB en Q4), Gemma 4 31B (18 GB), Qwen 3 32B (19 a 20 GB). Dejan espacio para un contexto largo y se adaptan bien a cuantizaciones más finas (Q5, Q6) si quieres más calidad.
MoE 30-35B
Qwen3-Coder 30B-A3B (19 GB) y Qwen 3.6 35B-A3B (21 GB) solo activan unos 3 mil millones de parámetros por token: ofrecen la mayor velocidad para su tamaño y son la opción adecuada para el código y los agentes.
gpt-oss-20b
14 GB en la biblioteca Ollama ; la página Ollama indica que puede ejecutarse en sistemas con al menos 16 GB de memoria. En 32 GB, ofrece un contexto inmenso y permite mantener cargado simultáneamente un segundo modelo.
Modelo de código de 24B
Devstral Small 2 24B (14 GB): un especialista en agentes de código que deja espacio para dos modelos residentes.

Para elegir, hazte tres preguntas. ¿Debe el modelo adaptarse a un contexto largo (documentos, repositorio de código)? Elige un modelo denso de 27 B en Q4, que deja 16 GB para la caché. ¿Necesitas velocidad (agentes, bucles de herramientas)? El MoE. ¿Simplemente quieres más calidad que con 24 GB? Pasa de Q4 a Q6 en un modelo de 27 a 32B: hay espacio.

#Verificar que el modelo realmente quepa en la tarjeta

Un modelo que «se carga» no necesariamente está por completo en la GPU. Ollama reparte silenciosamente las capas entre la tarjeta y la memoria RAM cuando falta VRAM, y la velocidad cae sin ningún mensaje de error. La FAQ oficial indica que el comando ollama ps muestra en la columna Processor dónde se ha cargado el modelo: 100 % GPU significa que está íntegramente en la GPU; una distribución como 30 %/70 % CPU/GPU indica que parte del modelo se ha descargado a la RAM.

  1. 01
    Cargar el modelo con el contexto objetivo
    Ejecuta el modelo con el tamaño de contexto que realmente necesitas para tu uso, no con el valor predeterminado: es la caché de contexto la que hace que se supere la capacidad de memoria.
  2. 02
    Leer la columna Processor
    Ejecuta ollama ps en otro terminal. Busca que indique 100 % GPU; cualquier parte ejecutada en la CPU reduce la velocidad.
  3. 03
    Reducir si es necesario
    Si el modelo supera el límite, reduce el contexto, activa la cuantización de la caché en q8_0 con Flash Attention o pasa a una cuantización más ligera.
  4. 04
    Controlar la VRAM restante
    En Windows o Linux, nvidia-smi muestra la memoria utilizada; deja un margen de uno a dos GB para la visualización y los picos.
  5. 05
    Medir con tu uso real
    Compara el rendimiento con un prompt corto y con tu prompt real: el segundo número es el que cuenta.
!
La trampa del contexto por defecto
Ollama utiliza por defecto una ventana de contexto de 4.096 tokens según su FAQ. Un modelo puede parecer caber en la VRAM con este ajuste y superar su capacidad en cuanto aumentes el contexto a 32.000 tokens para analizar un documento. Prueba siempre con el contexto que necesitas.

#70B y 123B: ¿por qué el offload no hace que estos modelos sean utilizables?

Llama 3.3 70B pesa 43 GB en la biblioteca de Ollama, y Mistral Large 123B, 73 GB. Con 32 GB de VRAM, por tanto, hay que mantener al menos 11 GB del 70B y 41 GB del 123B en la RAM del sistema. Por cada token, el procesador lee estas capas a la velocidad de la memoria del sistema: aproximadamente 102 GB/s como máximo con DDR5-6400 de doble canal (6 400 MT/s × 8 bytes × 2). Al dividir ese ancho de banda entre 41 GB, el límite del 123B es de aproximadamente 2,5 tokens por segundo; para el 70B, con 11 GB en RAM, es de aproximadamente 9 tokens por segundo. Son límites máximos, no mediciones: muestran sobre todo que la velocidad no se degrada de forma progresiva, sino por escalones, en cuanto las capas salen de la tarjeta.

Resultados de un modelo que supera los 32 GB de VRAM (cálculo a partir de la memoria del sistema)
ModeloTamaño en OllamaParte en RAM del sistemaLímite de RAM (102 GB/s)
Llama 3.3 70B43 GBaproximadamente 11 GB (34 %)aproximadamente 9 t/s
Mistral Large 123B73 GBaproximadamente 41 GB (56 %)aproximadamente 2,5 t/s

Este cálculo supone que la tarjeta mantiene 32 GB de pesos; en la práctica, la caché de contexto también ocupa espacio, por lo que una mayor parte de los pesos pasa a la RAM y el límite baja. Los MoE se comportan mejor: llama.cpp ofrece una opción para mantener los expertos de ciertas capas en el procesador (--n-cpu-moe), para configuraciones que no pueden cargar el modelo completo en la GPU. Esta opción permite ejecutar un modelo que no cabe, pero un usuario del repositorio llama.cpp señala una pérdida de velocidad de aproximadamente el 80 % al colocar todos los expertos en la CPU: es una solución de último recurso.

Un MoE demasiado grande: mantener expertos en el CPU (llama.cpp)
llama-server -m modele-moe.gguf -ngl 99 -fa --n-cpu-moe 12 -c 16384

El valor de --n-cpu-moe depende de tu memoria; hay que encontrarlo mediante pruebas. Para un 70B denso, la respuesta correcta con 32 GB es casi siempre un modelo más pequeño o más memoria, no el offload.

#Ajustar un modelo con 32 GB: lo que cabe y lo que no

El ajuste fino con QLoRA mantiene los pesos del modelo en 4 bits y solo entrena pequeños adaptadores. Solo los pesos de un 70B ya ocupan 40 GB, por lo que un ajuste con QLoRA sobre un 70B no cabe en 32 GB. Un 32B en 4 bits ocupa aproximadamente entre 19 y 20 GB: quedan 12 GB para las activaciones, el optimizador y los adaptadores, lo cual es factible con un contexto corto y un lote de 1, sin margen de seguridad. Un modelo de entre 7B y 14B funciona con holgura. Son órdenes de magnitud que debes confirmar en la herramienta que utilices.

#32 GB de VRAM o otra solución: el cuadro de decisión

Qué elegir según tus necesidades
NecesidadSoluciónPor qué
Modelo denso de 27-32B, contexto largo, velocidad máximaTarjeta NVIDIA de 32 GBAncho de banda alto, ecosistema CUDA
Misma capacidad con menor consumo eléctricoRadeon AI PRO R9700Los mismos 32 GB, menor ancho de banda teórico
Modelos de 64 GB y más, uso ocasionalMac con memoria unificada de 64 GB o másCapacidad sin offload, velocidad más baja
Presupuesto limitado, MoE de 30BA menudo una tarjeta de 24 GB bastaEl MoE de 19 GB cabe con un contexto moderado

#Preguntas frecuentes

FAQ
¿Cuál es el mejor LLM para 32 GB de VRAM?+
Para la calidad, un modelo denso de 27 a 32B en Q4 (Qwen 3.5 o 3.8 27B, Gemma 4 31B, Qwen 3 32B) con un contexto largo. Para la velocidad y el código, un modelo MoE de 30-35B como Qwen3-Coder 30B-A3B. Ningún modelo es el mejor en términos absolutos: la tarea y el idioma deciden.
¿Bastan 32 GB de VRAM para Mistral Large 123B?+
No. La biblioteca Ollama indica 73 GB para Mistral Large 123B. Más de 40 GB deberían permanecer en memoria RAM, donde la lectura está limitada a aproximadamente 100 GB/s, lo que da un límite teórico de 2 a 3 tokens por segundo. Es usable para procesamiento en segundo plano, no para chat.
¿RTX 5090 o Mac Studio con 64 GB para la IA local?+
La tarjeta para la velocidad: 1 792 GB/s frente a unos cientos de GB/s en un Mac, con modelos que caben en 32 GB. El Mac para la capacidad: un modelo de 40 a 50 GB cabe en él sin offload, a una velocidad menor. Elige según el tamaño de los modelos que cargues.
¿Añadir una segunda tarjeta de 16 GB equivale a tener una tarjeta de 32 GB?+
Dos tarjetas de 16 GB suman 32 GB, pero el modelo se distribuye entre ellas y la conexión PCIe ralentiza los intercambios; la distribución requiere también configuración en llama.cpp. Una tarjeta de 32 GB es más sencilla y más rápida para un mismo total, salvo si ya tienes una de las dos tarjetas.
¿Se pueden cargar dos modelos al mismo tiempo en 32 GB?+
Sí, por ejemplo gpt-oss-20b (14 GB) y Devstral Small 2 24B (14 GB), lo que suma 28 GB de peso, con un contexto corto. Ollama mantiene los modelos en memoria durante cinco minutos por defecto y puede mantener varios si la memoria lo permite; monitorea el caché de contexto, que se suma a cada uno.
¿Qué cuantización elegir en 32 GB?+
Q4_K_M sigue siendo el mejor equilibrio para los modelos densos de 27 a 32B. Si tienes margen (modelo con 14 a 16 GB de pesos), sube a Q5 o Q6 para mejorar la calidad. No bajes de Q4 salvo para hacer que quepa un modelo demasiado grande, aceptando una pérdida de calidad.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.