¿Qué LLM en RTX 5090 (32 GB)? ?
Una RTX 5090 ofrece 32 GB de VRAM GDDR7 y 1 792 GB/s de ancho de banda: mantiene en VRAM modelos densos de 27 a 32 mil millones de parámetros (Qwen 3.5 27B, Qwen3 32B) y modelos con expertos de 30 a 35 mil millones, con contexto largo. Genera aproximadamente 60 tokens por segundo en un modelo 27B denso. Un 70B (43 GB en Q4) no cabe en una sola tarjeta.
Con 32 GB, la RTX 5090 permite ejecutar en VRAM modelos que las tarjetas de 24 GB no permiten usar con un contexto largo. Esta guía presenta los modelos que realmente caben en la memoria, con su peso exacto, las tasas de generación medidas por Hardware Corner, lo que cambia con el formato FP4, el presupuesto de contexto y las limitaciones de alimentación. También sabrás cuándo una 5090 justifica la diferencia frente a una 4090 o una 3090.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#RTX 5090 para un LLM local: lo que permiten 32 GB
Para un LLM local, el valor de una RTX 5090 reside en sus 32 GB de GDDR7 y sus 1 792 GB/s de ancho de banda: mantiene íntegramente en VRAM modelos de 27 a 35 mil millones de parámetros con un contexto largo, mientras que las tarjetas de 24 GB no les dejan suficiente margen. Según la biblioteca de Ollama, Qwen 3.5 27B pesa 17 GB, Qwen 3.8 27B 18 GB, Qwen3 32B y Gemma 4 31B 20 GB, Qwen 3.5 35B y Nemotron 3 Nano 30B 24 GB. Hardware Corner mide entre 59 y 61 tokens por segundo en modelos densos de 27 a 32 mil millones con 4 000 tokens de contexto, y más de 160 en un modelo de expertos de 35 mil millones. Un 70B (43 GB para Llama 3.3 en Q4) sigue sin caber en una sola tarjeta.
- Memoria
- 32 GB de GDDR7 en un bus de 512 bits, según NVIDIA; 1 792 GB/s de ancho de banda, según Hardware Corner.
- Cálculo
- 21 760 núcleos CUDA y Tensor Cores de 5.ª generación, según NVIDIA. Capacidad de cálculo 12.0, admitida por Ollama con un controlador 550 o más reciente.
- Consumo
- 575 W de potencia gráfica y una fuente de alimentación de 1 000 W requerida para el sistema, según NVIDIA, con un cable PCIe Gen 5 de 600 W o un adaptador incluido.
#Los modelos que caben en 32 GB
Los pesos corresponden a los archivos de la biblioteca Ollama, consultados el 29 de septiembre de 2026. El margen es lo que queda de los 32 GB antes de contar el contexto, la caché y los búferes del motor.
| Modelo | Archivo Ollama | Margen bruto | Nota |
|---|---|---|---|
| gpt-oss 20B | 14 GB | 18 GB | Contexto de 128k sin restricción |
| Qwen 3.5 27B | 17 GB | 15 GB | Denso, texto e imagen |
| Qwen 3.8 27B | 18 GB | 14 GB | Denso, generación reciente |
| Qwen3 32B / Gemma 4 31B | 20 GB | 12 GB | Límite superior de los modelos densos que se pueden ejecutar con comodidad |
| Qwen 3.5 35B / Nemotron 3 Nano 30B | 24 GB | 8 GB | No caben en 24 GB con contexto |
| Llama 3.3 70B | 43 GB | Faltan 11 GB | No cabe |
| gpt-oss 120B | 65 GB | Faltan 33 GB | Fuera de alcance |
Los 32 GB cambian sobre todo el margen: un modelo denso de 27B deja entre 14 y 15 GB para el contexto, frente a entre 6 y 7 GB en una tarjeta de 24 GB, y un modelo cuyos pesos ocupan 24 GB sigue pudiendo cargarse con 8 GB de margen. Eso es lo que hace posibles los contextos de 128k cuyas cifras se detallan más abajo.
#Tasas de generación medidas: lo que aporta la 5090 frente a otras tarjetas
Los números a continuación provienen de Hardware Corner, que realiza pruebas con llama.cpp usando contextos de 4k a 256k. No son mediciones de QuelLLM.
| Modelo (Q4_K, o MXFP4 para Qwen 3.5 35B) | Contexto 4k | Contexto 32k | Contexto 128k |
|---|---|---|---|
| Qwen3 14B | 123,8 | 82,4 | 37,2 |
| gpt-oss 20B | 298,2 | 215,1 | 112,0 |
| Qwen3 30B A3B | 226,1 | 143,1 | 76,8 |
| Qwen 3.5 27B | 58,8 | 53,8 | 44,1 |
| Gemma 4 31B | 61,1 | 55,4 | 43,4 |
| Qwen3 32B | 61,4 | 43,8 | no medido |
| Qwen 3.5 35B (MXFP4) | 165,2 | 143,2 | 118,2 |
La generación está limitada por el ancho de banda: el límite teórico equivale aproximadamente al ancho de banda dividido por el tamaño del modelo. Para Qwen 3.5 27B (17 GB), 1 792 ÷ 17 da 105 tokens por segundo, y el valor medido, 58,8, alcanza el 56 % de ese límite. Para Qwen3 32B (20 GB), el límite es de 90 y el valor medido de 61,4, es decir, el 68 %. Por tanto, un modelo denso de 27 a 32 mil millones de parámetros funciona a unos 60 tokens por segundo en una 5090.
Con Qwen 3.5 27B, la 5090 genera 1,76 veces más rápido que la 3090 (58,8 frente a 33,5 según dos páginas de Hardware Corner), mientras que el ancho de banda es 1,91 veces mayor (1.792 frente a 936 GB/s). En la clasificación de llama.cpp, la 5090 alcanza aproximadamente entre 290 y 300 tokens por segundo con Llama 2 7B Q4_0, frente a unos 160 para una 3090.
#5090 frente a la 4090 y a la 3090: la diferencia medida
| Tarjeta | Memoria | Generación relativa |
|---|---|---|
| RTX 5090 | 32 GB | 100 % |
| RTX 4090 | 24 GB | 77 % |
| RTX 3090 Ti | 24 GB | 55 % |
| RTX 3090 | 24 GB | 51 % |
#Contexto y caché KV: planificar el uso de tus 32 GB
Ollama ajusta el contexto por defecto según la memoria de vídeo: su documentación indica 32k tokens para entre 24 y 48 GiB de VRAM y recomienda al menos 64.000 tokens para agentes, búsqueda web y herramientas de código. La 5090 entra en el rango de los 32k, más generoso que los 4k de las tarjetas con menos de 24 GiB. Aumentar el contexto supone un mayor consumo de memoria para la caché KV, que almacena las claves y los valores de atención de cada token leído.
La principal palanca es la cuantización de la caché: según la FAQ de Ollama, q8_0 utiliza aproximadamente la mitad de la memoria de f16, con una pérdida de precisión muy pequeña, y requiere Flash Attention, que Ollama activa automáticamente cuando la tarjeta y el modelo son compatibles con ella. Regla de cálculo: el margen de memoria que queda tras cargar el modelo, menos 1 a 2 GB para búferes, da la memoria disponible para la caché. Con Qwen 3.5 27B (17 GB), quedan más de 13 GB para el contexto, lo que confirma la medición con 128k de Hardware Corner. Comprueba el resultado con ollama ps.
#FP4, NVFP4, MXFP4: lo que realmente cambia Blackwell
Blackwell introduce el formato NVFP4: según NVIDIA, un formato de punto flotante de 4 bits, con un factor de escala por bloque de 16 valores frente a los 32 de MXFP4, lo que permite un escalado más fino. Hardware Corner indica que la 5090 acelera NVFP4 por hardware. Q4_K_M, por su parte, es una cuantización por bloques de llama.cpp: ambos no se contraponen en teoría, son formatos de archivo diferentes, y un modelo solo existe en uno u otro si alguien lo ha convertido.
En la práctica, la fila de Qwen 3.5 35B en MXFP4 de la tabla anterior muestra el rendimiento de un formato de coma flotante de 4 bits en esta tarjeta: 165 tokens por segundo a 4k con pesos que ocupan 24 GB. La compatibilidad con NVFP4 en las herramientas (llama.cpp, Ollama, vLLM) evoluciona rápidamente: comprueba la versión instalada y la ficha del modelo antes de elegir un archivo, y conserva Q4_K_M como una opción fiable.
#Instalar Ollama en una RTX 5090
- 01Verificar el controladorEjecuta nvidia-smi en un terminal: el controlador debe estar en versión 550 o superior (551.61 en Windows) y la memoria total debe mostrar aproximadamente 32 GB.
- 02Instalar OllamaInstala Ollama desde su sitio oficial. La API local escucha en http://localhost:11434.
- 03Ejecutar un modeloEjecuta ollama run qwen3.5:27b: la descarga de 17 GB se realiza una sola vez. Para un modelo de expertos más grande, prueba ollama run qwen3.5:35b (24 GB).
- 04Controlar la distribuciónEn un segundo terminal, ejecuta ollama ps: la columna Processeur debe mostrar 100 % GPU.
- 05Ajustar el contextoEstablece el contexto con OLLAMA_CONTEXT_LENGTH y vuelve a ejecutar ollama ps. Si no hay suficiente margen, configura OLLAMA_FLASH_ATTENTION en 1 y OLLAMA_KV_CACHE_TYPE en q8_0 al iniciar.
#Alimentación, calor y fine-tuning
NVIDIA anuncia 575 W de potencia gráfica, una fuente de alimentación del sistema de 1.000 W, una temperatura máxima de la GPU de 90 °C y un cable PCIe Gen 5 de 600 W: la 5090 es la tarjeta más exigente de la comparativa. Revisa el cable y su conector antes de instalar la tarjeta, y prevé una caja ventilada. Un límite de potencia reduce el consumo a cambio de una pequeña pérdida de velocidad, ya que el LLM utiliza principalmente la memoria (ver la medición de la 3090 limitada a 250 W en su guía).
Para el fine-tuning, Unsloth indica mínimos de VRAM en QLoRA de 4 bits: 22 GB para un modelo de 27 mil millones, 26 GB para 32 mil millones, 30 GB para 40 mil millones y 41 GB para 70 mil millones. La 5090 permite fine-tuning hasta 40B en QLoRA con un lote de 1 y un contexto corto, no un 70B.
#Veredicto: 5090, 4090 o 3090 según el uso
| Situación | Decisión | Razón respaldada por cifras |
|---|---|---|
| Buscas un modelo denso de 27B a 32B con contexto largo | 5090 | 32 GB: 12 a 15 GB de margen, 44 t/s a 128k en Qwen 3.5 27B |
| Buscas un modelo con expertos de 30 a 35 mil millones | 5090 | 24 GB de pesos: fuera del alcance de una tarjeta de 24 GB al añadir el contexto |
| Sigues usando modelos de 8 a 14 mil millones | Sin 5090 | La 3090 o una tarjeta de 16 GB son suficientes |
| Ya tienes una 4090 | Mantenerla a menos que se necesiten 32 GB | Generación al 77 % del rendimiento de la 5090 |
| Quieres un 70B | Dos tarjetas o una máquina con memoria unificada | 43 GB de pesos en Q4 |
La 5090 sustituye a una 4090 sobre todo cuando falta capacidad: la mejora de velocidad es de alrededor del 30 % según Hardware Corner, mientras que los 32 GB permiten cargar modelos y contextos que no caben en 24 GB. Para conocer los precios del día, consulta nuestro seguimiento, que registra el precio más bajo de cada tarjeta dos veces por semana.
- Fuente: NVIDIA, especificaciones de la RTX 5090
- Fuente: Hardware Corner, benchmarks LLM en RTX 5090
- Fuente: NVIDIA, presentación del formato NVFP4
- Fuente: documentación de Ollama, longitud de contexto
- Fuente: Unsloth, VRAM requerida para el fine-tuning
#Preguntas frecuentes
¿Qué LLM instalar en una RTX 5090?+
¿Puede una RTX 5090 ejecutar un 70B?+
¿La RTX 5090 es mucho más rápida que una 4090 para los LLM?+
¿La RTX 5090 soporta FP4 y NVFP4?+
¿Qué fuente de alimentación necesita una RTX 5090?+
¿Se puede hacer un ajuste fino de un modelo en una RTX 5090?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.