Intermedio 11 minRTX 50

¿Qué LLM en RTX 5090 (32 GB)? ?

Respuesta directa

Una RTX 5090 ofrece 32 GB de VRAM GDDR7 y 1 792 GB/s de ancho de banda: mantiene en VRAM modelos densos de 27 a 32 mil millones de parámetros (Qwen 3.5 27B, Qwen3 32B) y modelos con expertos de 30 a 35 mil millones, con contexto largo. Genera aproximadamente 60 tokens por segundo en un modelo 27B denso. Un 70B (43 GB en Q4) no cabe en una sola tarjeta.

Con 32 GB, la RTX 5090 permite ejecutar en VRAM modelos que las tarjetas de 24 GB no permiten usar con un contexto largo. Esta guía presenta los modelos que realmente caben en la memoria, con su peso exacto, las tasas de generación medidas por Hardware Corner, lo que cambia con el formato FP4, el presupuesto de contexto y las limitaciones de alimentación. También sabrás cuándo una 5090 justifica la diferencia frente a una 4090 o una 3090.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#RTX 5090 para un LLM local: lo que permiten 32 GB

Para un LLM local, el valor de una RTX 5090 reside en sus 32 GB de GDDR7 y sus 1 792 GB/s de ancho de banda: mantiene íntegramente en VRAM modelos de 27 a 35 mil millones de parámetros con un contexto largo, mientras que las tarjetas de 24 GB no les dejan suficiente margen. Según la biblioteca de Ollama, Qwen 3.5 27B pesa 17 GB, Qwen 3.8 27B 18 GB, Qwen3 32B y Gemma 4 31B 20 GB, Qwen 3.5 35B y Nemotron 3 Nano 30B 24 GB. Hardware Corner mide entre 59 y 61 tokens por segundo en modelos densos de 27 a 32 mil millones con 4 000 tokens de contexto, y más de 160 en un modelo de expertos de 35 mil millones. Un 70B (43 GB para Llama 3.3 en Q4) sigue sin caber en una sola tarjeta.

Memoria
32 GB de GDDR7 en un bus de 512 bits, según NVIDIA; 1 792 GB/s de ancho de banda, según Hardware Corner.
Cálculo
21 760 núcleos CUDA y Tensor Cores de 5.ª generación, según NVIDIA. Capacidad de cálculo 12.0, admitida por Ollama con un controlador 550 o más reciente.
Consumo
575 W de potencia gráfica y una fuente de alimentación de 1 000 W requerida para el sistema, según NVIDIA, con un cable PCIe Gen 5 de 600 W o un adaptador incluido.

#Los modelos que caben en 32 GB

Los pesos corresponden a los archivos de la biblioteca Ollama, consultados el 29 de septiembre de 2026. El margen es lo que queda de los 32 GB antes de contar el contexto, la caché y los búferes del motor.

Modelos para RTX 5090 (archivos de Ollama, Q4 salvo que se indique lo contrario)
ModeloArchivo OllamaMargen brutoNota
gpt-oss 20B14 GB18 GBContexto de 128k sin restricción
Qwen 3.5 27B17 GB15 GBDenso, texto e imagen
Qwen 3.8 27B18 GB14 GBDenso, generación reciente
Qwen3 32B / Gemma 4 31B20 GB12 GBLímite superior de los modelos densos que se pueden ejecutar con comodidad
Qwen 3.5 35B / Nemotron 3 Nano 30B24 GB8 GBNo caben en 24 GB con contexto
Llama 3.3 70B43 GBFaltan 11 GBNo cabe
gpt-oss 120B65 GBFaltan 33 GBFuera de alcance

Los 32 GB cambian sobre todo el margen: un modelo denso de 27B deja entre 14 y 15 GB para el contexto, frente a entre 6 y 7 GB en una tarjeta de 24 GB, y un modelo cuyos pesos ocupan 24 GB sigue pudiendo cargarse con 8 GB de margen. Eso es lo que hace posibles los contextos de 128k cuyas cifras se detallan más abajo.

#Tasas de generación medidas: lo que aporta la 5090 frente a otras tarjetas

Los números a continuación provienen de Hardware Corner, que realiza pruebas con llama.cpp usando contextos de 4k a 256k. No son mediciones de QuelLLM.

Generación en RTX 5090, tokens por segundo (Hardware Corner)
Modelo (Q4_K, o MXFP4 para Qwen 3.5 35B)Contexto 4kContexto 32kContexto 128k
Qwen3 14B123,882,437,2
gpt-oss 20B298,2215,1112,0
Qwen3 30B A3B226,1143,176,8
Qwen 3.5 27B58,853,844,1
Gemma 4 31B61,155,443,4
Qwen3 32B61,443,8no medido
Qwen 3.5 35B (MXFP4)165,2143,2118,2

La generación está limitada por el ancho de banda: el límite teórico equivale aproximadamente al ancho de banda dividido por el tamaño del modelo. Para Qwen 3.5 27B (17 GB), 1 792 ÷ 17 da 105 tokens por segundo, y el valor medido, 58,8, alcanza el 56 % de ese límite. Para Qwen3 32B (20 GB), el límite es de 90 y el valor medido de 61,4, es decir, el 68 %. Por tanto, un modelo denso de 27 a 32 mil millones de parámetros funciona a unos 60 tokens por segundo en una 5090.

Con Qwen 3.5 27B, la 5090 genera 1,76 veces más rápido que la 3090 (58,8 frente a 33,5 según dos páginas de Hardware Corner), mientras que el ancho de banda es 1,91 veces mayor (1.792 frente a 936 GB/s). En la clasificación de llama.cpp, la 5090 alcanza aproximadamente entre 290 y 300 tokens por segundo con Llama 2 7B Q4_0, frente a unos 160 para una 3090.

#5090 frente a la 4090 y a la 3090: la diferencia medida

Generación relativa por tarjeta (Hardware Corner, 5090 = 100 %)
TarjetaMemoriaGeneración relativa
RTX 509032 GB100 %
RTX 409024 GB77 %
RTX 3090 Ti24 GB55 %
RTX 309024 GB51 %
→
El verdadero beneficio: el contexto largo
La 5090 mantiene su tasa de procesamiento cuando el contexto crece. Qwen 3.5 27B pasa de 58,8 a 44,1 tokens por segundo entre 4k y 128k (-25 %), y Qwen 3.5 35B en MXFP4 genera aún 97,3 tokens por segundo con 256.000 tokens de contexto. Es en este escenario, y no en un chat corto, donde los 32 GB justifican la tarjeta.

#Contexto y caché KV: planificar el uso de tus 32 GB

Ollama ajusta el contexto por defecto según la memoria de vídeo: su documentación indica 32k tokens para entre 24 y 48 GiB de VRAM y recomienda al menos 64.000 tokens para agentes, búsqueda web y herramientas de código. La 5090 entra en el rango de los 32k, más generoso que los 4k de las tarjetas con menos de 24 GiB. Aumentar el contexto supone un mayor consumo de memoria para la caché KV, que almacena las claves y los valores de atención de cada token leído.

La principal palanca es la cuantización de la caché: según la FAQ de Ollama, q8_0 utiliza aproximadamente la mitad de la memoria de f16, con una pérdida de precisión muy pequeña, y requiere Flash Attention, que Ollama activa automáticamente cuando la tarjeta y el modelo son compatibles con ella. Regla de cálculo: el margen de memoria que queda tras cargar el modelo, menos 1 a 2 GB para búferes, da la memoria disponible para la caché. Con Qwen 3.5 27B (17 GB), quedan más de 13 GB para el contexto, lo que confirma la medición con 128k de Hardware Corner. Comprueba el resultado con ollama ps.

#FP4, NVFP4, MXFP4: lo que realmente cambia Blackwell

Blackwell introduce el formato NVFP4: según NVIDIA, un formato de punto flotante de 4 bits, con un factor de escala por bloque de 16 valores frente a los 32 de MXFP4, lo que permite un escalado más fino. Hardware Corner indica que la 5090 acelera NVFP4 por hardware. Q4_K_M, por su parte, es una cuantización por bloques de llama.cpp: ambos no se contraponen en teoría, son formatos de archivo diferentes, y un modelo solo existe en uno u otro si alguien lo ha convertido.

En la práctica, la fila de Qwen 3.5 35B en MXFP4 de la tabla anterior muestra el rendimiento de un formato de coma flotante de 4 bits en esta tarjeta: 165 tokens por segundo a 4k con pesos que ocupan 24 GB. La compatibilidad con NVFP4 en las herramientas (llama.cpp, Ollama, vLLM) evoluciona rápidamente: comprueba la versión instalada y la ficha del modelo antes de elegir un archivo, y conserva Q4_K_M como una opción fiable.

#Instalar Ollama en una RTX 5090

  1. 01
    Verificar el controlador
    Ejecuta nvidia-smi en un terminal: el controlador debe estar en versión 550 o superior (551.61 en Windows) y la memoria total debe mostrar aproximadamente 32 GB.
  2. 02
    Instalar Ollama
    Instala Ollama desde su sitio oficial. La API local escucha en http://localhost:11434.
  3. 03
    Ejecutar un modelo
    Ejecuta ollama run qwen3.5:27b: la descarga de 17 GB se realiza una sola vez. Para un modelo de expertos más grande, prueba ollama run qwen3.5:35b (24 GB).
  4. 04
    Controlar la distribución
    En un segundo terminal, ejecuta ollama ps: la columna Processeur debe mostrar 100 % GPU.
  5. 05
    Ajustar el contexto
    Establece el contexto con OLLAMA_CONTEXT_LENGTH y vuelve a ejecutar ollama ps. Si no hay suficiente margen, configura OLLAMA_FLASH_ATTENTION en 1 y OLLAMA_KV_CACHE_TYPE en q8_0 al iniciar.
Comandos básicos
ollama run qwen3.5:27b
ollama run qwen3.5:35b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Alimentación, calor y fine-tuning

NVIDIA anuncia 575 W de potencia gráfica, una fuente de alimentación del sistema de 1.000 W, una temperatura máxima de la GPU de 90 °C y un cable PCIe Gen 5 de 600 W: la 5090 es la tarjeta más exigente de la comparativa. Revisa el cable y su conector antes de instalar la tarjeta, y prevé una caja ventilada. Un límite de potencia reduce el consumo a cambio de una pequeña pérdida de velocidad, ya que el LLM utiliza principalmente la memoria (ver la medición de la 3090 limitada a 250 W en su guía).

Para el fine-tuning, Unsloth indica mínimos de VRAM en QLoRA de 4 bits: 22 GB para un modelo de 27 mil millones, 26 GB para 32 mil millones, 30 GB para 40 mil millones y 41 GB para 70 mil millones. La 5090 permite fine-tuning hasta 40B en QLoRA con un lote de 1 y un contexto corto, no un 70B.

#Veredicto: 5090, 4090 o 3090 según el uso

Qué decisión tomar según tu situación
SituaciónDecisiónRazón respaldada por cifras
Buscas un modelo denso de 27B a 32B con contexto largo509032 GB: 12 a 15 GB de margen, 44 t/s a 128k en Qwen 3.5 27B
Buscas un modelo con expertos de 30 a 35 mil millones509024 GB de pesos: fuera del alcance de una tarjeta de 24 GB al añadir el contexto
Sigues usando modelos de 8 a 14 mil millonesSin 5090La 3090 o una tarjeta de 16 GB son suficientes
Ya tienes una 4090Mantenerla a menos que se necesiten 32 GBGeneración al 77 % del rendimiento de la 5090
Quieres un 70BDos tarjetas o una máquina con memoria unificada43 GB de pesos en Q4

La 5090 sustituye a una 4090 sobre todo cuando falta capacidad: la mejora de velocidad es de alrededor del 30 % según Hardware Corner, mientras que los 32 GB permiten cargar modelos y contextos que no caben en 24 GB. Para conocer los precios del día, consulta nuestro seguimiento, que registra el precio más bajo de cada tarjeta dos veces por semana.

#Preguntas frecuentes

FAQ
¿Qué LLM instalar en una RTX 5090?+
Comienza con Qwen 3.5 27B: su archivo de Ollama de 17 GB deja aproximadamente 15 GB de margen y genera alrededor de 59 tokens por segundo según Hardware Corner. Para un modelo más grande con expertos, Qwen 3.5 35B (24 GB) supera los 160 tokens por segundo. Qwen3 32B y Gemma 4 31B (20 GB) son el límite superior de los modelos densos.
¿Puede una RTX 5090 ejecutar un 70B?+
No, no completamente. Llama 3.3 70B pesa 43 GB en Ollama, es decir, 11 GB más que la capacidad de la tarjeta, y gpt-oss 120B pesa 65 GB. Al repartir el modelo entre la VRAM y la RAM, la velocidad de generación cae, porque cada token vuelve a leer todos los pesos de un modelo denso. Para un 70B en VRAM, se necesitan dos tarjetas o una máquina con memoria unificada.
¿La RTX 5090 es mucho más rápida que una 4090 para los LLM?+
Según Hardware Corner, la 4090 genera el 77 % del rendimiento de la 5090, es decir, un margen de aproximadamente un 30 % a favor de la 5090. Su principal ventaja sigue siendo sus 32 GB de memoria, que permiten cargar modelos y contextos más grandes.
¿La RTX 5090 soporta FP4 y NVFP4?+
Sí: NVFP4 es un formato de 4 bits introducido con Blackwell, y Hardware Corner indica que la tarjeta lo acelera por hardware. La compatibilidad del software sigue evolucionando: verifica que tu versión de Ollama, llama.cpp o vLLM admita el formato del modelo. Q4_K_M sigue siendo una apuesta segura, sin necesidad de FP4.
¿Qué fuente de alimentación necesita una RTX 5090?+
NVIDIA indica una fuente de alimentación de 1 000 W para el sistema, con una potencia gráfica de 575 W y un cable PCIe Gen 5 de 600 W o el adaptador incluido. Hardware Corner recomienda como mínimo una fuente de 950 W Gold. Elige una fuente de alimentación de calidad y comprueba el cable antes de la instalación.
¿Se puede hacer un ajuste fino de un modelo en una RTX 5090?+
Sí, en QLoRA. Según Unsloth, el mínimo es de 22 GB para un 27B y de 30 GB para un 40B, lo cual cabe en 32 GB con un lote de 1. Un 70B requiere 41 GB y no cabe. Son mínimos absolutos: el contexto y el lote los aumentan.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.