Intermedio 12 minRTX 40

¿Qué LLM usar con una RTX 4090 (24 GB) ?

La RTX 4090 (octubre de 2022) sigue siendo en 2026 la referencia para la IA local en el mercado de consumo: 24 GB de VRAM GDDR6X, 1008 GB/s de ancho de banda y 16 384 núcleos CUDA Ada Lovelace. Ejecuta Qwen 3.5 9B a más de 90 tok/s, un Qwen 3.8 27B Q4 con soltura e incluso un Llama 70B Q4 con offload ligero. Ahora cuesta entre 1700 y 2000 € de segunda mano (existencias ex-LHR) y ofrece una mejor relación rendimiento/precio que una 5080 nueva para uso exclusivo con LLM. Esta guía detalla todos los modelos que se pueden ejecutar y ofrece cifras aproximadas de velocidad de generación.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene un beneficio de las compras que cumplen los requisitos.

#La RTX 4090 en 2026 sigue siendo la reina

Arquitectura
Ada Lovelace (AD102), proceso de fabricación TSMC 4N. 76 mil millones de transistores.
VRAM
24 GB GDDR6X a 21 Gbps, bus de 384 bits. Ancho de banda de 1008 GB/s.
Núcleos CUDA
16 384. Tensor Cores de 4.ª generación con soporte nativo de FP8. RT Cores de 3.ª generación.
TDP
450 W. Fuente de alimentación de 850 W recomendada.
Precio 2026
1700-2000 € de segunda mano en buen estado.
→
¿Por qué sigue siendo relevante en 2026?
24 GB = umbral mágico que abre Llama 3.3 70B Q2_K (26 GB con offload de 2 GB), Qwen 3.8 27B en Q8, Qwen3-Coder 30B-A3B. La 5080 (16 GB nueva) no puede, la 5090 (32 GB nueva, ≈ 5 700 €) cuesta aproximadamente 3 veces más. En relación pura VRAM/€, la 4090 de segunda mano domina.

#1. Modelos compatibles con 24 GB

Modelos LLM — RTX 4090 24 GB
ModeloQuantVRAMTokens/secUso
gpt-oss 20BQ4_K_M13 GB117-143Chat instantáneo
Devstral Small 2 24BQ4_K_M14 GB36-44Chat + RAG FR
Qwen 3.6 27BQ4_K_M16 GB29-35Asistente de código profesional
Qwen 3.8 27BQ4_K_M16 GB20-24Razonamiento de calidad
Mistral Small 24BQ6_K20 GB32-38Punto óptimo para usos variados
GLM 4.7 FlashQ4_K_M19 GB90-110Razonamiento avanzado
Granite 4.1 30B InstructQ4_K_M17 GB27-33Código complejo de múltiples archivos
Gemma 4 26B-A4B MoEQ5_K_M19 GB54-66Descarga de 2 GB a la RAM del sistema, utilizable
Gemma 4 31BQ5_K_M22 GB27-33Todo en VRAM, calidad degradada
i
Llama 70B: ¿qué cuantización preferir?
Q4_K_M (42 GB): transferencia masiva a la RAM, ~6 tok/s, poco cómodo. Q2_K (26 GB): 2 GB que deben trasladarse a la RAM, ~10 tok/s, calidad aceptable. IQ2_XS (21 GB): todo en VRAM, ~20 tok/s, pero con una calidad claramente degradada. Para ejecutar cómodamente un modelo de 70B en local, apunta a una 5090 (32 GB) o un Mac Studio.

#2. Instalación y CUDA

  1. 01
    Drivers NVIDIA 550+
    CUDA 12.4+. Para una 4090 nueva, GeForce Experience se encarga de ello. Linux: nvidia-driver-565 o posterior.
  2. 02
    Ollama
    Instalador estándar desde ollama.com. Detección automática de GPU CUDA.
  3. 03
    Primera prueba de un modelo para 24 GB
    ollama run qwen3.8:27b — profite de la VRAM dispo et met en valeur la carte.
Instalación completa en Linux
# Ubuntu 24.04
sudo apt install nvidia-driver-565
sudo reboot

curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen3.8:27b

#3. Pruebas de rendimiento en tokens/s

RTX 4090 24 GB — órdenes de magnitud de tokens/segundo
ModeloQ4_K_MQ5_K_MQ6_KQ8_0
Qwen 3.5 4B135 t/s122 t/s110 t/s90 t/s
Granite 4.2 8B100 t/s92 t/s82 t/s66 t/s
Qwen 3.5 9B92 t/s85 t/s76 t/s62 t/s
Gemma 4 12B70 t/s64 t/s57 t/s48 t/s
Mistral Small 24B42 t/s38 t/s34 t/s28 t/s
Qwen 3.8 27B32 t/s28 t/s25 t/s—

#4. Optimizaciones Ada

Flash Attention 2
Activo por defecto. FA3 llegará en las próximas versiones de llama.cpp
KV cache Q8
OLLAMA_KV_CACHE_TYPE=q8_0. Permite un contexto de 32k en un modelo de 14B con ~15 GB, dejando 9 GB para otros procesos.
Límite de potencia
nvidia-smi -pl 350 (a partir de 350 W). LLM : -2 % de velocidad, -25 % de calor y ruido. Configuración sostenible 24/7.
FP8 a través de TensorRT-LLM
Ada admite FP8 de forma nativa. Con TensorRT-LLM, el rendimiento por lotes aumenta un 40 % en Qwen 3.5 9B. Es especialmente útil para servir el modelo a varios usuarios.

#5. 4090 vs 5090 vs 3090

Los tres modelos insignia de NVIDIA para el mercado de consumo
CriterioRTX 5090RTX 4090RTX 3090
VRAM32 GB GDDR724 GB GDDR6X24 GB GDDR6X
Ancho de banda1792 GB/s1008 GB/s936 GB/s
Qwen 3.5 9B Q4115 t/s92 t/s66 t/s
Llama 70B Q422-28 t/s7-10 t/s5-8 t/s
Precio 2026≈ 5 700 € (28/09/2026)~1800 € de ocasión~750 € de ocasión
→
Mejor relación 24 GB/€: 3090 de ocasión
Por 750 € frente a 1800 €, la 3090 ofrece los mismos 24 GB de VRAM. Pérdida de aproximadamente un 30 % en velocidad pura. Si tu prioridad es la VRAM (modelos de 24-32B, QLoRA 14B+) y no la velocidad máxima, la 3090 de segunda mano sigue ofreciendo la mejor relación calidad-precio para LLM de toda la historia de NVIDIA.

#De segunda mano en 2026: ¿una compra inteligente?

Compra una 4090 de segunda mano si
Presupuesto 1500-2000 €, uso intenso de LLM, no es necesario tener la última generación. 24 GB de VRAM = argumento fuerte.
Elige preferentemente una RTX 5090 si
Presupuesto ≥ 5 700 €, uso regular de 70B, necesidad de FP4 nativo, servidor de equipo. 32 GB cambian el panorama.
Prefiere una RTX 3090 si
Presupuesto ≤ 1000 €, uso exclusivo de LLM, velocidad secundaria. La misma cantidad de VRAM por la mitad del precio.
Prefiere una RTX 5070 Ti si
Presupuesto ~1 400 €, uso de modelos de hasta 14B. Nueva con garantía, GDDR7, soporte de FP4.

#Preguntas frecuentes

¿Puede la RTX 4090 ejecutar Llama 3.3 70B localmente?+
Sí, pero con ciertas concesiones. Q4_K_M (42 GB): descarga masiva a la RAM → 6-8 tok/s (inutilizable). Q2_K (26 GB): 2 GB en RAM → 10-12 tok/s (aceptable). IQ2_XS (21 GB): todo en VRAM → 20 tok/s, pero con pérdida de calidad. Para usar cómodamente un modelo realmente grande, elige una 5090 (32 GB) o sigue con un Qwen 3.8 27B que cabe íntegramente en VRAM.
¿Cuántos tokens/segundo para Qwen 3.5 9B en RTX 4090?+
Aproximadamente 90 tokens/segundo en Q4_K_M, 62 tok/s en Q8_0. Más que suficiente para cualquier uso de chat, con el añadido de los 256k de contexto y las capacidades de visión del modelo.
¿RTX 4090 de segunda mano o RTX 5080 nueva?+
4090 de segunda mano (1800 €): 24 GB de VRAM, un 10 % más lenta que una 5080 con modelos de 7B, pero permite ejecutar modelos de 70B con offload y de 32B en Q6. 5080 nueva (≈ 1 500 a 1 850 €): 16 GB, más rápida con modelos pequeños, garantía de 3 años y soporte para FP4. Para uso exclusivo con LLM, la 4090 gana gracias a la VRAM. Para rendimiento + garantía, la 5080.
¿La RTX 4090 se calienta y consume mucho al ejecutar LLM?+
Menos que al jugar. Inferencia sostenida con Qwen 3.5 9B: 250-320 W (frente a un TDP de 450 W), GPU a 65-72 °C. Basta una caja con un flujo de aire adecuado. Para un uso 24/7, aplicar undervolting a 350 W reduce el calor y el ruido sin una pérdida significativa de rendimiento con LLM.
¿Se puede hacer fine-tuning LoRA en RTX 4090?+
Sí, excelente. LoRA en Qwen 3.5 9B: 12 GB, cómodo con batch 4, contexto 4096. QLoRA en Mistral Small 24B: ~18 GB, posible. QLoRA en un 70B: ajustado, pero factible con unsloth + batch 1. Para LoRA clásico en 70B, se necesitan 2× 4090 o una 5090.
¿La RTX 4090 soporta FP8?+
Sí, los Tensor Cores de 4.ª generación de Ada Lovelace admiten FP8 de forma nativa. TensorRT-LLM lo aprovecha (mejora del +30-40 % frente a FP16), al igual que vLLM (0.5+) y, parcialmente, llama.cpp. Para el uso general de Ollama, quédate con Q4-Q8. Para servir modelos por lotes, FP8 merece la pena.
¿Qué fuente de alimentación para una RTX 4090?+
Una fuente de alimentación de calidad de al menos 850 W (ATX 3.0 recomendado, pero no obligatorio). Al usar LLM, el consumo medio es de 250-320 W. En juegos o benchmarks, 450 W. Con una CPU de gama alta (9950X, 14900K), 1000 W ofrecen más tranquilidad.

Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.