¿Qué LLM usar con una RTX 4090 (24 GB) ?
La RTX 4090 (octubre de 2022) sigue siendo en 2026 la referencia para la IA local en el mercado de consumo: 24 GB de VRAM GDDR6X, 1008 GB/s de ancho de banda y 16 384 núcleos CUDA Ada Lovelace. Ejecuta Qwen 3.5 9B a más de 90 tok/s, un Qwen 3.8 27B Q4 con soltura e incluso un Llama 70B Q4 con offload ligero. Ahora cuesta entre 1700 y 2000 € de segunda mano (existencias ex-LHR) y ofrece una mejor relación rendimiento/precio que una 5080 nueva para uso exclusivo con LLM. Esta guía detalla todos los modelos que se pueden ejecutar y ofrece cifras aproximadas de velocidad de generación.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene un beneficio de las compras que cumplen los requisitos.
#La RTX 4090 en 2026 sigue siendo la reina
- Arquitectura
- Ada Lovelace (AD102), proceso de fabricación TSMC 4N. 76 mil millones de transistores.
- VRAM
- 24 GB GDDR6X a 21 Gbps, bus de 384 bits. Ancho de banda de 1008 GB/s.
- Núcleos CUDA
- 16 384. Tensor Cores de 4.ª generación con soporte nativo de FP8. RT Cores de 3.ª generación.
- TDP
- 450 W. Fuente de alimentación de 850 W recomendada.
- Precio 2026
- 1700-2000 € de segunda mano en buen estado.
#1. Modelos compatibles con 24 GB
| Modelo | Quant | VRAM | Tokens/sec | Uso |
|---|---|---|---|---|
| gpt-oss 20B | Q4_K_M | 13 GB | 117-143 | Chat instantáneo |
| Devstral Small 2 24B | Q4_K_M | 14 GB | 36-44 | Chat + RAG FR |
| Qwen 3.6 27B | Q4_K_M | 16 GB | 29-35 | Asistente de código profesional |
| Qwen 3.8 27B | Q4_K_M | 16 GB | 20-24 | Razonamiento de calidad |
| Mistral Small 24B | Q6_K | 20 GB | 32-38 | Punto óptimo para usos variados |
| GLM 4.7 Flash | Q4_K_M | 19 GB | 90-110 | Razonamiento avanzado |
| Granite 4.1 30B Instruct | Q4_K_M | 17 GB | 27-33 | Código complejo de múltiples archivos |
| Gemma 4 26B-A4B MoE | Q5_K_M | 19 GB | 54-66 | Descarga de 2 GB a la RAM del sistema, utilizable |
| Gemma 4 31B | Q5_K_M | 22 GB | 27-33 | Todo en VRAM, calidad degradada |
#2. Instalación y CUDA
- 01Drivers NVIDIA 550+CUDA 12.4+. Para una 4090 nueva, GeForce Experience se encarga de ello. Linux: nvidia-driver-565 o posterior.
- 02OllamaInstalador estándar desde ollama.com. Detección automática de GPU CUDA.
- 03Primera prueba de un modelo para 24 GBollama run qwen3.8:27b — profite de la VRAM dispo et met en valeur la carte.
#3. Pruebas de rendimiento en tokens/s
| Modelo | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| Qwen 3.5 4B | 135 t/s | 122 t/s | 110 t/s | 90 t/s |
| Granite 4.2 8B | 100 t/s | 92 t/s | 82 t/s | 66 t/s |
| Qwen 3.5 9B | 92 t/s | 85 t/s | 76 t/s | 62 t/s |
| Gemma 4 12B | 70 t/s | 64 t/s | 57 t/s | 48 t/s |
| Mistral Small 24B | 42 t/s | 38 t/s | 34 t/s | 28 t/s |
| Qwen 3.8 27B | 32 t/s | 28 t/s | 25 t/s | — |
#4. Optimizaciones Ada
- Flash Attention 2
- Activo por defecto. FA3 llegará en las próximas versiones de llama.cpp
- KV cache Q8
- OLLAMA_KV_CACHE_TYPE=q8_0. Permite un contexto de 32k en un modelo de 14B con ~15 GB, dejando 9 GB para otros procesos.
- Límite de potencia
- nvidia-smi -pl 350 (a partir de 350 W). LLM : -2 % de velocidad, -25 % de calor y ruido. Configuración sostenible 24/7.
- FP8 a través de TensorRT-LLM
- Ada admite FP8 de forma nativa. Con TensorRT-LLM, el rendimiento por lotes aumenta un 40 % en Qwen 3.5 9B. Es especialmente útil para servir el modelo a varios usuarios.
#5. 4090 vs 5090 vs 3090
| Criterio | RTX 5090 | RTX 4090 | RTX 3090 |
|---|---|---|---|
| VRAM | 32 GB GDDR7 | 24 GB GDDR6X | 24 GB GDDR6X |
| Ancho de banda | 1792 GB/s | 1008 GB/s | 936 GB/s |
| Qwen 3.5 9B Q4 | 115 t/s | 92 t/s | 66 t/s |
| Llama 70B Q4 | 22-28 t/s | 7-10 t/s | 5-8 t/s |
| Precio 2026 | ≈ 5 700 € (28/09/2026) | ~1800 € de ocasión | ~750 € de ocasión |
#De segunda mano en 2026: ¿una compra inteligente?
- Compra una 4090 de segunda mano si
- Presupuesto 1500-2000 €, uso intenso de LLM, no es necesario tener la última generación. 24 GB de VRAM = argumento fuerte.
- Elige preferentemente una RTX 5090 si
- Presupuesto ≥ 5 700 €, uso regular de 70B, necesidad de FP4 nativo, servidor de equipo. 32 GB cambian el panorama.
- Prefiere una RTX 3090 si
- Presupuesto ≤ 1000 €, uso exclusivo de LLM, velocidad secundaria. La misma cantidad de VRAM por la mitad del precio.
- Prefiere una RTX 5070 Ti si
- Presupuesto ~1 400 €, uso de modelos de hasta 14B. Nueva con garantía, GDDR7, soporte de FP4.
#Preguntas frecuentes
¿Puede la RTX 4090 ejecutar Llama 3.3 70B localmente?+
¿Cuántos tokens/segundo para Qwen 3.5 9B en RTX 4090?+
¿RTX 4090 de segunda mano o RTX 5080 nueva?+
¿La RTX 4090 se calienta y consume mucho al ejecutar LLM?+
¿Se puede hacer fine-tuning LoRA en RTX 4090?+
¿La RTX 4090 soporta FP8?+
¿Qué fuente de alimentación para una RTX 4090?+
Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.