Inicio › Catálogo › Mejor LLM para RTX 4090 (24 GB) en 2026

Mejor LLM para RTX 4090 (24 GB) en 2026

◆ IA Local — Tu ChatGPT privado y gratuito, en tu máquina, en 1 h · 24 € · o todos los kits 49 € →

Ranking actualizado el 22/09/2026

La RTX 4090 (24 GB de VRAM, arquitectura Ada Lovelace) es la referencia del mercado de consumo para la inferencia de LLM en 2026. Estos son los modelos que mejor la aprovechan: máxima calidad en Q4/Q5 sin superar los 24 GB y una velocidad cómoda (30 o más tokens/segundo).

Ofertas y alternativas para la IA local

RTX 4090 : alternativa de compra disponible para IA local — GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) :

Un mini-PC es una máquina completa: revisa la memoria necesaria y la compatibilidad del software. No reemplaza a macOS/MLX ni a CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

¿Qué PC elegir según tu presupuesto? Nuestras opciones de 800 a 3 500 € →

Enlaces de afiliados — QuelLLM puede percibir una comisión por las compras, sin coste adicional para ti, lo cual no influye en el ranking (establecido de forma independiente). Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

Clasificación

1

🇺🇸 Laguna XS.2

Poolside · 33 mil millones de parámetros · Apache 2.0 · 131 072 tokens ctx

MoE 33B/3B activos, Apache 2.0, especialista en programación con agentes. 68.2% SWE-Bench Verified, 128k ctx. Funciona en un Mac con 36 GB. Lanzamiento el 28 de abril de 2026.

Por qué esta posición Cabe en Q5_K_M (~23 GB de los 24 GB disponibles). 33 mil millones de parámetros, contexto de 131 072 tokens.
ollama run laguna-xs.2
En RTX 4090
Q5_K_M
23 GB · 100 tok/s
2

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B de parámetros · Apache 2.0 · 128 000 tokens ctx

Variante MoE de Gemma 4. 26B/4B activos. Multimodal completo (texto+imagen+audio).

Por qué esta posición Mantiene en Q5_K_M (~19 GB sobre 24 GB disponibles). 26B parámetros, contexto de 128 000 tokens.
ollama run gemma4:26b
En RTX 4090
Q5_K_M
19 GB · 60 tok/s
3

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16 mil millones de parámetros · Apache 2.0 · 8 192 tokens ctx

Primer dLLM abierto con licencia Apache 2.0: MoE 16B/1B + decodificador de difusión de 6.2B. Texto+visión unificados. Lanzamiento: 22 de abril de 2026.

Por qué esta posición Cabe en Q5_K_M (~22 GB de los 24 GB disponibles). 16 mil millones de parámetros, contexto de 8.192 tokens.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
En RTX 4090
Q5_K_M
22 GB · 130 tok/s
4

🇨🇳 Qwen 3.6 27B

Alibaba · 27 mil millones de parámetros · Apache 2.0 · 262 144 tokens ctx

Modelo denso multimodal de 27B, lanzado el 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Por qué esta posición Cabe en Q5_K_M (~19 GB de los 24 GB disponibles). 27B parámetros, contexto de 262.144 tokens.
ollama run qwen3.6:27b
En RTX 4090
Q5_K_M
19 GB · 32 tok/s
5

🇨🇳 Qwen 3.8 27B

Alibaba · 27 mil millones de parámetros · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B: modelo denso multimodal (texto + visión), 262k de contexto, ~16 GB de VRAM en Q4 (18 GB de pesos en Ollama). Apache 2.0, programación con agentes y visión.

Por qué esta posición Cabe en Q5_K_M (~19 GB de los 24 GB disponibles). 27B parámetros, contexto de 262.144 tokens.
ollama run qwen3.8:27b
En RTX 4090
Q5_K_M
19 GB · 22 tok/s
6

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31 mil millones de parámetros · MIT · 128 000 tokens ctx

GLM-4.7-Flash (MoE 31B, ~3B activos): la mejor relación código/VRAM de la clase 30B. MIT, 128k ctx, muy rápido en 3090/4090.

Por qué esta posición Cabe en Q5_K_M (~23 GB de los 24 GB disponibles). 31B parámetros, contexto de 128 000 tokens.
ollama run glm-4.7-flash
En RTX 4090
Q5_K_M
23 GB · 100 tok/s
7

🇺🇸 Gemma 4 31B

Google · 31 mil millones de parámetros · Apache 2.0 · 256 000 tokens ctx

Modelo denso multimodal de 31B (texto+imagen+audio). Más de 140 idiomas, contexto de 256k. N.º 3 en Chatbot Arena open.

Por qué esta posición Cabe en Q5_K_M (~22 GB de los 24 GB disponibles). 31B parámetros, contexto de 256 000 tokens.
ollama run gemma4:31b
En RTX 4090
Q5_K_M
22 GB · 30 tok/s

Tabla comparativa

Puesto Modelo Params VRAM Q4 Contexto Licencia En RTX 4090
#1 Laguna XS.2 33B 19 GB 131 072 Apache 2.0 100 tok/s · Q5_K_M
#2 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0 60 tok/s · Q5_K_M
#3 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0 130 tok/s · Q5_K_M
#4 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0 32 tok/s · Q5_K_M
#5 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0 22 tok/s · Q5_K_M
#6 GLM 4.7 Flash 31B 19 GB 128 000 MIT 100 tok/s · Q5_K_M
#7 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0 30 tok/s · Q5_K_M
El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Memo gratuito

¿Qué modelo para programar ejecutar en TU máquina?

Recibe el resumen VRAM → mejor modelo de código → comando Ollama (una sola pantalla, copiar y pegar). Y pasa al kit Copiloto Local para convertirlo en una configuración que realmente funcione.

El kit Copiloto Local — las configuraciones de Ollama + Cline + Aider listas para pegar, Modelfiles ajustados, solución de problemas, espacio en línea de por vida →

Sin spam. Darte de baja en 1 clic. Tus datos se quedan con nosotros (nunca se venden).

Metodología del ranking

Se mantienen los modelos que caben en 24 GB en Q4_K_M y que aprovechan al menos un 40% de la VRAM (de lo contrario, un 7B basta). Puntaje extra para los modelos cuyo uso de VRAM esté entre el 60% y el 95% — punto óptimo calidad/velocidad.

Criterios considerados:

  • Cabe en 24 GB en Q4_K_M
  • Aprovecha la VRAM (> 60%)
  • Velocidad ≥ 30 tokens/seg
  • Calidad > 7B

La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.

Preguntas frecuentes

¿Se puede ejecutar un 70B en RTX 4090?

En Q4_K_M, un 70B requiere ~40 GB de VRAM: demasiado para una sola 4090. Hay que bajar a Q2/Q3 (pérdida de calidad), trasladar el modelo a la RAM de la CPU (muy lento) o añadir una 2.ª tarjeta. Para un 70B real, apunta a 2× RTX 4090 o a una 5090 + DDR5.

¿Qué cuantización elegir para una RTX 4090?

Q5_K_M es el punto ideal (menos del 1% de pérdida en comparación con FP16 según los benchmarks). Q8 es claramente mejor que Q5 pero consume un 50% más de VRAM. Q4 solo si deseas un modelo grande que no entre en Q5.

¿Mistral Small 3.1 24B o Qwen 2.5 32B en una 4090?

Ver el comparativo. Mistral Small 3.1 es más rápido (24B < 32B) y mejor en francés. Qwen 2.5 32B es más capaz en tareas generales y en código.

¿Qué motor de inferencia usar en una RTX 4090?

Para chat interactivo: Ollama (simple) o llama.cpp (máximo control). Para un mayor rendimiento en servidor: vLLM o ExLlamaV2. La mejora de rendimiento puede alcanzar 2-3× en vLLM con procesamiento por lotes.

Para ir más allá

Los kits de QuelLLM La guía de referencia según el uso
Todos los kits de por vida — 49 €