Inicio › Catálogo › Mejor LLM para RTX 3090 (24 GB) en 2026 — una de las mejores GPU de segunda mano para LLM

Mejor LLM para RTX 3090 (24 GB) en 2026 — una de las mejores GPU de segunda mano para LLM

◆ IA Local — Tu ChatGPT privado y gratuito, en tu máquina, en 1 h · 24 € · o todos los kits 49 € →

Ranking actualizado el 22/09/2026

La RTX 3090 (24 GB GDDR6X, 936 GB/s) ofrece LA mejor relación rendimiento/precio para LLM en 2026. ~600-700 € de segunda mano, 24 GB a plena potencia, ejecución fluida de Qwen 32B Q5. Combina 2 tarjetas para obtener 48 GB por ~1300 €.

Ofertas y alternativas para la IA local

RTX 3090 : alternativa de compra disponible para IA local — GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) :

Un mini-PC es una máquina completa: revisa la memoria necesaria y la compatibilidad del software. No reemplaza a macOS/MLX ni a CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

¿Qué PC elegir según tu presupuesto? Nuestras opciones de 800 a 3 500 € →

Enlaces de afiliados — QuelLLM puede percibir una comisión por las compras, sin coste adicional para ti, lo cual no influye en el ranking (establecido de forma independiente). Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

Clasificación

1

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B de parámetros · Apache 2.0 · 128 000 tokens ctx

Variante MoE de Gemma 4. 26B/4B activos. Multimodal completo (texto+imagen+audio).

Por qué esta posición Variante MoE de Gemma 4. 26B/4B activos. Multimodal completo (texto+imagen+audio).
ollama run gemma4:26b
En RTX 3090
Q5_K_M
19 GB · 22 tok/s
2

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16 mil millones de parámetros · Apache 2.0 · 8 192 tokens ctx

Primer dLLM abierto con licencia Apache 2.0: MoE 16B/1B + decodificador de difusión de 6.2B. Texto+visión unificados. Lanzamiento: 22 de abril de 2026.

Por qué esta posición Primer dLLM abierto con licencia Apache 2.0: MoE 16B/1B + decodificador de difusión de 6.2B. Texto+visión unificados. Lanzamiento: 22 de abril de 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
En RTX 3090
Q5_K_M
22 GB · 60 tok/s
3

🇨🇳 Qwen 3.6 27B

Alibaba · 27 mil millones de parámetros · Apache 2.0 · 262 144 tokens ctx

Modelo denso multimodal de 27B, lanzado el 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Por qué esta posición Modelo denso multimodal de 27B, lanzado el 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
En RTX 3090
Q5_K_M
19 GB · 13 tok/s
4

🇨🇳 Qwen 3.8 27B

Alibaba · 27 mil millones de parámetros · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B: modelo denso multimodal (texto + visión), 262k de contexto, ~16 GB de VRAM en Q4 (18 GB de pesos en Ollama). Apache 2.0, programación con agentes y visión.

Por qué esta posición Qwen 3.8 27B: modelo denso multimodal (texto + visión), 262k de contexto, ~16 GB de VRAM en Q4 (18 GB de pesos en Ollama). Apache 2.0, programación con agentes y visión.
ollama run qwen3.8:27b
En RTX 3090
Q5_K_M
19 GB · 14 tok/s
5

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31 mil millones de parámetros · MIT · 128 000 tokens ctx

GLM-4.7-Flash (MoE 31B, ~3B activos): la mejor relación código/VRAM de la clase 30B. MIT, 128k ctx, muy rápido en 3090/4090.

Por qué esta posición GLM-4.7-Flash (MoE 31B, ~3B activos): la mejor relación código/VRAM de la clase 30B. MIT, 128k ctx, muy rápido en 3090/4090.
ollama run glm-4.7-flash
En RTX 3090
Q5_K_M
23 GB · 40 tok/s
6

🇺🇸 Gemma 4 31B

Google · 31 mil millones de parámetros · Apache 2.0 · 256 000 tokens ctx

Modelo denso multimodal de 31B (texto+imagen+audio). Más de 140 idiomas, contexto de 256k. N.º 3 en Chatbot Arena open.

Por qué esta posición Modelo denso multimodal de 31B (texto+imagen+audio). Más de 140 idiomas, contexto de 256k. N.º 3 en Chatbot Arena open.
ollama run gemma4:31b
En RTX 3090
Q5_K_M
22 GB · 12 tok/s
7

🇺🇸 Granite 4.1 30B Instruct

IBM · 30B de parámetros · Apache 2.0 · 131 072 tokens ctx

Denso de 30B, licencia Apache 2.0, 12 idiomas incluido el francés, 131k ctx, GQA 32Q/8KV. Llamadas a herramientas compatibles con OpenAI. Lanzamiento el 29 de abril de 2026.

Por qué esta posición Denso de 30B, licencia Apache 2.0, 12 idiomas incluido el francés, 131k ctx, GQA 32Q/8KV. Llamadas a herramientas compatibles con OpenAI. Lanzamiento el 29 de abril de 2026.
ollama run granite4.1:30b
En RTX 3090
Q5_K_M
21 GB · 12 tok/s
8

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B de parámetros · NVIDIA Open Model License · 128 000 tokens ctx

MoE 30B/3B activos: modo thinking + instruct. Medalla de oro en IMO 2025 e IOI 2025. Inferencia rápida gracias a los 3B activos, capacidades de razonamiento de nivel 30B. Lanzamiento en abril de 2026.

Por qué esta posición MoE 30B/3B activos: modo thinking + instruct. Medalla de oro en IMO 2025 e IOI 2025. Inferencia rápida gracias a los 3B activos, capacidades de razonamiento de nivel 30B. Lanzamiento en abril de 2026.
ollama run nemotron-cascade-2
En RTX 3090
Q5_K_M
21 GB · 30 tok/s

Tabla comparativa

Puesto Modelo Params VRAM Q4 Contexto Licencia En RTX 3090
#1 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0 22 tok/s · Q5_K_M
#2 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0 60 tok/s · Q5_K_M
#3 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0 13 tok/s · Q5_K_M
#4 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0 14 tok/s · Q5_K_M
#5 GLM 4.7 Flash 31B 19 GB 128 000 MIT 40 tok/s · Q5_K_M
#6 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0 12 tok/s · Q5_K_M
#7 Granite 4.1 30B Instruct 30B 17 GB 131 072 Apache 2.0 12 tok/s · Q5_K_M
#8 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA Open Model License 30 tok/s · Q5_K_M
El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Memo gratuito

¿Qué modelo para programar ejecutar en TU máquina?

Recibe el resumen VRAM → mejor modelo de código → comando Ollama (una sola pantalla, copiar y pegar). Y pasa al kit Copiloto Local para convertirlo en una configuración que realmente funcione.

El kit Copiloto Local — las configuraciones de Ollama + Cline + Aider listas para pegar, Modelfiles ajustados, solución de problemas, espacio en línea de por vida →

Sin spam. Darte de baja en 1 clic. Tus datos se quedan con nosotros (nunca se venden).

Metodología del ranking

Filtro: Q4_K_M ≤ 22 GB. Bonus 13-32B (pico 24 GB). 936 GB/s GDDR6X = sólido Ampere.

Criterios considerados:

  • Q4_K_M ≤ 22 GB
  • Lo mejor de segunda mano para LLM en 2026
  • Qwen 3 32B Q5 fluido
  • Fine-tuning LoRA 7-13B

La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.

Preguntas frecuentes

¿Por qué la 3090 es la mejor opción de segunda mano para LLM en 2026?

24 GB de VRAM (= 4090 y 3090 Ti) por unos 600-700 €. La 4070 Ti Super nueva cuesta unos 900 € y ofrece 16 GB. La 3090 sigue siendo imbatible en €/GB de VRAM para LLM. Ver guía completa.

3090 vs 4090: ¿cuál elegir en 2026?

La 4090 es ~2 veces más rápida, pero cuesta ~1500 € nueva, frente a ~650 € por una 3090 de segunda mano. Si el presupuesto lo permite, la 4090. Si buscas una elección racional, la 3090. Consulta RTX 4090.

¿Configuración con 2× 3090 para Llama 70B?

Sí — 48 GB en total a ~1300 € de ocasión. Llama 70B Q4_K_M (~40 GB) se puede ejecutar con paralelismo tensorial (vLLM, llama.cpp -tp 2). ~25-35 tok/s. Difícil de superar en €/perf 70B local.

¿Qué modelo ofrece el mejor equilibrio en una 3090?

Qwen 3 32B Q5 (~22 GB) a 22-28 tok/s o Mistral Small 24B Q6 (~18 GB) a 30-35 tok/s. Para código, Qwen 2.5 Coder 32B Q4 (~17 GB). Véase clasificación para programación.

Para ir más allá

Los kits de QuelLLM La guía de referencia según el uso
Todos los kits de por vida — 49 €