🇨🇳 GLM 4.7 Flash
GLM-4.7-Flash (MoE 31B, ~3B activos): la mejor relación código/VRAM de la clase 30B. MIT, 128k ctx, muy rápido en 3090/4090.
ollama run glm-4.7-flash
Ranking actualizado el 22/09/2026
La RTX 5090 (Blackwell, 32 GB GDDR7, 1792 GB/s) es la primera GPU de consumo que supera los 24 GB. Llama 70B Q4_K_M cabe con 12 GB de margen para el contexto. La referencia absoluta para la IA local en 2026.
RTX 5090 : alternativa de compra disponible para IA local — GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) :
Un mini-PC es una máquina completa: revisa la memoria necesaria y la compatibilidad del software. No reemplaza a macOS/MLX ni a CUDA.
¿Qué PC elegir según tu presupuesto? Nuestras opciones de 800 a 3 500 € →
Enlaces de afiliados — QuelLLM puede percibir una comisión por las compras, sin coste adicional para ti, lo cual no influye en el ranking (establecido de forma independiente). Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
GLM-4.7-Flash (MoE 31B, ~3B activos): la mejor relación código/VRAM de la clase 30B. MIT, 128k ctx, muy rápido en 3090/4090.
ollama run glm-4.7-flash
MoE 33B/3B activos, Apache 2.0, especialista en programación con agentes. 68.2% SWE-Bench Verified, 128k ctx. Funciona en un Mac con 36 GB. Lanzamiento el 28 de abril de 2026.
ollama run laguna-xs.2
MoE 30B/3B activos: modo thinking + instruct. Medalla de oro en IMO 2025 e IOI 2025. Inferencia rápida gracias a los 3B activos, capacidades de razonamiento de nivel 30B. Lanzamiento en abril de 2026.
ollama run nemotron-cascade-2
Híbrido Mamba-2 + MoE 32B/9B activos. ~70% menos de RAM en contexto largo. Apache 2.0.
ollama run granite4:small-h
MoE 30B/3B activos, razonamiento híbrido. MMLU 81.4, AIME24 80.4. Más de 100 idiomas.
ollama run qwen3:30b-a3b
MoE de NVIDIA: 30B, con 3.5B activos; chat, código y razonamiento. Contexto de 128k, velocidad de un 3.5B con las capacidades de un 30B. Lanzamiento en abril de 2026.
ollama run nemotron-3-nano
MoE de 30B (3,3B activos), especializado en programación agéntica. Muy rápido en local, contexto nativo de 256k, la referencia para 16-24 GB con Ollama.
ollama run qwen3-coder:30b
Visión MoE 30B/3B activos. Punto óptimo para visión en Qwen 3. 256k ctx.
ollama run qwen3-vl:30b
| Puesto | Modelo | Params | VRAM Q4 | Contexto | Licencia | En RTX 5090 |
|---|---|---|---|---|---|---|
| #1 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 100 tok/s · Q5_K_M |
| #2 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 | 100 tok/s · Q5_K_M |
| #3 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License | 80 tok/s · Q8 |
| #4 | Granite 4.0 H-Small 32B-A9B | 32B | 19 GB | 128 000 | Apache 2.0 | 75 tok/s · Q5_K_M |
| #5 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 | 100 tok/s · Q5_K_M |
| #6 | Nemotron 3 Nano 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License | 80 tok/s · Q8 |
| #7 | Qwen3-Coder 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 100 tok/s · Q5_K_M |
| #8 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 100 tok/s · Q5_K_M |
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
Memo gratuito
Recibe el resumen VRAM → mejor modelo de código → comando Ollama (una sola pantalla, copiar y pegar). Y pasa al kit Copiloto Local para convertirlo en una configuración que realmente funcione.
El kit Copiloto Local — las configuraciones de Ollama + Cline + Aider listas para pegar, Modelfiles ajustados, solución de problemas, espacio en línea de por vida →Sin spam. Darte de baja en 1 clic. Tus datos se quedan con nosotros (nunca se venden).
Tu tarjeta → el mejor modelo para programar que puedes ejecutar en local, y el comando exacto de Ollama:
| Tu VRAM | GPU / Mac típicos | Modelo recomendado para programar | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) o Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — especialista en agentes de programación | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — el « casi Copilot » | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE rápido | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — sigue siendo la referencia en este caso concreto. ⚠️ Qwen 3.8: su nivel de razonamiento está configurado muy alto por defecto y «piensa demasiado» ante solicitudes simples — bájalo a low (o desactívalo) en el primer arranque. ⚠️ La trampa de la licencia: Codestral 22B = Mistral Non-Production License → prohibido para programar en el trabajo. Qwen 3.5/3.8, Gemma 4 y Devstral tienen licencia Apache 2.0. 💡 ¿Se cuelga por falta de memoria? Deja ~1,5 GB de VRAM libre para el contexto, o baja un nivel de cuantización.🔌 Para integrarlo en VS Code: Cline (agente que trabaja con varios archivos), Aider (CLI) o Tabby/Twinny (autocompletado FIM) — todos se conectan a Ollama en local. El kit Copiloto Local — configuraciones listas para pegar + configuración probada — está disponible: /copilote-local.
Filtro: modelos que caben en menos de 30 GB en Q4_K_M (deja 2 GB para el contexto). Extra para 30-70B (pico en la 5090) y MoE 100B (32 GB permiten acceder a DBRX y Mixtral 8x22B). 1792 GB/s = récord de rendimiento en hardware de consumo.
Criterios considerados:
La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.
RTX 5090 de 32 GB: ¿Llama 70B funciona con fluidez?
Sí — Llama 3.3 70B Q4_K_M (~40 GB) NO CABE en una sola tarjeta; Q3_K_M (~30 GB) cabe y funciona a 35-45 tok/s. Q5_K_M (~48 GB) requiere descargar parcialmente el modelo a la CPU. Para 70B Q4 sin concesiones, optar por 2× RTX 4090/5090 o un Mac Studio con 96 GB o más.
¿RTX 5090 vs 2× RTX 4090?
5090 = 32 GB en una sola tarjeta + 1792 GB/s. 2× 4090 = 48 GB (repartidos entre ambas tarjetas) + 1008 GB/s por tarjeta. Para 70B Q4 (~40 GB), 2× 4090 gana. Para 30-32B Q5 + contexto largo, la 5090 es más sencilla (sin sobrecarga por el reparto). Consulta RTX 4090.
¿Cuál es la cuantización óptima para una 5090?
Q5_K_M para 30B (~22 GB) o Q4 para 70B (~40 GB, con descarga parcial en la RAM del sistema). Q8 para 13-14B (Qwen 3 14B ~15 GB) con calidad máxima. Q6_K es un excelente equilibrio para 32B (~25 GB).
¿MoE en RTX 5090?
Excelente: Mixtral 8x22B Q4 (~80 GB) no cabe, pero 8x7B Q4 (~28 GB) funciona a 80+ tok/s. Qwen 3 30B-A3B Q8 (~32 GB) también funciona con fluidez. Ver clasificación de agentes/MoE.