🇨🇳 GLM 4.7 Flash
GLM-4.7-Flash (MoE 31B, ~3B activos): la mejor relación código/VRAM de la clase 30B. MIT, 128k ctx, muy rápido en 3090/4090.
ollama run glm-4.7-flash
Ranking actualizado el 22/09/2026
64 GB de memoria unificada son, en la práctica, el umbral para modelos de 70B. Llama 3.3 70B Q4_K_M cabe en ~40 GB, con un contexto de 32k incluido. Es el primer umbral en el que se puede competir en local con una configuración multi-GPU de RTX 4090.
Compara los precios de MacBook Pro M5 Pro — 24 GB / 1 TB en nuestros comercios asociados (fichas de producto verificadas):
¿Qué PC elegir según tu presupuesto? Nuestras opciones de 800 a 3 500 € →
Enlaces de afiliados — QuelLLM puede percibir una comisión por las compras, sin coste adicional para ti, lo cual no influye en el ranking (establecido de forma independiente). Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
GLM-4.7-Flash (MoE 31B, ~3B activos): la mejor relación código/VRAM de la clase 30B. MIT, 128k ctx, muy rápido en 3090/4090.
ollama run glm-4.7-flash
MoE 33B/3B activos, Apache 2.0, especialista en programación con agentes. 68.2% SWE-Bench Verified, 128k ctx. Funciona en un Mac con 36 GB. Lanzamiento el 28 de abril de 2026.
ollama run laguna-xs.2
Híbrido Mamba-2 + MoE 32B/9B activos. ~70% menos de RAM en contexto largo. Apache 2.0.
ollama run granite4:small-h
MoE 30B/3B activos, razonamiento híbrido. MMLU 81.4, AIME24 80.4. Más de 100 idiomas.
ollama run qwen3:30b-a3b
MoE 30B/3B activos: modo thinking + instruct. Medalla de oro en IMO 2025 e IOI 2025. Inferencia rápida gracias a los 3B activos, capacidades de razonamiento de nivel 30B. Lanzamiento en abril de 2026.
ollama run nemotron-cascade-2
MoE de 30B (3,3B activos), especializado en programación agéntica. Muy rápido en local, contexto nativo de 256k, la referencia para 16-24 GB con Ollama.
ollama run qwen3-coder:30b
Visión MoE 30B/3B activos. Punto óptimo para visión en Qwen 3. 256k ctx.
ollama run qwen3-vl:30b
Modelo coreano MoE con capacidades agénticas, 30B/3B activos. Cubre KR/EN/JP/ZH/TH/VI. Apache 2.0. Atención MLA.
ollama pull hf.co/kakaoai/Kanana-2-30B-GGUF
| Puesto | Modelo | Params | VRAM Q4 | Contexto | Licencia | En Apple M4 Max (64 GB) |
|---|---|---|---|---|---|---|
| #1 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 40 tok/s · Q8 |
| #2 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #3 | Granite 4.0 H-Small 32B-A9B | 32B | 19 GB | 128 000 | Apache 2.0 | 30 tok/s · Q8 |
| #4 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #5 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License | 30 tok/s · Q8 |
| #6 | Qwen3-Coder 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 40 tok/s · Q8 |
| #7 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 40 tok/s · Q8 |
| #8 | Kanana 2 30B-A3B Thinking | 30B | 18 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.
Memo gratuito
Recibe el resumen VRAM → mejor modelo de código → comando Ollama (una sola pantalla, copiar y pegar). Y pasa al kit Copiloto Local para convertirlo en una configuración que realmente funcione.
El kit Copiloto Local — las configuraciones de Ollama + Cline + Aider listas para pegar, Modelfiles ajustados, solución de problemas, espacio en línea de por vida →Sin spam. Darte de baja en 1 clic. Tus datos se quedan con nosotros (nunca se venden).
Tu tarjeta → el mejor modelo para programar que puedes ejecutar en local, y el comando exacto de Ollama:
| Tu VRAM | GPU / Mac típicos | Modelo recomendado para programar | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) o Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — especialista en agentes de programación | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — el « casi Copilot » | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE rápido | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — sigue siendo la referencia en este caso concreto. ⚠️ Qwen 3.8: su nivel de razonamiento está configurado muy alto por defecto y «piensa demasiado» ante solicitudes simples — bájalo a low (o desactívalo) en el primer arranque. ⚠️ La trampa de la licencia: Codestral 22B = Mistral Non-Production License → prohibido para programar en el trabajo. Qwen 3.5/3.8, Gemma 4 y Devstral tienen licencia Apache 2.0. 💡 ¿Se cuelga por falta de memoria? Deja ~1,5 GB de VRAM libre para el contexto, o baja un nivel de cuantización.🔌 Para integrarlo en VS Code: Cline (agente que trabaja con varios archivos), Aider (CLI) o Tabby/Twinny (autocompletado FIM) — todos se conectan a Ollama en local. El kit Copiloto Local — configuraciones listas para pegar + configuración probada — está disponible: /copilote-local.
Filtro: modelos de 7 a 100B cuya versión Q4_K_M ocupa menos de 48 GB (deja 16 GB para macOS + contexto). Bonificación para modelos de 30 a 70B (pico de 64 GB) y MoE.
Criterios considerados:
La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.
Mac de 64 GB: ¿Llama 70B Q4 funciona con fluidez?
En M3/M4 Max (400-546 GB/s), sí: 12-18 tokens/seg con Llama 3.3 70B Q4_K_M (~40 GB). En M1/M2 Max (200-400 GB/s), 8-12 tokens/seg: utilizable, pero más lento. Ver MBP M4 Max.
64 GB: ¿Llama 70B o Mistral Large 123B?
Llama 70B Q4 (~40 GB) funciona con fluidez. Mistral Large 123B Q4 (~68 GB) no cabe en 64 GB: se necesitan 96 GB o más. Elige Llama 70B o Mistral Small 3.2 24B Q8 (~26 GB) si buscas un modelo denso de calidad.
¿Mac de 64 GB o 2× RTX 3090 (48 GB de VRAM en total)?
2× 3090 = ~3× más rápido (936 GB/s por tarjeta frente a 400 GB/s de memoria unificada). Pero un Mac de 64 GB = silencio + portabilidad + cero cables. Para uso personal, el Mac gana en comodidad. Para uso profesional en tiempo real, 2× 3090 gana en throughput.
¿MoE 70B en 64 GB?
Sí: Mixtral 8x7B Q4 (~28 GB) o DeepSeek V4 Flash 284B (37B activos MoE) Q3_K_S (~140 GB) no cabe en 64 GB — se necesita un Mac Studio de 192 GB o más. Vea Mac Studio.