🇺🇸 Laguna XS.2
MoE 33B/3B activos, Apache 2.0, especialista en programación con agentes. 68.2% SWE-Bench Verified, 128k ctx. Funciona en un Mac con 36 GB. Lanzamiento el 28 de abril de 2026.
ollama run laguna-xs.2
Ranking actualizado el 22/09/2026
96 GB de memoria unificada (máximo en M2/M3/M4 Max, Studio M2 de entrada) ofrecen un margen considerable: Llama 70B en Q5/Q6, modelos de 100B en Q4, contexto de 100k+ para RAG con textos largos.
Compara los precios de MacBook Pro M5 Pro — 24 GB / 1 TB en nuestros comercios asociados (fichas de producto verificadas):
¿Qué PC elegir según tu presupuesto? Nuestras opciones de 800 a 3 500 € →
Enlaces de afiliados — QuelLLM puede percibir una comisión por las compras, sin coste adicional para ti, lo cual no influye en el ranking (establecido de forma independiente). Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
MoE 33B/3B activos, Apache 2.0, especialista en programación con agentes. 68.2% SWE-Bench Verified, 128k ctx. Funciona en un Mac con 36 GB. Lanzamiento el 28 de abril de 2026.
ollama run laguna-xs.2
GLM-4.7-Flash (MoE 31B, ~3B activos): la mejor relación código/VRAM de la clase 30B. MIT, 128k ctx, muy rápido en 3090/4090.
ollama run glm-4.7-flash
Híbrido Mamba-2 + MoE 32B/9B activos. ~70% menos de RAM en contexto largo. Apache 2.0.
ollama run granite4:small-h
MoE de 35B/3B activos para programación con agentes. 73.4% en SWE-Bench. Lanzamiento el 16 de abril de 2026.
ollama run qwen3.6:35b-a3b
MoE 30B/3B activos, razonamiento híbrido. MMLU 81.4, AIME24 80.4. Más de 100 idiomas.
ollama run qwen3:30b-a3b
MoE 30B/3B activos: modo thinking + instruct. Medalla de oro en IMO 2025 e IOI 2025. Inferencia rápida gracias a los 3B activos, capacidades de razonamiento de nivel 30B. Lanzamiento en abril de 2026.
ollama run nemotron-cascade-2
MoE de 30B (3,3B activos), especializado en programación agéntica. Muy rápido en local, contexto nativo de 256k, la referencia para 16-24 GB con Ollama.
ollama run qwen3-coder:30b
Visión MoE 30B/3B activos. Punto óptimo para visión en Qwen 3. 256k ctx.
ollama run qwen3-vl:30b
| Puesto | Modelo | Params | VRAM Q4 | Contexto | Licencia | En Apple M3 Max (64 GB) |
|---|---|---|---|---|---|---|
| #1 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #2 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 40 tok/s · Q8 |
| #3 | Granite 4.0 H-Small 32B-A9B | 32B | 19 GB | 128 000 | Apache 2.0 | 30 tok/s · Q8 |
| #4 | Qwen 3.6 35B-A3B | 35B | 21 GB | 262 000 | Apache 2.0 | 22 tok/s · Q8 |
| #5 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #6 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License | 30 tok/s · Q8 |
| #7 | Qwen3-Coder 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 40 tok/s · Q8 |
| #8 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 40 tok/s · Q8 |
La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.
Memo gratuito
Recibe el resumen VRAM → mejor modelo de código → comando Ollama (una sola pantalla, copiar y pegar). Y pasa al kit Copiloto Local para convertirlo en una configuración que realmente funcione.
El kit Copiloto Local — las configuraciones de Ollama + Cline + Aider listas para pegar, Modelfiles ajustados, solución de problemas, espacio en línea de por vida →Sin spam. Darte de baja en 1 clic. Tus datos se quedan con nosotros (nunca se venden).
Tu tarjeta → el mejor modelo para programar que puedes ejecutar en local, y el comando exacto de Ollama:
| Tu VRAM | GPU / Mac típicos | Modelo recomendado para programar | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) o Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — especialista en agentes de programación | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — el « casi Copilot » | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE rápido | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — sigue siendo la referencia en este caso concreto. ⚠️ Qwen 3.8: su nivel de razonamiento está configurado muy alto por defecto y «piensa demasiado» ante solicitudes simples — bájalo a low (o desactívalo) en el primer arranque. ⚠️ La trampa de la licencia: Codestral 22B = Mistral Non-Production License → prohibido para programar en el trabajo. Qwen 3.5/3.8, Gemma 4 y Devstral tienen licencia Apache 2.0. 💡 ¿Se cuelga por falta de memoria? Deja ~1,5 GB de VRAM libre para el contexto, o baja un nivel de cuantización.🔌 Para integrarlo en VS Code: Cline (agente que trabaja con varios archivos), Aider (CLI) o Tabby/Twinny (autocompletado FIM) — todos se conectan a Ollama en local. El kit Copiloto Local — configuraciones listas para pegar + configuración probada — está disponible: /copilote-local.
Filtro: modelos de 13-150B que caben en menos de 72 GB en Q4_K_M (deja 24 GB para macOS + contexto largo). Extra para 30-100B (pico de 96 GB) y MoE (hasta 150B accesibles).
Criterios considerados:
La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.
Mac de 96 GB: ¿Llama 70B Q5 o Mistral Large 123B Q4?
Llama 70B Q5_K_M (~48 GB) + contexto 32k = ~58 GB consumidos, 38 GB libres. Mistral Large 123B Q4_K_M (~68 GB) cabe justo, 28 GB libres. Llama 70B Q5 ofrece más comodidad, Mistral Large es más capaz. Depende del uso.
MacBook Pro M3 Max de 96 GB en 2026: ¿sigue siendo una opción pertinente?
Sí — es el punto óptimo precio/rendimiento para portátil de oficina. ~3500 € de segunda mano, ancho de banda 400 GB/s, Llama 70B fluido. El M4 Max 128 GB es ~25 % más rápido pero 2 veces más caro. Ver MBP M3.
¿Contexto de 100k+ en un Mac con 96 GB?
Sí: Qwen 3 32B Q5 (~22 GB) + caché KV de 100k (~25 GB) = ~47 GB, con un amplio margen. Para Llama 70B + 100k de contexto (~16 GB de caché KV), solo cabe Q4_K_M (~40 GB): en total, ~56 GB, todavía con un margen cómodo.
96 GB frente a 128 GB: ¿qué salto supone?
128 GB desbloquea MoE 130-150B (Granite 4 Mamba) en Q6 y Llama 70B Q8 (~75 GB). 96 GB se mantiene limitado a Q5/Q6 en 70B. Para la estación de trabajo absoluta, 128 GB o Studio Ultra. Vea Mac 128 GB.