Qué LLM en MacBook Pro M3 Pro / Max (18–128 GB) ?
El MacBook Pro M3 Pro / Max (finales de 2023) es en 2026 la opción ideal entre los portátiles para ejecutar LLM en local. El M3 Max de 16 núcleos ofrece 400 GB/s de ancho de banda y hasta 128 GB de memoria unificada, suficiente para ejecutar todo el catálogo de modelos de pesos abiertos de 2026 con plena precisión: Qwen 3.6 35B-A3B en Q8, Qwen 3.8 27B en su versión densa o varios modelos cargados en paralelo con contextos de 128k o más. Atención: el M3 Pro ha sufrido una reducción del ancho de banda de memoria (150 GB/s, frente a 200 para el M2 Pro). Esta guía aclara lo que permite realmente cada variante.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: MacBook Pro M5 Pro — 24 GB / 1 TB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene un beneficio de las compras que cumplen los requisitos.
#MBP M3 Pro / Max en 2026
- Fecha de lanzamiento
- Octubre-noviembre de 2023. Sigue siendo compatible con macOS Sequoia y versiones posteriores.
- M3 Pro
- 11 o 12 núcleos de CPU + 14 o 18 núcleos de GPU, 150 GB/s (reducción respecto al M2 Pro), RAM de 18 o 36 GB
- M3 Max 14-core
- 14 núcleos CPU + 30 núcleos GPU, 300 GB/s, RAM de 36 o 96 GB.
- M3 Max 16-core
- 16 núcleos de CPU + 40 núcleos de GPU, 400 GB/s, RAM de 48, 64 o 128 GB.
#1. M3 Pro vs M3 Max (cuidado con la trampa)
- M3 Pro 150 GB/s
- Correcto para 9B-12B (~30 tok/s) pero se agota en 24B+ densos (~12 tok/s). Evítalo si buscas 24B+ densos.
- M3 Max de 14 núcleos, 300 GB/s
- El buen equilibrio: Qwen 3.6 35B-A3B (MoE) a 35-38 tok/s, Qwen 3.8 27B denso a 15-17 tok/s. RAM máxima 96 GB.
- M3 Max 16 núcleos 400 GB/s
- La gama alta. +30 % de velocidad en modelos grandes, permite disponer de 128 GB de RAM para la precisión completa Q8 y varios modelos en paralelo.
#2. 18 a 128 GB: qué LLM
| Modelo | Quant | M3 Pro 18 | M3 Pro 36 | M3 Max 64 | M3 Max 96 | M3 Max 128 |
|---|---|---|---|---|---|---|
| Qwen 3.5 9B | Q5_K_M | ✓ 30 | ✓ 32 | ✓ 46 | ✓ 48 | ✓ 50 |
| Gemma 4 12B | Q5_K_M | ✓ 14 | ✓ 16 | ✓ 26 | ✓ 28 | ✓ 30 |
| Mistral Small 24B | Q5_K_M | — | ✓ 10 | ✓ 17 | ✓ 19 | ✓ 20 |
| Qwen 3.8 27B | Q5_K_M | — | — | ✓ 15 | ✓ 16 | ✓ 17 |
| Qwen 3.6 35B-A3B | Q5_K_M | — | — | ✓ 38 | ✓ 40 | ✓ 42 |
| Qwen 3.6 35B-A3B | Q8_0 | — | — | ✓ 32 | ✓ 34 | ✓ 36 |
| Qwen3-Coder 30B-A3B | Q8_0 | — | — | ✓ 33 | ✓ 35 | ✓ 37 |
| GLM 4.7 Flash | Q4_K_M | — | — | ✓ 44 | ✓ 46 | ✓ 48 |
#3. Pruebas de rendimiento en tokens/s
| Modelo | Q4_K_M | Q5_K_M | Flash Attn 8k |
|---|---|---|---|
| Qwen 3.5 9B | 54 t/s | 50 t/s | 48 t/s |
| Gemma 4 12B | 34 t/s | 30 t/s | 29 t/s |
| Mistral Small 24B | 22 t/s | 20 t/s | 19 t/s |
| Qwen 3.8 27B | 19 t/s | 17 t/s | 16 t/s |
| Qwen 3.6 35B-A3B | 46 t/s | 42 t/s | 40 t/s |
#4. Instalación y configuración
#5. Grandes modelos en precisión completa con Flash Attention
Flash Attention, durante mucho tiempo reservado para CUDA, está disponible en Metal desde finales de 2024 a través de llama.cpp y Ollama. Una mejora considerable con contextos largos, indispensable para llevar un Qwen 3.6 35B-A3B a un contexto de 128k.
La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
#6. El M3 Max de 128 GB: al nivel de una estación de trabajo
- Qwen 3.6 35B-A3B Q8
- Precisión completa, calidad máxima. ~36 tok/s (MoE, 3B activos). La versión de 128 GB permite Q8 sin comprometer el contexto.
- Qwen 3.8 27B Q8
- El mayor modelo generalista denso en precisión completa (~29 GB). ~15 tok/s. El modelo «cercano a Copilot» de 2026, con visión incluida.
- 2 modelos de 30B en paralelo
- Un Qwen 3.6 35B-A3B + un Qwen3-Coder 30B-A3B cargados simultáneamente. ~42 GB en total. Para agentes multiespecialistas.
- Contexto 128k+ en 35B
- Con una caché KV Q8, Qwen 3.6 35B-A3B + contexto de 128k cabe en ~50 GB. Análisis serio de documentos largos.
#M3 Max vs M4 Max
- Ancho de banda
- M3 Max de 16 núcleos = 400 GB/s. M4 Max de 16 núcleos = 546 GB/s (+36 %).
- Velocidad Qwen 3.6 35B-A3B
- M3 Max ~40 tok/s, M4 Max ~54 tok/s. +35 % en uso real.
- RAM máxima
- Idéntico: 128 GB en las dos configuraciones de gama más alta.
- Veredicto
- M4 Max si lo compras nuevo. Un M3 Max de segunda mano con un precio un 25 % menor también es una excelente oferta.
#Preguntas frecuentes
¿El M3 Pro es realmente más lento que el M2 Pro para los LLM?+
¿Qué MBP M3 para ejecutar modelos grandes en 2026?+
¿Qué diferencia hay en la práctica entre el M3 Max de 14 núcleos y el de 16 núcleos?+
128 GB de RAM, ¿son realmente útiles en 2026?+
¿Flash Attention cambia realmente algo en M3 Max?+
¿Autonomía de la batería durante una conversación con un modelo grande?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.