Intermedio 12 minMacBook Pro

Qué LLM en MacBook Pro M3 Pro / Max (18–128 GB) ?

El MacBook Pro M3 Pro / Max (finales de 2023) es en 2026 la opción ideal entre los portátiles para ejecutar LLM en local. El M3 Max de 16 núcleos ofrece 400 GB/s de ancho de banda y hasta 128 GB de memoria unificada, suficiente para ejecutar todo el catálogo de modelos de pesos abiertos de 2026 con plena precisión: Qwen 3.6 35B-A3B en Q8, Qwen 3.8 27B en su versión densa o varios modelos cargados en paralelo con contextos de 128k o más. Atención: el M3 Pro ha sufrido una reducción del ancho de banda de memoria (150 GB/s, frente a 200 para el M2 Pro). Esta guía aclara lo que permite realmente cada variante.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en macOS 14+
Hardware recomendado

Alternativa de compra para esta guía: MacBook Pro M5 Pro — 24 GB / 1 TB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene un beneficio de las compras que cumplen los requisitos.

#MBP M3 Pro / Max en 2026

Fecha de lanzamiento
Octubre-noviembre de 2023. Sigue siendo compatible con macOS Sequoia y versiones posteriores.
M3 Pro
11 o 12 núcleos de CPU + 14 o 18 núcleos de GPU, 150 GB/s (reducción respecto al M2 Pro), RAM de 18 o 36 GB
M3 Max 14-core
14 núcleos CPU + 30 núcleos GPU, 300 GB/s, RAM de 36 o 96 GB.
M3 Max 16-core
16 núcleos de CPU + 40 núcleos de GPU, 400 GB/s, RAM de 48, 64 o 128 GB.
!
La trampa del M3 Pro
Apple ha reducido el ancho de banda de memoria del M3 Pro (150 GB/s frente a 200 para el M2 Pro). Resultado: el M3 Pro es más lento que el M2 Pro con LLM. Si buscas un M3, ve directamente a por el M3 Max o conserva un M2 Pro de segunda mano.

#1. M3 Pro vs M3 Max (cuidado con la trampa)

M3 Pro 150 GB/s
Correcto para 9B-12B (~30 tok/s) pero se agota en 24B+ densos (~12 tok/s). Evítalo si buscas 24B+ densos.
M3 Max de 14 núcleos, 300 GB/s
El buen equilibrio: Qwen 3.6 35B-A3B (MoE) a 35-38 tok/s, Qwen 3.8 27B denso a 15-17 tok/s. RAM máxima 96 GB.
M3 Max 16 núcleos 400 GB/s
La gama alta. +30 % de velocidad en modelos grandes, permite disponer de 128 GB de RAM para la precisión completa Q8 y varios modelos en paralelo.

#2. 18 a 128 GB: qué LLM

Modelos compatibles por configuración en MBP M3
ModeloQuantM3 Pro 18M3 Pro 36M3 Max 64M3 Max 96M3 Max 128
Qwen 3.5 9BQ5_K_M✓ 30✓ 32✓ 46✓ 48✓ 50
Gemma 4 12BQ5_K_M✓ 14✓ 16✓ 26✓ 28✓ 30
Mistral Small 24BQ5_K_M—✓ 10✓ 17✓ 19✓ 20
Qwen 3.8 27BQ5_K_M——✓ 15✓ 16✓ 17
Qwen 3.6 35B-A3BQ5_K_M——✓ 38✓ 40✓ 42
Qwen 3.6 35B-A3BQ8_0——✓ 32✓ 34✓ 36
Qwen3-Coder 30B-A3BQ8_0——✓ 33✓ 35✓ 37
GLM 4.7 FlashQ4_K_M——✓ 44✓ 46✓ 48

#3. Pruebas de rendimiento en tokens/s

Órdenes de magnitud — MBP M3 Max, GPU de 16 núcleos, 128 GB, Ollama, conectado a la corriente
ModeloQ4_K_MQ5_K_MFlash Attn 8k
Qwen 3.5 9B54 t/s50 t/s48 t/s
Gemma 4 12B34 t/s30 t/s29 t/s
Mistral Small 24B22 t/s20 t/s19 t/s
Qwen 3.8 27B19 t/s17 t/s16 t/s
Qwen 3.6 35B-A3B46 t/s42 t/s40 t/s

#4. Instalación y configuración

Configuración completa MBP M3 Max 128 GB
brew install --cask ollama

# Relever la mémoire GPU (128 Go → 116 Go GPU)
sudo sysctl iogpu.wired_limit_mb=118784
echo "iogpu.wired_limit_mb=118784" | sudo tee -a /etc/sysctl.conf

# Flash Attention + KV cache Q8
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0

brew services restart ollama
ollama pull qwen3.6:35b

#5. Grandes modelos en precisión completa con Flash Attention

Flash Attention, durante mucho tiempo reservado para CUDA, está disponible en Metal desde finales de 2024 a través de llama.cpp y Ollama. Una mejora considerable con contextos largos, indispensable para llevar un Qwen 3.6 35B-A3B a un contexto de 128k.

El kit Mac

La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida
llama.cpp compilado localmente — Qwen 3.6 35B contexto 16k
./build/bin/llama-cli \
  -m ./models/qwen3.6-35b-a3b-q5_K_M.gguf \
  -ngl 99 -fa \
  -ctk q8_0 -ctv q8_0 \
  -c 16384 \
  --temp 0.7
→
Mejoras medidas con Flash Attention en M3 Max
Contexto de 4k: +8 %. Contexto de 8k: +15 %. Contexto de 16k: +25 %. Cuanto más contexto tengas, más evidente será la mejora. Activar siempre en M3 Max.

#6. El M3 Max de 128 GB: al nivel de una estación de trabajo

Qwen 3.6 35B-A3B Q8
Precisión completa, calidad máxima. ~36 tok/s (MoE, 3B activos). La versión de 128 GB permite Q8 sin comprometer el contexto.
Qwen 3.8 27B Q8
El mayor modelo generalista denso en precisión completa (~29 GB). ~15 tok/s. El modelo «cercano a Copilot» de 2026, con visión incluida.
2 modelos de 30B en paralelo
Un Qwen 3.6 35B-A3B + un Qwen3-Coder 30B-A3B cargados simultáneamente. ~42 GB en total. Para agentes multiespecialistas.
Contexto 128k+ en 35B
Con una caché KV Q8, Qwen 3.6 35B-A3B + contexto de 128k cabe en ~50 GB. Análisis serio de documentos largos.

#M3 Max vs M4 Max

Ancho de banda
M3 Max de 16 núcleos = 400 GB/s. M4 Max de 16 núcleos = 546 GB/s (+36 %).
Velocidad Qwen 3.6 35B-A3B
M3 Max ~40 tok/s, M4 Max ~54 tok/s. +35 % en uso real.
RAM máxima
Idéntico: 128 GB en las dos configuraciones de gama más alta.
Veredicto
M4 Max si lo compras nuevo. Un M3 Max de segunda mano con un precio un 25 % menor también es una excelente oferta.

#Preguntas frecuentes

¿El M3 Pro es realmente más lento que el M2 Pro para los LLM?+
Sí, para modelos densos de 24B+, debido al ancho de banda (150 GB/s vs 200). En Qwen 3.5 9B, la diferencia es pequeña (~5 %). En Mistral Small 24B, el M2 Pro es un 10-15 % más rápido. Consejo: si compras de segunda mano y buscas un modelo de 24B+ denso, opta por M2 Pro o salta directamente a M3 Max.
¿Qué MBP M3 para ejecutar modelos grandes en 2026?+
M3 Max de 14 núcleos y 64 GB para un Qwen 3.6 35B-A3B en Q8 (~35 tok/s, MoE), M3 Max de 16 núcleos y 96-128 GB para cargar varios modelos o aumentar el contexto a 128k. El M3 Pro de 36 GB se limita al modelo denso de 24B.
¿Qué diferencia hay en la práctica entre el M3 Max de 14 núcleos y el de 16 núcleos?+
+30 % de ancho de banda (300 vs 400 GB/s), +33 % de núcleos GPU, opción de 128 GB de RAM. En un modelo MoE grande de 35B: +40 % de velocidad. En uno de 9B: solo +8 %. Si buscas modelos grandes, el de 16 núcleos es una verdadera inversión.
128 GB de RAM, ¿son realmente útiles en 2026?+
Sí si lo deseas: Qwen 3.6 35B-A3B en Q8 (precisión completa, mejor calidad que un Q4), dos modelos de 30B en paralelo, o un contexto de 128k. Para uso estándar, 64 GB es más que suficiente.
¿Flash Attention cambia realmente algo en M3 Max?+
Sí, entre un 15 y un 25 % más de velocidad en contextos de 8k-16k, sin pérdida de calidad. Activar por defecto mediante OLLAMA_FLASH_ATTENTION=1.
¿Autonomía de la batería durante una conversación con un modelo grande?+
Aproximadamente 1 h 40 min de chat continuo en el modelo de 16 pulgadas con M3 Max (consumo de unos 50 W). Cómodo para una sesión fuera de casa. Para el procesamiento por lotes con un modelo grande, calcula un máximo de 1 h; es preferible conectarlo a la red eléctrica.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.