Intermedio 11 minMacBook Pro

¿Qué LLM en MacBook Pro M1 Pro / Max (16–64 GB)? ?

Lanzado a finales de 2021, el MacBook Pro M1 Pro / Max sigue siendo en 2026 una máquina destacada para la IA local, especialmente en la versión Max de 64 GB. Ancho de banda de 200 a 400 GB/s, ventiladores activos (sin throttling), hasta 64 GB de memoria unificada: un MoE Qwen 3.6 35B funciona a ~34 tokens/segundo y un modelo de 30B cabe en Q8 con plena calidad, algo imposible en un portátil de consumo equivalente. Esta guía detalla cómo aprovechar esta máquina hoy.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en macOS 14+
Hardware recomendado

Alternativa de compra para esta guía: MacBook Pro M5 Pro — 24 GB / 1 TB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#MBP M1 Pro / Max en 2026

Fecha de lanzamiento
Octubre de 2021. Sigue siendo compatible con macOS Sequoia (15) en 2026.
M1 Pro
8 o 10 núcleos de CPU + 14 o 16 núcleos de GPU, ancho de banda 200 GB/s, RAM 16 o 32 GB.
M1 Max
10 núcleos de CPU + 24 o 32 núcleos de GPU, ancho de banda de 400 GB/s, RAM de 32 o 64 GB.
Refrigeración
Ventiladores activos: sin reducción del rendimiento por temperatura al usar LLM. Puede funcionar durante 24 horas seguidas.
Valor de segunda mano en 2026
MBP M1 Pro y M1 Max: de segunda mano, precio variable según estado
→
¿Por qué es una buena compra en 2026?
Un MBP M1 Max de 64 GB de segunda mano (precio variable) ejecuta los mejores modelos MoE de 2026 (Qwen 3.6 35B, Qwen3-Coder 30B) en Q8 con plena calidad. Para la misma capacidad LLM en un PC, hacen falta 2 × RTX 3090 (de segunda mano, precio variable) + una CPU, una placa base y una fuente de alimentación compatibles (~800 €), lo que supone un coste total considerable y un equipo ruidoso y de alto consumo energético.

#1. M1 Pro vs M1 Max: elegir

M1 Pro (200 GB/s)
Excelente para modelos de 8 a 12B. Un MoE de 30-35B (Qwen 3.6 35B-A3B) cabe en la versión de 32 GB, pero no en 16 GB.
M1 Max (400 GB/s)
2× el ancho de banda = 2× la velocidad de inferencia en modelos ≥ 13B. Imprescindible para ejecutar un 30B en Q8 con calidad plena.
Núcleos GPU
El M1 Max de 32 núcleos es un 15-20 % más rápido que el de 24 núcleos con modelos de 8B. La diferencia se amplía con los modelos de 27-35B.

#2. 16, 32, 64 GB: qué modelos

Modelos recomendados por configuración para MBP M1
ModeloQuantRAM del modeloM1 Pro 16 GBM1 Pro 32 GBM1 Max 64 GB
Qwen 3.5 9BQ5_K_M7 GB283143
Granite 4.2 8BQ5_K_M6 GB303447
Gemma 4 12BQ5_K_M9 GB182130
Qwen 3.8 27BQ4_K_M18 GB—1118
Mistral Small 24BQ5_K_M16 GB—1018
Qwen 3.6 35B-A3B (MoE)Q4_K_M23 GB—2234
Qwen3-Coder 30B-A3BQ8_032 GB——24

#3. Pruebas de rendimiento en tokens/s

MBP M1 Max con GPU de 32 núcleos, 64 GB, Ollama, conectado a la corriente — órdenes de magnitud
ModeloQ4_K_MQ5_K_MQ8_0
Qwen 3.5 9B46 t/s43 t/s28 t/s
Granite 4.2 8B50 t/s47 t/s30 t/s
Gemma 4 12B32 t/s30 t/s19 t/s
Qwen 3.8 27B18 t/s16 t/s10 t/s
Qwen 3.6 35B-A3B34 t/s—22 t/s

#4. Instalación y configuración

Terminal — configuración completa
# Homebrew
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

# Ollama + démarrage auto
brew install --cask ollama
brew services start ollama

# Modèles conseillés
ollama run qwen3.5:9b        # M1 Pro 16 Go
ollama run qwen3.8:27b       # M1 Pro 32 Go
ollama run qwen3.6:35b       # M1 Max 64 Go (MoE 35B)

#5. Identificar el límite de memoria del GPU

En un MBP M1 Max de 64 GB, macOS asigna por defecto ~43 GB a la GPU. Para cargar un modelo de 30-35B en Q8 (~35 GB) con un contexto ampliado —la caché KV de un contexto de 256k puede superar por sí sola los 10 GB—, el conjunto supera rápidamente los 43 GB y es necesario aumentar el límite.

El kit Mac

Tu MacBook Pro M1 puede ejecutar más de lo que crees. El kit Mac muestra cómo ampliar el límite de memoria de la GPU (cap. 2), elegir el modelo adecuado para tu chip (cap. 4) y solucionar lo que falla: Metal, memoria, swap (cap. 14).

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j
Aumentar la memoria GPU asignable
# Vérifier la valeur actuelle
sysctl iogpu.wired_limit_mb

# Relever à 56 Go (64 Go - 8 Go système)
sudo sysctl iogpu.wired_limit_mb=57344

# Rendre permanent
echo "iogpu.wired_limit_mb=57344" | sudo tee -a /etc/sysctl.conf
!
Deja ≥ 8 GB para macOS
Por debajo de ese margen, el sistema recurre a la memoria de intercambio y la inferencia se ralentiza drásticamente. 8 GB es el margen mínimo en un MBP de 64 GB; quédate en 6 GB únicamente si cierras todas las apps Electron y no utilizas ningún navegador.

#6. Ejecutar un modelo grande de 2026 en M1 Max

El MBP M1 Max de 64 GB ejecuta los modelos más grandes de 2026 con toda su calidad: un MoE de 30-35B en Q8, o varios modelos cargados en paralelo. Esta es la configuración óptima:

MoE Qwen 3.6 35B en M1 Max 64 GB
# Augmenter la RAM GPU (fait une seule fois)
sudo sysctl iogpu.wired_limit_mb=57344

# Activer flash attention + KV cache quantifié
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
brew services restart ollama

# Lancer le modèle
ollama run qwen3.6:35b
# Comptez ~34 tokens/seconde (MoE, 3B actifs) — contexte étendu confortable
i
Autonomía de la batería con modelos grandes
Aproximadamente 1 h 30 min de autonomía en chat continuo con un MoE de 35B (consumo ~40 W). Para sesiones largas, enchufa el equipo: el MBP M1 Max limita considerablemente la GPU cuando la batería está baja.

#¿Cambiar a M3 Max o M4 Max?

M3 Max 16-core (2023)
Un 50 % más de velocidad pura frente al M1 Max. Hasta 128 GB de RAM (frente a 64 GB). Justifica la actualización si quieres que un MoE de 30-35B supere los 50 tok/s.
M4 Max 16-core (2024)
+90 % frente al M1 Max, ancho de banda de 546 GB/s. 128 GB de RAM. El mejor portátil Mac para LLM en 2026.
Seguir con el M1 Max de 64 GB
Completamente viable: MoE 35B a ~34 tok/s, 27B denso a 18 tok/s. No hay razón para actualizar antes de 2027 si la velocidad actual te satisface.

#Preguntas frecuentes

¿MBP M1 Pro 16 GB o M1 Max 32 GB para IA local?+
El M1 Max de 32 GB ofrece una mejora real: el doble de ancho de banda (400 frente a 200 GB/s) = el doble de velocidad en modelos de 13B o más, y 20 GB utilizables adicionales. En cambio, para ejecutar únicamente modelos de 8-9B, el M1 Pro de 16 GB es más que suficiente.
¿Se puede ejecutar un modelo grande en un MBP M1 Max de 32 GB?+
Sí: un modelo MoE de 30-35B en Q4 (~23 GB, como Qwen 3.6 35B-A3B) cabe en 32 GB y se ejecuta rápidamente gracias a sus 3B de parámetros activos. En cambio, un modelo de 30B en Q8 (~32 GB) o un modelo denso ≥ 27B en Q8 saturan los 32 GB: en ese caso, pasa a 64 GB.
¿El MBP M1 Pro es mejor que un PC con RTX 3060 para los LLM?+
Para Qwen 3.5 9B Q4: velocidad comparable (30-45 tok/s). Ventaja Mac: 16 GB disponibles vs 12 GB de VRAM, silencio, sin drivers. Ventaja PC: ecosistema CUDA, fine-tuning más sencillo.
¿Los ventiladores giran a altas revoluciones durante la inferencia de un LLM?+
El ruido es audible al usar un modelo grande en un chat continuo (RPM ~4000, equivalente a un MacBook Pro Intel 2019 durante una compilación). Es discreto con modelos de 8-12B (RPM ~2500). Mucho menos ruidoso que un portátil PC para juegos con la misma carga de GPU.
¿Conviene elegir la pantalla de 16" o la de 14" para los LLM?+
Ningún impacto en el rendimiento. El modelo de 16" tiene una mejor disipación térmica (chasis más grande), por lo que mantiene la carga un poco más de tiempo. 14" si prima la portabilidad; 16" si priman las sesiones largas.
¿Ollama o MLX en un MBP M1 Max?+
Ollama sigue siendo la base para el 95 % de los usos (simple, robusto, API OpenAI). MLX es interesante para hacer un ajuste fino de un modelo de 8-9B en local o para modelos nativos de MLX que aprovechan el M1 Max. Ambos coexisten sin conflicto.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.