¿Qué LLM en MacBook Pro M4 Pro / Max (24–128 GB)? ?
Un MacBook Pro M4 Pro o Max ejecuta modelos de 14B a 32B sin dificultad y, con un M4 Max de 64 o 128 GB, un 70B en Q4 (aproximadamente 40 GB). El ancho de banda (273, 410 o 546 GB/s según el chip) limita un 70B a aproximadamente 13 a 14 tokens por segundo; la memoria, de 24 a 128 GB, determina el tamaño del modelo.
El MacBook Pro M4 es el portátil más adecuado para modelos locales grandes, siempre que se elijan bien el chip y la memoria. Esta página muestra qué configuración corresponde a qué tamaño de modelo, calcula la velocidad máxima teórica y compara la máquina con una GPU NVIDIA, un Mac Studio o un Air.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: MacBook Pro M5 Pro — 24 GB / 1 TB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#MacBook Pro M4 Pro y M4 Max: qué configuraciones, qué ancho de banda
En un MacBook Pro M4, el chip determina dos cosas: el ancho de banda, que determina la velocidad máxima de generación, y la memoria máxima, que determina el tamaño del modelo. Según la ficha técnica de Apple, el M4 Pro ofrece 273 GB/s, el M4 Max con 14 núcleos de CPU y 32 núcleos de GPU ofrece 410 GB/s, y el M4 Max con 16 núcleos de CPU y 40 núcleos de GPU ofrece 546 GB/s. La memoria va de 24 GB a 128 GB según el chip. No son opciones intercambiables: cada chip permite acceder a su propia clase de modelos.
| Chip | Ancho de banda | Memoria ofrecida | Clase de modelo realista (Q4) |
|---|---|---|---|
| M4 Pro | 273 GB/s | 24 o 48 GB | Hasta 14B con holgura, 24-27B con 48 GB |
| M4 Max 14 núcleos CPU, 32 núcleos GPU | 410 GB/s | 36 GB | 24-27B cómodo, 32B con contexto corto |
| M4 Max 16 núcleos CPU, 40 núcleos GPU | 546 GB/s | 48, 64 o 128 GB | 32B con comodidad; 70B desde 64 GB; arquitecturas MoE de más de 100B con 128 GB |
Apple especifica que el M4 Max admite hasta 128 GB de memoria unificada y que esto permite a los desarrolladores interactuar con modelos de lenguaje de cerca de 200 mil millones de parámetros. Apple no especifica ni la cuantización ni el contexto de esta cifra: no la interpretes como una promesa para un modelo denso en Q4, ya que un 70B denso ya ocupa aproximadamente 40 GB según las referencias del sitio.
La ficha describe el MacBook Pro de 14 pulgadas; el de 16 pulgadas utiliza los mismos chips. A los chips M4 les ha sucedido una generación M5: los equipos nuevos de la generación descrita aquí ya no están siempre disponibles, y el mercado de segunda mano determina su precio. Esta página no cita ningún precio; la página /materiel-ia/macbook-pro-m4-max ofrece referencias actualizadas.
#Pro, Max de 14 núcleos o Max de 16 núcleos: cómo elegir
La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
- 01Establece primero el tamaño del modelo que quieres usarUn modelo de 8 a 14 mil millones de parámetros se ejecuta en un M4 Pro de 24 GB. Un modelo de 24 a 32B requiere entre 36 y 48 GB. Un modelo de 70B requiere al menos 64 GB, con un contexto corto.
- 02Agrega el contexto y un margen del 25 al 30 %El caché KV crece con la longitud del contexto, y macOS reserva una parte de la memoria para sí mismo. Multiplica el peso del modelo por aproximadamente 1,3 para una estimación prudente.
- 03Comprueba el ancho de banda en relación con la velocidad deseadaDivide el ancho de banda por el tamaño del modelo: esa es la velocidad máxima teórica. Si es demasiado baja para el uso previsto, elige un chip superior en lugar de aumentar la memoria.
- 04Decide entre un chip Max de 14 o 16 núcleosEl modelo de 16 núcleos ofrece 546 GB/s frente a 410 GB/s, y sobre todo el acceso a 48, 64 y 128 GB: la memoria, tanto como la velocidad, justifica la diferencia.
Este procedimiento explica por qué el M4 Pro de 48 GB y el M4 Max de 14 núcleos de 36 GB no son comparables: el primero ofrece más memoria, el segundo más ancho de banda. Para un uso donde el modelo es pequeño y las respuestas deben ser rápidas, el Max de 14 núcleos gana. Para cargar un modelo más grande, gana el Pro de 48 GB, aunque genere más lentamente.
#Lo que permite el ancho de banda: límites teóricos
Para generar cada token, se vuelven a leer los pesos activos. La velocidad máxima es, por tanto, el ancho de banda dividido por el tamaño de los pesos en gigabytes, tomando como referencia las cifras del sitio: 14B, unos 9 GB; 32B, unos 19 a 20 GB; 70B, unos 40 GB en Q4. La tabla aplica esta fórmula a los tres chips. Son límites máximos calculados, nunca mediciones: la velocidad real depende del motor, del contexto y de la carga térmica.
| Modelo denso | Tamaño del modelo | M4 Pro (273 GB/s) | M4 Max de 14 núcleos (410 GB/s) | M4 Max de 16 núcleos (546 GB/s) |
|---|---|---|---|---|
| 14B | ≈ 9 GB | ≈ 30 tok/s | ≈ 45 tok/s | ≈ 60 tok/s |
| 32B | ≈ 19 a 20 GB | ≈ 14 tok/s | ≈ 21 tok/s | ≈ 28 tok/s |
| 70B | ≈ 40 GB | fuera de alcance (memoria) | fuera de alcance (memoria) | ≈ 13 a 14 tok/s |
Los modelos de mezcla de expertos (MoE) quedan fuera de esta tabla: un 30B con 3B activos ocupa aproximadamente 19 GB en memoria, pero solo vuelve a leer unos pocos gigabytes de pesos por token, por lo que su límite teórico es varias veces superior al de un 32B denso de igual tamaño. Es la opción más ventajosa para un MacBook Pro con 48 GB o más. Las tasas de generación reales se pueden consultar en /benchmarks o en los benchmarks publicados por terceros, comprobando el chip, la cuantización y el motor.
#MLX, Ollama, LM Studio: ¿qué motor elegir en esta máquina?
Ollama cubre lo esencial: instalación en un clic, API local, detección automática de la GPU. MLX, el framework de Apple, aprovecha la memoria compartida del Mac sin copias entre CPU y GPU; su paquete mlx-lm permite generar texto y realizar ajustes finos de modelos en Apple silicon, con soporte para modelos cuantizados. LM Studio ofrece una interfaz gráfica y modelos MLX. La guía comparativa de MLX frente a llama.cpp determina cuál ofrece mejor rendimiento; no es necesario repetir sus conclusiones aquí.
- 01Instalar OllamaDescárgalo en ollama.com o con Homebrew. El arranque automático se describe en la guía de instalación para macOS.
- 02Iniciar el modelo seleccionadoLa orden ollama run t descarga y ejecuta el modelo. Verifica luego el GPU con ollama ps.
- 03Ajustar el caché KV y la atención flashOllama activa Flash Attention automáticamente cuando el hardware lo permite; la variable OLLAMA_KV_CACHE_TYPE cuantiza la caché KV, con f16 por defecto. Esta cuantización reduce la memoria que ocupan los contextos largos.
- 04Aumentar el límite de memoria de la GPU si es necesarioEl repositorio mlx-lm indica que un modelo que cabe en RAM a menudo se puede acelerar aumentando el límite de memoria no paginable del sistema. Es un ajuste del sistema que requiere permisos de administrador: sigue el procedimiento de la guía de optimización de macOS, sin copiar ningún valor encontrado en otro lugar.
#Contexto largo: el caso de uso en el que la memoria del Pro más importa
El contexto largo es el principal argumento a favor de los 64 y 128 GB. Ollama fija por defecto un contexto de 4 000 tokens con menos de 24 GiB de memoria, de 32 000 entre 24 y 48 GiB, y de 256 000 a partir de 48 GiB; su documentación recomienda al menos 64 000 tokens para la búsqueda web, los agentes y las herramientas de código. Un contexto de 64 000 tokens en un modelo de 32B requiere gigabytes de caché KV, además de los 19 a 20 GB de pesos: con 48 GB, el margen se agota rápido. Una máquina de 64 GB o 128 GB deja espacio para este contexto sin obligar a cuantizar la caché.
#MacBook Pro M4 frente a una GPU NVIDIA, un Mac Studio o un Air
La comparación útil se centra en la memoria antes que en la velocidad. Una RTX 4090 incluye 24 GB de GDDR6X, según NVIDIA: con modelos de más de 24 a 30 mil millones de parámetros, debe transferir parte del modelo a la RAM del sistema, y la velocidad cae. Un MacBook Pro M4 Max de 64 o 128 GB carga un modelo de 70B completo. La tarjeta sigue siendo superior cuando el modelo cabe en su memoria y la velocidad es la prioridad.
| Situación | Mejor opción | Razón |
|---|---|---|
| Modelo de 8 a 14B, movilidad, silencio | MacBook Air M4 de 16 o 24 GB | Suficiente, más ligero |
| Modelo de 24 a 32B, varios modelos abiertos | MacBook Pro M4 Pro 48 GB o Max | Memoria y ventilación activa |
| Modelo de 70B o contexto muy largo, cuando estás de viaje | MacBook Pro M4 Max 64 o 128 GB | Único portátil que carga un 70B completo |
| Misma carga, pero en la oficina | Mac Studio o Mac mini | Mismo chip, sistema de refrigeración más grande, sin batería |
| Modelo que cabe en 24 GB, velocidad máxima | GPU NVIDIA con 24 GB o más | Mayor ancho de banda cuando el modelo cabe en memoria |
#M4 o M5: ¿qué cambia en la siguiente generación?
Apple ha lanzado desde entonces MacBook Pro M5 Pro y M5 Max. Su ficha indica 307 GB/s para el M5 Pro, 460 GB/s para el M5 Max con 32 núcleos GPU y 614 GB/s para el M5 Max con 40 núcleos GPU, frente a 273, 410 y 546 GB/s para la generación M4. El ancho de banda aumenta aproximadamente entre un 12 y un 13 %, por lo que también suben los límites teóricos de velocidad. La decisión de compra se plantea sobre todo con la misma cantidad de memoria: un M4 Max de 128 GB de segunda mano permite ejecutar más modelos que un M5 Pro de 48 GB nuevo.
| Chip | M4 | M5 |
|---|---|---|
| Pro | 273 GB/s | 307 GB/s |
| Max, 32 núcleos de GPU | 410 GB/s | 460 GB/s |
| Max, 40 núcleos de GPU | 546 GB/s | 614 GB/s |
#Limitaciones que debes conocer
- Límite de memoria
- 128 GB como máximo. Para superar esa capacidad, se necesita un Mac Studio u otra plataforma.
- Sin CUDA
- Las bibliotecas que requieren CUDA no funcionan. MLX y llama.cpp cubren la inferencia, no todo el ecosistema de entrenamiento.
- Fine-tuning
- MLX permite fine-tuning de bajo rango y completo con modelos cuantizados. En modelos de más de unos pocos mil millones de parámetros, esto sigue siendo lento y genera calor: reserva los trabajos grandes para un servicio en la nube.
- Batería
- La inferencia continua agota rápidamente la batería: conecta el equipo a la corriente para las sesiones largas.
- MacBook Air M4: 32 GB y 120 GB/s
- Mac Studio: el mismo chip en un equipo de escritorio
- Mac mini M4 y M4 Pro
- Optimizar un Mac Apple Silicon
- Ficha de hardware: MacBook Pro M4 Max
- Fuente: ficha técnica de Apple del MacBook Pro M4 Pro y M4 Max
- Fuente: ficha técnica de Apple del MacBook Pro M5 Pro y M5 Max
- Fuente: Apple, anuncio de los chips M4 Pro y M4 Max
- Fuente: documentación de Ollama, contexto
- Fuente: repositorio mlx-lm
#Preguntas frecuentes
¿El MacBook Pro M4 Max es mejor que una RTX 4090 para LLM?+
M4 Pro 48 GB o M4 Max 36 GB: ¿cuál elegir?+
¿Se necesitan 64 o 128 GB de memoria en un M4 Max?+
¿Qué velocidad se puede esperar de un 70B en un MacBook Pro M4 Max?+
¿Se puede hacer fine-tuning de un modelo en un MacBook Pro M4?+
¿Ollama, LM Studio o MLX en un MacBook Pro M4?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.