Intermedio 11 minMacBook Pro

¿Qué LLM en MacBook Pro M4 Pro / Max (24–128 GB)? ?

Respuesta directa

Un MacBook Pro M4 Pro o Max ejecuta modelos de 14B a 32B sin dificultad y, con un M4 Max de 64 o 128 GB, un 70B en Q4 (aproximadamente 40 GB). El ancho de banda (273, 410 o 546 GB/s según el chip) limita un 70B a aproximadamente 13 a 14 tokens por segundo; la memoria, de 24 a 128 GB, determina el tamaño del modelo.

El MacBook Pro M4 es el portátil más adecuado para modelos locales grandes, siempre que se elijan bien el chip y la memoria. Esta página muestra qué configuración corresponde a qué tamaño de modelo, calcula la velocidad máxima teórica y compara la máquina con una GPU NVIDIA, un Mac Studio o un Air.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en macOS 14+
Hardware recomendado

Alternativa de compra para esta guía: MacBook Pro M5 Pro — 24 GB / 1 TB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#MacBook Pro M4 Pro y M4 Max: qué configuraciones, qué ancho de banda

En un MacBook Pro M4, el chip determina dos cosas: el ancho de banda, que determina la velocidad máxima de generación, y la memoria máxima, que determina el tamaño del modelo. Según la ficha técnica de Apple, el M4 Pro ofrece 273 GB/s, el M4 Max con 14 núcleos de CPU y 32 núcleos de GPU ofrece 410 GB/s, y el M4 Max con 16 núcleos de CPU y 40 núcleos de GPU ofrece 546 GB/s. La memoria va de 24 GB a 128 GB según el chip. No son opciones intercambiables: cada chip permite acceder a su propia clase de modelos.

Configuraciones del MacBook Pro M4 Pro y M4 Max, según Apple
ChipAncho de bandaMemoria ofrecidaClase de modelo realista (Q4)
M4 Pro273 GB/s24 o 48 GBHasta 14B con holgura, 24-27B con 48 GB
M4 Max 14 núcleos CPU, 32 núcleos GPU410 GB/s36 GB24-27B cómodo, 32B con contexto corto
M4 Max 16 núcleos CPU, 40 núcleos GPU546 GB/s48, 64 o 128 GB32B con comodidad; 70B desde 64 GB; arquitecturas MoE de más de 100B con 128 GB

Apple especifica que el M4 Max admite hasta 128 GB de memoria unificada y que esto permite a los desarrolladores interactuar con modelos de lenguaje de cerca de 200 mil millones de parámetros. Apple no especifica ni la cuantización ni el contexto de esta cifra: no la interpretes como una promesa para un modelo denso en Q4, ya que un 70B denso ya ocupa aproximadamente 40 GB según las referencias del sitio.

La ficha describe el MacBook Pro de 14 pulgadas; el de 16 pulgadas utiliza los mismos chips. A los chips M4 les ha sucedido una generación M5: los equipos nuevos de la generación descrita aquí ya no están siempre disponibles, y el mercado de segunda mano determina su precio. Esta página no cita ningún precio; la página /materiel-ia/macbook-pro-m4-max ofrece referencias actualizadas.

#Pro, Max de 14 núcleos o Max de 16 núcleos: cómo elegir

El kit Mac

La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j
  1. 01
    Establece primero el tamaño del modelo que quieres usar
    Un modelo de 8 a 14 mil millones de parámetros se ejecuta en un M4 Pro de 24 GB. Un modelo de 24 a 32B requiere entre 36 y 48 GB. Un modelo de 70B requiere al menos 64 GB, con un contexto corto.
  2. 02
    Agrega el contexto y un margen del 25 al 30 %
    El caché KV crece con la longitud del contexto, y macOS reserva una parte de la memoria para sí mismo. Multiplica el peso del modelo por aproximadamente 1,3 para una estimación prudente.
  3. 03
    Comprueba el ancho de banda en relación con la velocidad deseada
    Divide el ancho de banda por el tamaño del modelo: esa es la velocidad máxima teórica. Si es demasiado baja para el uso previsto, elige un chip superior en lugar de aumentar la memoria.
  4. 04
    Decide entre un chip Max de 14 o 16 núcleos
    El modelo de 16 núcleos ofrece 546 GB/s frente a 410 GB/s, y sobre todo el acceso a 48, 64 y 128 GB: la memoria, tanto como la velocidad, justifica la diferencia.

Este procedimiento explica por qué el M4 Pro de 48 GB y el M4 Max de 14 núcleos de 36 GB no son comparables: el primero ofrece más memoria, el segundo más ancho de banda. Para un uso donde el modelo es pequeño y las respuestas deben ser rápidas, el Max de 14 núcleos gana. Para cargar un modelo más grande, gana el Pro de 48 GB, aunque genere más lentamente.

#Lo que permite el ancho de banda: límites teóricos

Para generar cada token, se vuelven a leer los pesos activos. La velocidad máxima es, por tanto, el ancho de banda dividido por el tamaño de los pesos en gigabytes, tomando como referencia las cifras del sitio: 14B, unos 9 GB; 32B, unos 19 a 20 GB; 70B, unos 40 GB en Q4. La tabla aplica esta fórmula a los tres chips. Son límites máximos calculados, nunca mediciones: la velocidad real depende del motor, del contexto y de la carga térmica.

Límite teórico de generación (pesos en Q4): cálculo, no medición
Modelo densoTamaño del modeloM4 Pro (273 GB/s)M4 Max de 14 núcleos (410 GB/s)M4 Max de 16 núcleos (546 GB/s)
14B≈ 9 GB≈ 30 tok/s≈ 45 tok/s≈ 60 tok/s
32B≈ 19 a 20 GB≈ 14 tok/s≈ 21 tok/s≈ 28 tok/s
70B≈ 40 GBfuera de alcance (memoria)fuera de alcance (memoria)≈ 13 a 14 tok/s

Los modelos de mezcla de expertos (MoE) quedan fuera de esta tabla: un 30B con 3B activos ocupa aproximadamente 19 GB en memoria, pero solo vuelve a leer unos pocos gigabytes de pesos por token, por lo que su límite teórico es varias veces superior al de un 32B denso de igual tamaño. Es la opción más ventajosa para un MacBook Pro con 48 GB o más. Las tasas de generación reales se pueden consultar en /benchmarks o en los benchmarks publicados por terceros, comprobando el chip, la cuantización y el motor.

!
Desconfía de las velocidades de generación sin contexto
Una tasa anunciada superior a 30 tokens por segundo para un modelo denso de 32B en Q4 en un M4 Max de 546 GB/s supera el límite teórico de 28: no proviene de una generación clásica. Comprueba siempre qué modelo está activo, qué cuantización se usa y si un modelo borrador acelera la generación.

#MLX, Ollama, LM Studio: ¿qué motor elegir en esta máquina?

Ollama cubre lo esencial: instalación en un clic, API local, detección automática de la GPU. MLX, el framework de Apple, aprovecha la memoria compartida del Mac sin copias entre CPU y GPU; su paquete mlx-lm permite generar texto y realizar ajustes finos de modelos en Apple silicon, con soporte para modelos cuantizados. LM Studio ofrece una interfaz gráfica y modelos MLX. La guía comparativa de MLX frente a llama.cpp determina cuál ofrece mejor rendimiento; no es necesario repetir sus conclusiones aquí.

  1. 01
    Instalar Ollama
    Descárgalo en ollama.com o con Homebrew. El arranque automático se describe en la guía de instalación para macOS.
  2. 02
    Iniciar el modelo seleccionado
    La orden ollama run t descarga y ejecuta el modelo. Verifica luego el GPU con ollama ps.
  3. 03
    Ajustar el caché KV y la atención flash
    Ollama activa Flash Attention automáticamente cuando el hardware lo permite; la variable OLLAMA_KV_CACHE_TYPE cuantiza la caché KV, con f16 por defecto. Esta cuantización reduce la memoria que ocupan los contextos largos.
  4. 04
    Aumentar el límite de memoria de la GPU si es necesario
    El repositorio mlx-lm indica que un modelo que cabe en RAM a menudo se puede acelerar aumentando el límite de memoria no paginable del sistema. Es un ajuste del sistema que requiere permisos de administrador: sigue el procedimiento de la guía de optimización de macOS, sin copiar ningún valor encontrado en otro lugar.
Terminal
brew install --cask ollama
ollama run qwen3:32b
ollama ps

# Long contexte : cache KV quantifié
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0

#Contexto largo: el caso de uso en el que la memoria del Pro más importa

El contexto largo es el principal argumento a favor de los 64 y 128 GB. Ollama fija por defecto un contexto de 4 000 tokens con menos de 24 GiB de memoria, de 32 000 entre 24 y 48 GiB, y de 256 000 a partir de 48 GiB; su documentación recomienda al menos 64 000 tokens para la búsqueda web, los agentes y las herramientas de código. Un contexto de 64 000 tokens en un modelo de 32B requiere gigabytes de caché KV, además de los 19 a 20 GB de pesos: con 48 GB, el margen se agota rápido. Una máquina de 64 GB o 128 GB deja espacio para este contexto sin obligar a cuantizar la caché.

#MacBook Pro M4 frente a una GPU NVIDIA, un Mac Studio o un Air

La comparación útil se centra en la memoria antes que en la velocidad. Una RTX 4090 incluye 24 GB de GDDR6X, según NVIDIA: con modelos de más de 24 a 30 mil millones de parámetros, debe transferir parte del modelo a la RAM del sistema, y la velocidad cae. Un MacBook Pro M4 Max de 64 o 128 GB carga un modelo de 70B completo. La tarjeta sigue siendo superior cuando el modelo cabe en su memoria y la velocidad es la prioridad.

¿Dónde colocar el MacBook Pro M4 respecto a otras opciones?
SituaciónMejor opciónRazón
Modelo de 8 a 14B, movilidad, silencioMacBook Air M4 de 16 o 24 GBSuficiente, más ligero
Modelo de 24 a 32B, varios modelos abiertosMacBook Pro M4 Pro 48 GB o MaxMemoria y ventilación activa
Modelo de 70B o contexto muy largo, cuando estás de viajeMacBook Pro M4 Max 64 o 128 GBÚnico portátil que carga un 70B completo
Misma carga, pero en la oficinaMac Studio o Mac miniMismo chip, sistema de refrigeración más grande, sin batería
Modelo que cabe en 24 GB, velocidad máximaGPU NVIDIA con 24 GB o másMayor ancho de banda cuando el modelo cabe en memoria

#M4 o M5: ¿qué cambia en la siguiente generación?

Apple ha lanzado desde entonces MacBook Pro M5 Pro y M5 Max. Su ficha indica 307 GB/s para el M5 Pro, 460 GB/s para el M5 Max con 32 núcleos GPU y 614 GB/s para el M5 Max con 40 núcleos GPU, frente a 273, 410 y 546 GB/s para la generación M4. El ancho de banda aumenta aproximadamente entre un 12 y un 13 %, por lo que también suben los límites teóricos de velocidad. La decisión de compra se plantea sobre todo con la misma cantidad de memoria: un M4 Max de 128 GB de segunda mano permite ejecutar más modelos que un M5 Pro de 48 GB nuevo.

Ancho de banda de los chips Pro y Max, M4 y M5, según Apple
ChipM4M5
Pro273 GB/s307 GB/s
Max, 32 núcleos de GPU410 GB/s460 GB/s
Max, 40 núcleos de GPU546 GB/s614 GB/s

#Limitaciones que debes conocer

Límite de memoria
128 GB como máximo. Para superar esa capacidad, se necesita un Mac Studio u otra plataforma.
Sin CUDA
Las bibliotecas que requieren CUDA no funcionan. MLX y llama.cpp cubren la inferencia, no todo el ecosistema de entrenamiento.
Fine-tuning
MLX permite fine-tuning de bajo rango y completo con modelos cuantizados. En modelos de más de unos pocos mil millones de parámetros, esto sigue siendo lento y genera calor: reserva los trabajos grandes para un servicio en la nube.
Batería
La inferencia continua agota rápidamente la batería: conecta el equipo a la corriente para las sesiones largas.

#Preguntas frecuentes

FAQ
¿El MacBook Pro M4 Max es mejor que una RTX 4090 para LLM?+
Todo depende del tamaño del modelo. La RTX 4090 tiene 24 GB de memoria: si el modelo supera esa capacidad, parte de él se transfiere a la RAM y la ejecución se ralentiza. Un M4 Max con 64 o 128 GB carga un modelo de 70B completo, pero genera más lentamente que una tarjeta cuando el modelo cabe en sus 24 GB. Elige según el tamaño del modelo que quieras ejecutar.
M4 Pro 48 GB o M4 Max 36 GB: ¿cuál elegir?+
El M4 Pro de 48 GB carga modelos más grandes, hasta uno de 32B en Q4 con un contexto moderado. El M4 Max de 14 núcleos tiene 410 GB/s frente a 273, por lo que genera aproximadamente un 50 % más rápido, pero sus 36 GB limitan el tamaño. Para un modelo de 24 a 32B, la memoria tiene prioridad: elige 48 GB.
¿Se necesitan 64 o 128 GB de memoria en un M4 Max?+
64 GB bastan para un modelo de 70B en Q4 (aproximadamente 40 GB) con un contexto moderado. 128 GB se justifican para un contexto muy largo, modelos con expertos de más de 100 mil millones de parámetros o varios modelos cargados al mismo tiempo. Si tu uso cabe en 64 GB, la memoria adicional no aporta velocidad.
¿Qué velocidad se puede esperar de un 70B en un MacBook Pro M4 Max?+
El techo teórico es de 546 GB/s divididos por aproximadamente 40 GB, es decir, de 13 a 14 tokens por segundo. La velocidad real es más baja y depende del motor y del contexto. El M4 Max con 410 GB/s y 36 GB no puede cargar un 70B; solo la versión de 546 GB/s con 64 o 128 GB puede hacerlo.
¿Se puede hacer fine-tuning de un modelo en un MacBook Pro M4?+
Sí, con MLX: el paquete mlx-lm admite el fine-tuning de bajo rango y completo con modelos cuantizados. En la práctica, sirve para modelos pequeños y pruebas. Para un modelo de varias decenas de miles de millones de parámetros, un servicio en la nube sigue siendo más rápido.
¿Ollama, LM Studio o MLX en un MacBook Pro M4?+
Ollama para la simplicidad y la API local, LM Studio para la interfaz gráfica, MLX para los formatos Apple y el fine-tuning. Los tres coexisten, pero no cargues dos modelos grandes al mismo tiempo: la memoria es la principal limitación. La guía de MLX frente a llama.cpp compara las velocidades.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.