Intermedio 11 minMacBook Pro

¿Qué LLM en MacBook Pro M2 Pro / Max (16–96 GB)? ?

Respuesta directa

Un MacBook Pro M2 Pro puede ejecutar cómodamente un modelo de 8-9B con 16 GB y uno de 24 a 32B con 32 GB; un M2 Max con 64 o 96 GB es la única variante de esta generación que puede alojar un modelo de 70B en Q4 (aproximadamente 40 GB) y dos modelos de 20 a 30B al mismo tiempo. La velocidad depende del ancho de banda: 200 GB/s para el M2 Pro, 400 GB/s para el M2 Max, lo que equivale a casi el doble de tokens por segundo con el mismo modelo.

Lanzado en enero de 2023, el MacBook Pro M2 Pro / Max sigue siendo uno de los portátiles más potentes para la IA local: ventiladores, 400 GB/s de ancho de banda en el M2 Max y hasta 96 GB de memoria unificada. Esta página explica qué permite cada configuración de memoria, qué indican las mediciones publicadas, por qué duplicar el ancho de banda no duplica la velocidad, y en qué casos vale la pena pasar a un M4 Max.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en macOS 14+
Hardware recomendado

Alternativa de compra para esta guía: MacBook Pro M5 Pro — 24 GB / 1 TB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene un beneficio de las compras que cumplen los requisitos.

#MacBook Pro M2 Pro / Max en 2026: la ficha técnica útil

En su presentación, Apple anunciaba para el M2 Pro un ancho de banda de 200 GB/s y hasta 32 GB de memoria unificada, y para el M2 Max, 400 GB/s, hasta 96 GB y una GPU de hasta 38 núcleos. Apple presentaba esos 96 GB como una ampliación de los límites de la memoria gráfica en un portátil. La memoria está soldada al procesador, por lo que la configuración se elige al comprar el equipo y ya no se puede cambiar.

Los chips del MacBook Pro de 14 y 16 pulgadas (2023)
ChipAncho de bandaOpciones de memoriaGPU
M2 Pro200 GB/s16 o 32 GB16 o 19 núcleos
M2 Max400 GB/s32, 64 o 96 GB30 o 38 núcleos

La refrigeración activa es el segundo punto a favor respecto a un MacBook Air: el MacBook Pro puede mantener cargas prolongadas sin que el chip tenga que reducir notablemente su velocidad. Apple también ofrece, en algunos modelos, un modo de alta potencia que permite que los ventiladores giren más rápido; es un ajuste que puedes probar durante las generaciones largas, a costa de un ruido adicional.

#M2 Pro o M2 Max: qué cambia realmente el ancho de banda

El kit Mac

La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

La generación de texto lee todos los pesos activos del modelo con cada token. Por tanto, la velocidad máxima es el ancho de banda dividido por el tamaño de los pesos. Un M2 Max con 400 GB/s puede, en teoría, ser dos veces más rápido que un M2 Pro con 200 GB/s. Las mediciones publicadas en el repositorio llama.cpp muestran que esto solo se cumple en parte.

Generación de texto, Llama 7B, llama.cpp (discusión #4167)
Chip (núcleos de GPU)Ancho de bandaQ4_0Q8_0F16
M2 Pro (19)200 GB/s38,86 t/s23,01 t/s13,06 t/s
M2 Max (30)400 GB/s60,99 t/s39,97 t/s24,16 t/s
M2 Max (38)400 GB/s65,95 t/s41,83 t/s24,65 t/s

En un modelo de 7B en Q4_0, el M2 Max solo ofrece entre 1,6 y 1,7 veces el rendimiento del M2 Pro. En el mismo modelo en F16, de aproximadamente 13 GB, la diferencia sube hasta casi 1,9 veces. El cálculo lo explica: un modelo pequeño se lee tan rápido que otras limitaciones (cálculo, latencia, sobrecarga) pasan a dominar, mientras que un modelo grande realmente satura la memoria. La consecuencia práctica es contraintuitiva: cuanto más grande es el modelo, mejor justifica el M2 Max su precio. Para un 7B, un M2 Pro es más que suficiente.

→
Orden de magnitud para tu modelo
Divide el ancho de banda por el tamaño de los pesos en Q4 del catálogo y luego resta entre un 15 % y un 35 % según el tamaño del modelo: el M2 Max alcanza aproximadamente el 63 % del límite máximo con un 7B en Q4_0 y alrededor del 83 % con un 7B en F16. Para un modelo de 19 GB como Qwen3-Coder 30B-A3B, el límite máximo del M2 Max ya es de 21 t/s en lectura densa; los modelos MoE solo vuelven a leer sus parámetros activos, por lo que sus velocidades reales son mucho mejores.

#De 16 a 96 GB: lo que cabe y lo que va justo

En Apple Silicon, la GPU no tiene acceso a toda la memoria por defecto: según las discusiones del repositorio llama.cpp, Metal le asigna entre dos tercios y tres cuartos. Con 16 GB, cuenta con unos 10 a 12 GB para el modelo y su contexto; con 96 GB, unos 64 a 72 GB. El límite se puede aumentar mediante un ajuste del sistema detallado en la guía dedicada, pero superarlo puede bloquear el equipo.

Pesos en Q4 (catálogo QuelLLM) según la memoria disponible, sin incluir la memoria del contexto
ModeloPesos Q4M2 Pro 16 GBM2 Pro 32 GBM2 Max 64 GBM2 Max 96 GB
Qwen 3.5 9B6 GBCómodoSíSíSí
Gemma 4 12B7 GBExactoSíSíSí
Mistral Small 3.2 24B14 GBNoSíSíSí
Qwen 3.5 27B16 GBNoSí, contexto moderadoSíSí
Qwen3-Coder 30B-A3B (MoE)19 GBNoSí, contexto moderadoSíSí
Qwen 3.6 35B-A3B (MoE)21 GBNoExactoSíSí
Llama 3.3 70B40 GBNoNoSí, contexto cortoSí

Los modelos MoE como Qwen3-Coder 30B-A3B o Qwen 3.6 35B-A3B pesan 19 y 21 GB, pero activan solo alrededor de 3 mil millones de parámetros por token: con la misma memoria, generan claramente más rápido que un modelo denso de 27B. Es la opción más rentable con 32 GB. Con 96 GB, el atractivo del M2 Max radica menos en cargar un único modelo muy grande que en mantener dos modelos en memoria a la vez, por ejemplo, uno de chat y otro de código.

#Velocidades publicadas: lo que se puede afirmar y lo que no se puede

No tenemos mediciones propias en esta máquina, y los tokens por segundo dependen del modelo, de la cuantización, del contexto y de la versión de llama.cpp o de Ollama. Las únicas mediciones que citamos son las publicadas por usuarios con un Llama 7B, que sirven para hacerse una idea del orden de magnitud. Para un modelo más reciente, dividir el ancho de banda entre el peso sigue siendo una buena práctica, con el margen de error indicado más arriba.

El procesamiento del prompt sigue otra lógica: la tabla de llama.cpp indica, para este mismo Llama 7B en F16, 384 t/s de procesamiento del prompt en un M2 Pro con 19 núcleos y 756 t/s en un M2 Max con 38 núcleos. El número de núcleos de la GPU influye en esta fase, no en la generación. Para un RAG o el análisis de un documento largo, un M2 Max tendrá, por tanto, un tiempo de espera hasta la primera palabra de aproximadamente la mitad que un M2 Pro.

#Instalar Ollama y usarlo correctamente en Mac

Ollama requiere macOS Sonoma (14) o una versión más reciente. En Mac, las preguntas frecuentes oficiales aclaran que, cuando Ollama se ejecuta como aplicación, sus variables de entorno se definen con launchctl y después hay que volver a iniciar la aplicación. Las variables exportadas en un terminal no bastan: la aplicación no las ve.

Ajustes útiles para modelos grandes
launchctl setenv OLLAMA_FLASH_ATTENTION 1
launchctl setenv OLLAMA_KV_CACHE_TYPE q8_0
# puis quitter et relancer l'application Ollama

La FAQ de Ollama indica que la caché K/V cuantizada en q8_0 utiliza aproximadamente la mitad de la memoria del formato f16 predeterminado y que Flash Attention debe estar activado para aprovecharla. En un modelo de 70B con un contexto largo, este ajuste permite que la caché quepa en la memoria. Una limitación que debes conocer: la cuantización de la caché puede degradar ligeramente la calidad en algunos modelos; pruébala en tus casos de uso antes de mantener este ajuste.

!
Aumenta el límite de memoria de la GPU solo si sabes lo que implica
El parámetro iogpu.wired_limit_mb permite asignar más memoria a la GPU, pero no se mantiene tras el reinicio y un valor excesivo puede bloquear macOS. Se describe en la guía sobre los ajustes de Apple Silicon, que sigue siendo la referencia; aplícalo solo si el modelo no cabe en la memoria disponible de otro modo y deja al menos 8 GB para el sistema.

#¿Qué modelo para qué uso?

Chat generalista
Un modelo de 8 a 12B (Qwen 3.5 9B, Gemma 4 12B) responde rápido en M2 Pro; un modelo de 27B se vuelve interesante a partir de 32 GB para un francés más cuidado.
Código
Un modelo MoE de código como Qwen3-Coder 30B-A3B en 32 GB o más, o un modelo de agente de código de 24B como Devstral Small 2 (14 GB en Q4). Para autocompletado en línea, un modelo de 7B basta.
RAG documental
Gemma 4 12B en velocidad, un modelo de 24B en calidad de razonamiento; limita el contexto para no alargar la espera antes de la primera palabra.
Análisis extensos, agentes
Con 64 GB o más: Qwen 3.6 35B-A3B como MoE rápido, o un 70B para priorizar la calidad, siempre que aceptes alrededor de 10 t/s en el mejor de los casos (400 ÷ 40).

Un aspecto que conviene tener en cuenta con los modelos de razonamiento: generan largos bloques de reflexión antes de responder, lo que multiplica el número de tokens que deben generar. En una máquina que genera 60 t/s, diez mil tokens de reflexión tardan casi tres minutos. Para preguntas sencillas, desactiva el modo de reflexión cuando el modelo lo permita.

#Con batería y bajo carga prolongada: lo que cambia

El MacBook Pro está diseñado para mantener el rendimiento durante más tiempo que un Air, pero sigue siendo un portátil. Dos ajustes influyen en las velocidades de procesamiento: el modo de alimentación (con batería, macOS puede limitar la potencia) y, en los modelos que lo ofrecen, el modo de alta potencia. Según Apple, este modo permite que los ventiladores giren más rápido para mantener un mejor rendimiento con cargas de trabajo muy intensivas, a costa de más ruido. Para una generación de varios minutos, conecta el equipo a la corriente y prueba este modo.

#¿Conviene pasar a un M4 Max?

El M4 Max alcanza 546 GB/s y 128 GB de memoria según Apple. En la tabla de llama.cpp, un Llama de 7B en Q4_0 pasa de 65,95 t/s en M2 Max 38 núcleos a 83,06 t/s en M4 Max 40 núcleos: aproximadamente un 26 % más. La mejora es real para un uso intenso, pero el M2 Max de 96 GB mantiene una ventaja de capacidad respecto a un M4 Pro limitado a 64 GB.

¿Cuándo mantener el M2 Max y cuándo cambiar?
SituaciónRecomendación
Usas principalmente modelos de 8-14BUn M2 Pro de 32 GB es suficiente; no pagues por el ancho de banda adicional
Cargas modelos de 27 a 35B todos los díasM2 Max con 64 o 96 GB: ahí es donde se justifica
Quieres ejecutar un 70B con holgura o mantener dos modelos cargados en memoriaM2 Max 96 GB, o un M4 Max 128 GB si la velocidad importa
Buscas un servidor sin pantallaUn Mac mini M4 Pro o un Mac Studio es más adecuado

#Preguntas frecuentes

FAQ
¿Es suficiente un MacBook Pro M2 Pro de 16 GB para la IA local?+
Sí, para modelos de 8 a 9 mil millones de parámetros en Q4, que ocupan entre 5 y 6 GB, con un contexto razonable. No es adecuado para modelos de 24B o más. Como la memoria no se puede ampliar después, elige 32 GB si quieres poder pasar a un modelo más grande en el futuro.
¿Qué diferencia hay entre el M2 Max con 30 núcleos de GPU y el de 38 núcleos de GPU?+
Ambos tienen 400 GB/s de ancho de banda. En las mediciones de llama.cpp, la generación de texto es solo alrededor de un 8 % más rápida con 38 núcleos (65,95 frente a 60,99 t/s en Q4_0), ya que depende del ancho de banda. La diferencia se ve más claramente en el procesamiento del prompt, donde la versión con 38 núcleos es claramente más rápida.
¿Se pueden ejecutar dos LLM en paralelo en un M2 Max de 64 GB?+
Sí, si la suma de los pesos y los contextos se mantiene dentro de la parte de memoria que Metal asigna a la GPU, es decir, entre 43 y 48 GB aproximadamente. Por ejemplo, un modelo de 27B (16 GB) y un modelo de 12B (7 GB) caben. Ollama mantiene los modelos en memoria durante 5 minutos por defecto, y volver a cargar un modelo tarda unos segundos.
¿Qué modelo usar en francés en un MacBook Pro M2 Max?+
Mistral Small 3.2 24B, del laboratorio francés Mistral AI, es un buen candidato para equipos con 32 GB o más (14 GB en Q4). Qwen 3.5 9B y Gemma 4 12B son multilingües y más rápidos. Pruébalos con tus propios textos: la calidad en francés depende del tipo de tarea.
¿El M2 Max se calienta más que el M1 Max durante la inferencia?+
No tenemos una comparación fiable con cifras que citar. Los dos cuentan con refrigeración activa; la velocidad depende principalmente del ancho de banda, idéntico a 400 GB/s. Para generaciones largas, conecta la alimentación y prueba el modo Alta potencia que ofrece Apple, aceptando el ruido de los ventiladores.
¿Se debe instalar MLX junto a Ollama en un M2 Max?+
No necesariamente. Ollama basta para el chat, el RAG y la API. MLX interesa a los desarrolladores que quieren controlar el modelo desde Python o probar un ajuste fino local con LoRA. Las diferencias de velocidad varían según el modelo y la versión: la comparación detallada del sitio las examina sin prometer una mejora fija.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.