¿Qué LLM en MacBook Pro M2 Pro / Max (16–96 GB)? ?
Un MacBook Pro M2 Pro puede ejecutar cómodamente un modelo de 8-9B con 16 GB y uno de 24 a 32B con 32 GB; un M2 Max con 64 o 96 GB es la única variante de esta generación que puede alojar un modelo de 70B en Q4 (aproximadamente 40 GB) y dos modelos de 20 a 30B al mismo tiempo. La velocidad depende del ancho de banda: 200 GB/s para el M2 Pro, 400 GB/s para el M2 Max, lo que equivale a casi el doble de tokens por segundo con el mismo modelo.
Lanzado en enero de 2023, el MacBook Pro M2 Pro / Max sigue siendo uno de los portátiles más potentes para la IA local: ventiladores, 400 GB/s de ancho de banda en el M2 Max y hasta 96 GB de memoria unificada. Esta página explica qué permite cada configuración de memoria, qué indican las mediciones publicadas, por qué duplicar el ancho de banda no duplica la velocidad, y en qué casos vale la pena pasar a un M4 Max.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: MacBook Pro M5 Pro — 24 GB / 1 TB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene un beneficio de las compras que cumplen los requisitos.
#MacBook Pro M2 Pro / Max en 2026: la ficha técnica útil
En su presentación, Apple anunciaba para el M2 Pro un ancho de banda de 200 GB/s y hasta 32 GB de memoria unificada, y para el M2 Max, 400 GB/s, hasta 96 GB y una GPU de hasta 38 núcleos. Apple presentaba esos 96 GB como una ampliación de los límites de la memoria gráfica en un portátil. La memoria está soldada al procesador, por lo que la configuración se elige al comprar el equipo y ya no se puede cambiar.
| Chip | Ancho de banda | Opciones de memoria | GPU |
|---|---|---|---|
| M2 Pro | 200 GB/s | 16 o 32 GB | 16 o 19 núcleos |
| M2 Max | 400 GB/s | 32, 64 o 96 GB | 30 o 38 núcleos |
La refrigeración activa es el segundo punto a favor respecto a un MacBook Air: el MacBook Pro puede mantener cargas prolongadas sin que el chip tenga que reducir notablemente su velocidad. Apple también ofrece, en algunos modelos, un modo de alta potencia que permite que los ventiladores giren más rápido; es un ajuste que puedes probar durante las generaciones largas, a costa de un ruido adicional.
#M2 Pro o M2 Max: qué cambia realmente el ancho de banda
La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
La generación de texto lee todos los pesos activos del modelo con cada token. Por tanto, la velocidad máxima es el ancho de banda dividido por el tamaño de los pesos. Un M2 Max con 400 GB/s puede, en teoría, ser dos veces más rápido que un M2 Pro con 200 GB/s. Las mediciones publicadas en el repositorio llama.cpp muestran que esto solo se cumple en parte.
| Chip (núcleos de GPU) | Ancho de banda | Q4_0 | Q8_0 | F16 |
|---|---|---|---|---|
| M2 Pro (19) | 200 GB/s | 38,86 t/s | 23,01 t/s | 13,06 t/s |
| M2 Max (30) | 400 GB/s | 60,99 t/s | 39,97 t/s | 24,16 t/s |
| M2 Max (38) | 400 GB/s | 65,95 t/s | 41,83 t/s | 24,65 t/s |
En un modelo de 7B en Q4_0, el M2 Max solo ofrece entre 1,6 y 1,7 veces el rendimiento del M2 Pro. En el mismo modelo en F16, de aproximadamente 13 GB, la diferencia sube hasta casi 1,9 veces. El cálculo lo explica: un modelo pequeño se lee tan rápido que otras limitaciones (cálculo, latencia, sobrecarga) pasan a dominar, mientras que un modelo grande realmente satura la memoria. La consecuencia práctica es contraintuitiva: cuanto más grande es el modelo, mejor justifica el M2 Max su precio. Para un 7B, un M2 Pro es más que suficiente.
#De 16 a 96 GB: lo que cabe y lo que va justo
En Apple Silicon, la GPU no tiene acceso a toda la memoria por defecto: según las discusiones del repositorio llama.cpp, Metal le asigna entre dos tercios y tres cuartos. Con 16 GB, cuenta con unos 10 a 12 GB para el modelo y su contexto; con 96 GB, unos 64 a 72 GB. El límite se puede aumentar mediante un ajuste del sistema detallado en la guía dedicada, pero superarlo puede bloquear el equipo.
| Modelo | Pesos Q4 | M2 Pro 16 GB | M2 Pro 32 GB | M2 Max 64 GB | M2 Max 96 GB |
|---|---|---|---|---|---|
| Qwen 3.5 9B | 6 GB | Cómodo | Sí | Sí | Sí |
| Gemma 4 12B | 7 GB | Exacto | Sí | Sí | Sí |
| Mistral Small 3.2 24B | 14 GB | No | Sí | Sí | Sí |
| Qwen 3.5 27B | 16 GB | No | Sí, contexto moderado | Sí | Sí |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | No | Sí, contexto moderado | Sí | Sí |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | No | Exacto | Sí | Sí |
| Llama 3.3 70B | 40 GB | No | No | Sí, contexto corto | Sí |
Los modelos MoE como Qwen3-Coder 30B-A3B o Qwen 3.6 35B-A3B pesan 19 y 21 GB, pero activan solo alrededor de 3 mil millones de parámetros por token: con la misma memoria, generan claramente más rápido que un modelo denso de 27B. Es la opción más rentable con 32 GB. Con 96 GB, el atractivo del M2 Max radica menos en cargar un único modelo muy grande que en mantener dos modelos en memoria a la vez, por ejemplo, uno de chat y otro de código.
#Velocidades publicadas: lo que se puede afirmar y lo que no se puede
No tenemos mediciones propias en esta máquina, y los tokens por segundo dependen del modelo, de la cuantización, del contexto y de la versión de llama.cpp o de Ollama. Las únicas mediciones que citamos son las publicadas por usuarios con un Llama 7B, que sirven para hacerse una idea del orden de magnitud. Para un modelo más reciente, dividir el ancho de banda entre el peso sigue siendo una buena práctica, con el margen de error indicado más arriba.
El procesamiento del prompt sigue otra lógica: la tabla de llama.cpp indica, para este mismo Llama 7B en F16, 384 t/s de procesamiento del prompt en un M2 Pro con 19 núcleos y 756 t/s en un M2 Max con 38 núcleos. El número de núcleos de la GPU influye en esta fase, no en la generación. Para un RAG o el análisis de un documento largo, un M2 Max tendrá, por tanto, un tiempo de espera hasta la primera palabra de aproximadamente la mitad que un M2 Pro.
#Instalar Ollama y usarlo correctamente en Mac
Ollama requiere macOS Sonoma (14) o una versión más reciente. En Mac, las preguntas frecuentes oficiales aclaran que, cuando Ollama se ejecuta como aplicación, sus variables de entorno se definen con launchctl y después hay que volver a iniciar la aplicación. Las variables exportadas en un terminal no bastan: la aplicación no las ve.
La FAQ de Ollama indica que la caché K/V cuantizada en q8_0 utiliza aproximadamente la mitad de la memoria del formato f16 predeterminado y que Flash Attention debe estar activado para aprovecharla. En un modelo de 70B con un contexto largo, este ajuste permite que la caché quepa en la memoria. Una limitación que debes conocer: la cuantización de la caché puede degradar ligeramente la calidad en algunos modelos; pruébala en tus casos de uso antes de mantener este ajuste.
#¿Qué modelo para qué uso?
- Chat generalista
- Un modelo de 8 a 12B (Qwen 3.5 9B, Gemma 4 12B) responde rápido en M2 Pro; un modelo de 27B se vuelve interesante a partir de 32 GB para un francés más cuidado.
- Código
- Un modelo MoE de código como Qwen3-Coder 30B-A3B en 32 GB o más, o un modelo de agente de código de 24B como Devstral Small 2 (14 GB en Q4). Para autocompletado en línea, un modelo de 7B basta.
- RAG documental
- Gemma 4 12B en velocidad, un modelo de 24B en calidad de razonamiento; limita el contexto para no alargar la espera antes de la primera palabra.
- Análisis extensos, agentes
- Con 64 GB o más: Qwen 3.6 35B-A3B como MoE rápido, o un 70B para priorizar la calidad, siempre que aceptes alrededor de 10 t/s en el mejor de los casos (400 ÷ 40).
Un aspecto que conviene tener en cuenta con los modelos de razonamiento: generan largos bloques de reflexión antes de responder, lo que multiplica el número de tokens que deben generar. En una máquina que genera 60 t/s, diez mil tokens de reflexión tardan casi tres minutos. Para preguntas sencillas, desactiva el modo de reflexión cuando el modelo lo permita.
#Con batería y bajo carga prolongada: lo que cambia
El MacBook Pro está diseñado para mantener el rendimiento durante más tiempo que un Air, pero sigue siendo un portátil. Dos ajustes influyen en las velocidades de procesamiento: el modo de alimentación (con batería, macOS puede limitar la potencia) y, en los modelos que lo ofrecen, el modo de alta potencia. Según Apple, este modo permite que los ventiladores giren más rápido para mantener un mejor rendimiento con cargas de trabajo muy intensivas, a costa de más ruido. Para una generación de varios minutos, conecta el equipo a la corriente y prueba este modo.
#¿Conviene pasar a un M4 Max?
El M4 Max alcanza 546 GB/s y 128 GB de memoria según Apple. En la tabla de llama.cpp, un Llama de 7B en Q4_0 pasa de 65,95 t/s en M2 Max 38 núcleos a 83,06 t/s en M4 Max 40 núcleos: aproximadamente un 26 % más. La mejora es real para un uso intenso, pero el M2 Max de 96 GB mantiene una ventaja de capacidad respecto a un M4 Pro limitado a 64 GB.
| Situación | Recomendación |
|---|---|
| Usas principalmente modelos de 8-14B | Un M2 Pro de 32 GB es suficiente; no pagues por el ancho de banda adicional |
| Cargas modelos de 27 a 35B todos los días | M2 Max con 64 o 96 GB: ahí es donde se justifica |
| Quieres ejecutar un 70B con holgura o mantener dos modelos cargados en memoria | M2 Max 96 GB, o un M4 Max 128 GB si la velocidad importa |
| Buscas un servidor sin pantalla | Un Mac mini M4 Pro o un Mac Studio es más adecuado |
- MacBook Pro M3
- MacBook Pro M4
- Mac Studio de 64 a 512 GB
- Ficha de hardware: MacBook Pro M4 Max
- Fuente: mediciones de llama.cpp en chips Apple
- Fuente: Apple, lanzamiento del MacBook Pro M2 Pro y M2 Max
- Fuente: FAQ oficial de Ollama
#Preguntas frecuentes
¿Es suficiente un MacBook Pro M2 Pro de 16 GB para la IA local?+
¿Qué diferencia hay entre el M2 Max con 30 núcleos de GPU y el de 38 núcleos de GPU?+
¿Se pueden ejecutar dos LLM en paralelo en un M2 Max de 64 GB?+
¿Qué modelo usar en francés en un MacBook Pro M2 Max?+
¿El M2 Max se calienta más que el M1 Max durante la inferencia?+
¿Se debe instalar MLX junto a Ollama en un M2 Max?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.