Mac M4 Max y LLM local: MLX, rendimiento, modelos
El MacBook Pro M4 Max (64 o 128 GB de RAM unificada) se ha convertido en el portátil más capaz para ejecutar un LLM local. La combinación de memoria unificada y el framework MLX de Apple permite cargar los modelos de pesos abiertos más grandes del momento —los MoE de 30-35B con precisión completa y los modelos densos multimodales de 27B— en un portátil, a velocidades sorprendentes. Esta guía mide lo que realmente funciona: MLX vs Ollama, modelos que se pueden ejecutar en la práctica, tokens/segundo medidos y comportamiento térmico al funcionar con batería.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: Mac Studio M5 Max (36 GB / 512 GB).
¿Por qué esta elección? Nuestra ficha completa sobre Mac Studio M5 Max (36 GB / 512 GB) →
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#Por qué el M4 Max cambia las reglas del juego para los LLM locales
En un PC con Windows o Linux, la VRAM de la GPU es la principal limitación. Una RTX 4090 tiene un límite de 24 GB: ejecutar localmente un modelo de 30-35B en FP16 obliga a descargar parte del procesamiento en la CPU, lo que divide la velocidad de generación entre cinco o diez. El M4 Max aborda el problema al revés. La GPU y la CPU comparten la misma memoria: todo lo que está en la RAM es accesible para la GPU sin necesidad de copiarlo.
En concreto, un MacBook Pro M4 Max de 128 GB puede cargar los mejores modelos MoE de 2026 —Qwen 3.6 35B-A3B o Qwen 3.8 27B— en precisión completa FP16, o varios modelos al mismo tiempo, sin problemas, y seguir ejecutándolos con batería. Ningún ordenador portátil x86 hace esto hoy en día: se necesita un ordenador de escritorio con una RTX 5090 o dos RTX 3090 para acercarse al mismo resultado, y aun así, sin poder usarlo de forma portátil.
#RAM unificada: por qué 128 GB ≠ 128 GB de VRAM
Has visto lo que da un M4 Max con MLX. El kit Mac detalla cuándo MLX supera realmente a GGUF (cap. 3), cómo calcular tu presupuesto de memoria con un contexto largo (cap. 5) y qué rendimiento esperar, teniendo también en cuenta el calor y la batería (cap. 6).
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
macOS no permite que un solo proceso consuma toda la memoria. Por defecto, la GPU puede usar aproximadamente el 75 % de la RAM total. En una máquina de 128 GB, eso da ~96 GB disponibles para tus modelos. En una de 64 GB, obtienes ~48 GB. Es más que suficiente para los modelos objetivo, pero hay que saberlo antes de calcular.
- Mac M4 Max 64 GB
- Aproximadamente 48 GB para el LLM. Los mejores MoE de 2026 en Q8 caben con holgura —Qwen3-Coder 30B-A3B (≈32 GB), Qwen 3.8 27B (≈30 GB), Qwen 3.6 35B-A3B (≈40 GB), que cabe justo— y Mistral Small 24B cabe incluso en FP16 (≈48 GB).
- Mac M4 Max 128 GB
- Aproximadamente 96 GB para el LLM. Espacio suficiente para ejecutar grandes modelos MoE en precisión completa FP16 (Qwen 3.6 35B-A3B, Qwen 3.8 27B, Granite 4.2 30B), mantener varios modelos cargados simultáneamente, o aumentar el contexto hasta 256k tokens.
- Cuantizaciones recomendadas
- Q4_K_M sigue siendo una buena opción por defecto. Con 128 GB puedes subir a Q5_K_M o Q6 sin problemas para mejorar la calidad.
#MLX vs Ollama : ¿cuál para un Mac M4 Max?
Apple lanzó MLX en diciembre de 2023: un framework de cálculo con arrays diseñado para Apple Silicon, funcionalmente equivalente a PyTorch pero concebido en torno a la memoria unificada. El módulo mlx-lm ofrece una CLI y una API en Python para ejecutar modelos cuantizados en formato MLX (similar al GGUF pero distinto).
- Ollama (Metal)
- Más fácil de instalar, ecosistema enorme, formatos GGUF universales, API compatible con OpenAI en el puerto :11434. Ligera sobrecarga, conversión de memoria CPU↔GPU no óptima.
- MLX (mlx-lm)
- Más rápido en la práctica en Apple Silicon: +20 a +40 % de tokens/segundo en modelos de 30B+, gestión nativa de la memoria y almacenamiento en caché de prompts integrado. Ecosistema más pequeño, sin una API REST estandarizada de serie.
- Veredicto
- Para explorar y probar 10 modelos: Ollama. Para aprovechar al máximo el M4 Max y ejecutar los grandes MoE de 30-35B en precisión completa en producción local: MLX.
#Instalar MLX y ejecutar un primer modelo
- 01Preparar un entorno de PythonUsa Python 3.10+ (3.12 recomendado). En Mac, lo más limpio es uv o pyenv. mlx-lm no tiene requisitos nativos además de Apple Silicon.
- 02Instalar mlx-lmUn solo comando pip basta. Todo está compilado para arm64 Metal.
- 03Lanzar un modelo MLXLa CLI mlx_lm.generate descarga el modelo desde Hugging Face (organización mlx-community) y lo ejecuta.
- 04Exponer una API HTTP (opcional)mlx-lm incluye desde la versión 0.18 el comando mlx_lm.server que expone una API compatible con OpenAI en el puerto 8080.
#Modelos probados en MacBook Pro M4 Max 128 GB
Todas las cifras siguientes se han medido en un MacBook Pro de 16" M4 Max (40 núcleos de GPU, 128 GB), conectado a la red eléctrica, primero en frío y después tras 5 minutos de calentamiento. Prompt corto (50 tokens), generación de 500 tokens, tamaño de lote de 1.
- Qwen 3.6 35B-A3B Q8 (MLX)
- ≈40 GB en RAM. 42-50 tokens/s: el MoE activa solo 3B de parámetros, de ahí la elevada tasa de generación a pesar de su tamaño. Una apuesta segura y versátil en este Mac.
- Qwen 3.8 27B Q8 (MLX)
- ≈30 GB en RAM. 18-22 tokens/s (modelo denso). 262k de contexto y visión, el más cercano a un Copilot local. Piensa en poner el ajuste de razonamiento en low, de lo contrario piensa demasiado.
- Qwen3-Coder 30B-A3B Q8 (MLX)
- ≈32 GB de RAM. 44-52 tokens/s. MoE especializado en código, 256k de contexto: ideal como asistente de desarrollo local.
- GLM 4.7 Flash Q8 (MLX)
- ≈32 GB en RAM (MoE 30B-A3B, licencia MIT). 40-48 tokens/s. Excelente para agentes y llamadas a herramientas, con una respuesta muy rápida.
- Granite 4.2 30B Q8 (MLX)
- ≈33 GB en RAM. 30-38 tokens/s. Orientado al uso profesional y empresarial, con un consumo moderado de tokens y estable en sesiones largas.
- Mistral Small 24B FP16 (MLX)
- ≈48 GB. 18-22 tokens/s. Modelo denso, excelente calidad FR, especialmente bueno en síntesis documental.
#Benchmarks detallados: MLX vs Ollama vs llama.cpp
Con el mismo modelo Qwen 3.8 27B en Q8, esta es la dispersión observada entre los tres runtimes en la misma máquina M4 Max de 128 GB:
- MLX 8-bit (mlx-community)
- 20,5 tokens/s en promedio, evaluación de prompt ~410 tokens/s
- Ollama Q8_0 (Metal)
- 15,2 tokens/s en promedio, evaluación de prompt ~300 tokens/s.
- llama.cpp sin intermediarios Q8_0
- 15.6 tokens/s en promedio. Ollama añade poca sobrecarga en comparación con llama.cpp.
#M4 Max vs RTX 4090: quién gana en qué
La comparación directa: un MacBook Pro M4 Max de 128 GB (modelo sustituido por el M5 Max en Apple; hay que buscarlo de segunda mano, con precio variable) frente a un ordenador de sobremesa equipado con una RTX 4090 de 24 GB de segunda mano (precio variable, solo la GPU, sin el resto de la torre).
- Modelos pequeños ≤14B Q4 (Qwen 3.5 9B, gpt-oss 20B)
- La RTX 4090 gana claramente (80-120 tok/s frente a 35-60 en M4 Max). Para estos tamaños, elige la 4090 si tienes la opción.
- Modelos densos 24-30B Q4 (Mistral Small, Qwen 3.8 27B)
- RTX 4090 aún lidera (30-40 tok/s vs 18-22 en M4 Max), pero la diferencia se acorta.
- Precisión completa Q8/FP16
- El M4 Max se pone por delante en la práctica: ejecuta los mejores modelos MoE de 2026 (35B-A3B, 27B) en Q8 o FP16 en su RAM, mientras que la RTX 4090 debe bajar a Q4 o descargar parte del procesamiento en la CPU (con un rendimiento dividido por cinco).
- MoE de gran tamaño (Qwen 3.6 35B-A3B)
- El M4 Max destaca gracias a su gran cantidad de RAM: todo cabe en memoria, incluso en FP16. La RTX 4090 tiene que descargar parte del modelo a la RAM del sistema en cuanto se supera Q4.
- Mobilidad
- No hay comparación: el M4 Max aguanta ~3 h de inferencia continua con batería; la RTX 4090 recorre 0 km.
#Comportamiento térmico, ventiladores y autonomía de la batería
El M4 Max se calienta poco durante la inferencia en comparación con una GPU NVIDIA. Bajo carga sostenida (generación de 5 minutos con un gran MoE de 35B en Q8), los ventiladores alcanzan unas 2.800 RPM: son audibles, pero están lejos del ruido molesto de un PC para juegos. La temperatura de la CPU/GPU alcanza un máximo de unos 95 °C sin una reducción notable del rendimiento por temperatura cuando el equipo está conectado a la corriente.
- Conectado a la red eléctrica (cargador de 140 W)
- A plena potencia, con el máximo rendimiento. Sin límites, ventiladores a un régimen moderado.
- Con batería
- macOS reduce ligeramente la frecuencia de la GPU: aproximadamente el 80 % de la velocidad de generación con el equipo conectado a la corriente. Qwen 3.6 35B-A3B pasa de aproximadamente 45 a 37 tokens/s.
- Autonomía de la batería durante la inferencia
- MacBook Pro 16" M4 Max 100 Wh: ~3 h de inferencia continua en un gran MoE 35B, ~5 h en modelos 7B-14B, ~8 h de uso mixto chat + lectura.
- Ruido de los ventiladores
- Se escuchan a partir de 30 segundos de generación continua, pero son mucho más discretos que un portátil con RTX.
#Consejos para sacar el máximo partido al M4 Max
- Deja el modelo cargado
- El primer prompt tras la carga es lento. Usa el modo servidor (mlx_lm.server o ollama serve) para mantener el modelo en RAM durante toda la sesión.
- Prioriza el formato MLX
- Los modelos publicados por mlx-community en Hugging Face están optimizados para Apple Silicon. Busca el prefijo "mlx-community/" antes de cualquier otro.
- Monitorea con asitop o Stats
- asitop (equivalente a nvtop para Apple Silicon) muestra en tiempo real el consumo de GPU, la memoria y la potencia instantánea.
- Modo de alto rendimiento
- En Configuración del sistema → Batería → elegir «Alto rendimiento». Mejora marginal pero real en los modelos de 70B.
- Desactiva Spotlight durante las pruebas de rendimiento
- La indexación de Spotlight puede reducir la tasa de generación entre un 5 y un 10 %. mdutil -a -i off la desactiva durante una sesión.
#Para ir más allá
Tres pistas para profundizar en el tema:
- Instalar Ollama en macOS
- Si prefieres la simplicidad al rendimiento puro, la guía "Instalar Ollama en macOS (Apple Silicon)" cubre todas las herramientas de Metal para Ollama.
- Elegir tu cuantización
- Con 128 GB de RAM unificada, tienes margen para subir a Q5_K_M, Q6 o incluso FP16; la guía «Elegir la cuantización» detalla los compromisos.
- Mac Studio Ultra para ir más lejos
- Si los modelos MoE de 30-35B no te bastan y buscas ejecutar en local los modelos más grandes de pesos abiertos (100B a 671B), la guía «Qué LLM usar en un Mac Studio» cubre las configuraciones Ultra de hasta 512 GB.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.