Intermedio 15 minMac

Mac M4 Max y LLM local: MLX, rendimiento, modelos

El MacBook Pro M4 Max (64 o 128 GB de RAM unificada) se ha convertido en el portátil más capaz para ejecutar un LLM local. La combinación de memoria unificada y el framework MLX de Apple permite cargar los modelos de pesos abiertos más grandes del momento —los MoE de 30-35B con precisión completa y los modelos densos multimodales de 27B— en un portátil, a velocidades sorprendentes. Esta guía mide lo que realmente funciona: MLX vs Ollama, modelos que se pueden ejecutar en la práctica, tokens/segundo medidos y comportamiento térmico al funcionar con batería.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: Mac Studio M5 Max (36 GB / 512 GB).

¿Por qué esta elección? Nuestra ficha completa sobre Mac Studio M5 Max (36 GB / 512 GB) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#Por qué el M4 Max cambia las reglas del juego para los LLM locales

En un PC con Windows o Linux, la VRAM de la GPU es la principal limitación. Una RTX 4090 tiene un límite de 24 GB: ejecutar localmente un modelo de 30-35B en FP16 obliga a descargar parte del procesamiento en la CPU, lo que divide la velocidad de generación entre cinco o diez. El M4 Max aborda el problema al revés. La GPU y la CPU comparten la misma memoria: todo lo que está en la RAM es accesible para la GPU sin necesidad de copiarlo.

En concreto, un MacBook Pro M4 Max de 128 GB puede cargar los mejores modelos MoE de 2026 —Qwen 3.6 35B-A3B o Qwen 3.8 27B— en precisión completa FP16, o varios modelos al mismo tiempo, sin problemas, y seguir ejecutándolos con batería. Ningún ordenador portátil x86 hace esto hoy en día: se necesita un ordenador de escritorio con una RTX 5090 o dos RTX 3090 para acercarse al mismo resultado, y aun así, sin poder usarlo de forma portátil.

i
Qué significa "M4 Max"
El M4 Max es el chip de gama alta de los MacBook Pro de 14" y 16" lanzados a finales de 2024. Está disponible en dos configuraciones de GPU (32 o 40 núcleos) y tres niveles de RAM: 36, 48, 64 o 128 GB. Para la inferencia de LLM, solo las versiones de 64 y 128 GB tienen sentido. El ancho de banda de memoria anunciado es de 546 GB/s.

#RAM unificada: por qué 128 GB ≠ 128 GB de VRAM

El kit Mac

Has visto lo que da un M4 Max con MLX. El kit Mac detalla cuándo MLX supera realmente a GGUF (cap. 3), cómo calcular tu presupuesto de memoria con un contexto largo (cap. 5) y qué rendimiento esperar, teniendo también en cuenta el calor y la batería (cap. 6).

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

macOS no permite que un solo proceso consuma toda la memoria. Por defecto, la GPU puede usar aproximadamente el 75 % de la RAM total. En una máquina de 128 GB, eso da ~96 GB disponibles para tus modelos. En una de 64 GB, obtienes ~48 GB. Es más que suficiente para los modelos objetivo, pero hay que saberlo antes de calcular.

Mac M4 Max 64 GB
Aproximadamente 48 GB para el LLM. Los mejores MoE de 2026 en Q8 caben con holgura —Qwen3-Coder 30B-A3B (≈32 GB), Qwen 3.8 27B (≈30 GB), Qwen 3.6 35B-A3B (≈40 GB), que cabe justo— y Mistral Small 24B cabe incluso en FP16 (≈48 GB).
Mac M4 Max 128 GB
Aproximadamente 96 GB para el LLM. Espacio suficiente para ejecutar grandes modelos MoE en precisión completa FP16 (Qwen 3.6 35B-A3B, Qwen 3.8 27B, Granite 4.2 30B), mantener varios modelos cargados simultáneamente, o aumentar el contexto hasta 256k tokens.
Cuantizaciones recomendadas
Q4_K_M sigue siendo una buena opción por defecto. Con 128 GB puedes subir a Q5_K_M o Q6 sin problemas para mejorar la calidad.
Aumentar la memoria asignada a la GPU (opcional)
# Par défaut macOS laisse ~75% de la RAM au GPU.
# Pour pousser à ~85% (à vos risques, peut faire swapper le système) :
sudo sysctl iogpu.wired_limit_mb=110000

# Pour revenir à la valeur par défaut :
sudo sysctl iogpu.wired_limit_mb=0
!
No fuerces el límite más allá del 90 %
Elevar demasiado el límite deja al propio macOS sin memoria suficiente. A partir del 90 %, te arriesgas a que el sistema se bloquee y recurra al swap de forma permanente. El valor predeterminado es adecuado para el 95 % de los usos.

#MLX vs Ollama : ¿cuál para un Mac M4 Max?

Apple lanzó MLX en diciembre de 2023: un framework de cálculo con arrays diseñado para Apple Silicon, funcionalmente equivalente a PyTorch pero concebido en torno a la memoria unificada. El módulo mlx-lm ofrece una CLI y una API en Python para ejecutar modelos cuantizados en formato MLX (similar al GGUF pero distinto).

Ollama (Metal)
Más fácil de instalar, ecosistema enorme, formatos GGUF universales, API compatible con OpenAI en el puerto :11434. Ligera sobrecarga, conversión de memoria CPU↔GPU no óptima.
MLX (mlx-lm)
Más rápido en la práctica en Apple Silicon: +20 a +40 % de tokens/segundo en modelos de 30B+, gestión nativa de la memoria y almacenamiento en caché de prompts integrado. Ecosistema más pequeño, sin una API REST estandarizada de serie.
Veredicto
Para explorar y probar 10 modelos: Ollama. Para aprovechar al máximo el M4 Max y ejecutar los grandes MoE de 30-35B en precisión completa en producción local: MLX.
→
Los dos conviven muy bien
Muchos usuarios de M4 Max mantienen Ollama como servidor permanente para aplicaciones externas (Open WebUI, n8n, Continue.dev) y lanzan MLX de forma puntual para sesiones en las que desean el máximo de tokens/segundo.

#Instalar MLX y ejecutar un primer modelo

  1. 01
    Preparar un entorno de Python
    Usa Python 3.10+ (3.12 recomendado). En Mac, lo más limpio es uv o pyenv. mlx-lm no tiene requisitos nativos además de Apple Silicon.
  2. 02
    Instalar mlx-lm
    Un solo comando pip basta. Todo está compilado para arm64 Metal.
  3. 03
    Lanzar un modelo MLX
    La CLI mlx_lm.generate descarga el modelo desde Hugging Face (organización mlx-community) y lo ejecuta.
  4. 04
    Exponer una API HTTP (opcional)
    mlx-lm incluye desde la versión 0.18 el comando mlx_lm.server que expone una API compatible con OpenAI en el puerto 8080.
Terminal — instalación y primer test
# 1. Environnement
python3 -m venv ~/mlx-env
source ~/mlx-env/bin/activate

# 2. Installation
pip install --upgrade mlx-lm

# 3. Téléchargement + génération en une commande
mlx_lm.generate \
  --model mlx-community/Qwen3.6-35B-A3B-Instruct-4bit \
  --prompt "Explique en français le principe de la mémoire unifiée Apple Silicon." \
  --max-tokens 512
Servidor compatible con OpenAI usando MLX
# Démarre une API sur http://localhost:8080/v1
mlx_lm.server \
  --model mlx-community/Qwen3.8-27B-Instruct-4bit \
  --port 8080

#Modelos probados en MacBook Pro M4 Max 128 GB

Todas las cifras siguientes se han medido en un MacBook Pro de 16" M4 Max (40 núcleos de GPU, 128 GB), conectado a la red eléctrica, primero en frío y después tras 5 minutos de calentamiento. Prompt corto (50 tokens), generación de 500 tokens, tamaño de lote de 1.

Qwen 3.6 35B-A3B Q8 (MLX)
≈40 GB en RAM. 42-50 tokens/s: el MoE activa solo 3B de parámetros, de ahí la elevada tasa de generación a pesar de su tamaño. Una apuesta segura y versátil en este Mac.
Qwen 3.8 27B Q8 (MLX)
≈30 GB en RAM. 18-22 tokens/s (modelo denso). 262k de contexto y visión, el más cercano a un Copilot local. Piensa en poner el ajuste de razonamiento en low, de lo contrario piensa demasiado.
Qwen3-Coder 30B-A3B Q8 (MLX)
≈32 GB de RAM. 44-52 tokens/s. MoE especializado en código, 256k de contexto: ideal como asistente de desarrollo local.
GLM 4.7 Flash Q8 (MLX)
≈32 GB en RAM (MoE 30B-A3B, licencia MIT). 40-48 tokens/s. Excelente para agentes y llamadas a herramientas, con una respuesta muy rápida.
Granite 4.2 30B Q8 (MLX)
≈33 GB en RAM. 30-38 tokens/s. Orientado al uso profesional y empresarial, con un consumo moderado de tokens y estable en sesiones largas.
Mistral Small 24B FP16 (MLX)
≈48 GB. 18-22 tokens/s. Modelo denso, excelente calidad FR, especialmente bueno en síntesis documental.

#Benchmarks detallados: MLX vs Ollama vs llama.cpp

Con el mismo modelo Qwen 3.8 27B en Q8, esta es la dispersión observada entre los tres runtimes en la misma máquina M4 Max de 128 GB:

MLX 8-bit (mlx-community)
20,5 tokens/s en promedio, evaluación de prompt ~410 tokens/s
Ollama Q8_0 (Metal)
15,2 tokens/s en promedio, evaluación de prompt ~300 tokens/s.
llama.cpp sin intermediarios Q8_0
15.6 tokens/s en promedio. Ollama añade poca sobrecarga en comparación con llama.cpp.
i
Por qué MLX gana
MLX evita la conversión entre representaciones CPU y GPU y aprovecha mejor las instrucciones Metal Performance Shaders para los matmul cuantizados. La diferencia se agranda a medida que aumenta el tamaño del modelo: en modelos de 7B la diferencia es marginal, en modelos grandes de 30B+ se vuelve clara.

#M4 Max vs RTX 4090: quién gana en qué

La comparación directa: un MacBook Pro M4 Max de 128 GB (modelo sustituido por el M5 Max en Apple; hay que buscarlo de segunda mano, con precio variable) frente a un ordenador de sobremesa equipado con una RTX 4090 de 24 GB de segunda mano (precio variable, solo la GPU, sin el resto de la torre).

Modelos pequeños ≤14B Q4 (Qwen 3.5 9B, gpt-oss 20B)
La RTX 4090 gana claramente (80-120 tok/s frente a 35-60 en M4 Max). Para estos tamaños, elige la 4090 si tienes la opción.
Modelos densos 24-30B Q4 (Mistral Small, Qwen 3.8 27B)
RTX 4090 aún lidera (30-40 tok/s vs 18-22 en M4 Max), pero la diferencia se acorta.
Precisión completa Q8/FP16
El M4 Max se pone por delante en la práctica: ejecuta los mejores modelos MoE de 2026 (35B-A3B, 27B) en Q8 o FP16 en su RAM, mientras que la RTX 4090 debe bajar a Q4 o descargar parte del procesamiento en la CPU (con un rendimiento dividido por cinco).
MoE de gran tamaño (Qwen 3.6 35B-A3B)
El M4 Max destaca gracias a su gran cantidad de RAM: todo cabe en memoria, incluso en FP16. La RTX 4090 tiene que descargar parte del modelo a la RAM del sistema en cuanto se supera Q4.
Mobilidad
No hay comparación: el M4 Max aguanta ~3 h de inferencia continua con batería; la RTX 4090 recorre 0 km.
→
Umbral de decisión
¿Quieres ejecutar los mejores modelos MoE de 2026 con precisión completa (Q8/FP16) y mantener varios cargados al mismo tiempo? El M4 Max de 128 GB es el equipo portátil más rentable del mercado. ¿Buscas un modelo de 13B muy rápido? Una RTX 4090 de sobremesa cuesta la mitad y es el doble de rápida.

#Comportamiento térmico, ventiladores y autonomía de la batería

El M4 Max se calienta poco durante la inferencia en comparación con una GPU NVIDIA. Bajo carga sostenida (generación de 5 minutos con un gran MoE de 35B en Q8), los ventiladores alcanzan unas 2.800 RPM: son audibles, pero están lejos del ruido molesto de un PC para juegos. La temperatura de la CPU/GPU alcanza un máximo de unos 95 °C sin una reducción notable del rendimiento por temperatura cuando el equipo está conectado a la corriente.

Conectado a la red eléctrica (cargador de 140 W)
A plena potencia, con el máximo rendimiento. Sin límites, ventiladores a un régimen moderado.
Con batería
macOS reduce ligeramente la frecuencia de la GPU: aproximadamente el 80 % de la velocidad de generación con el equipo conectado a la corriente. Qwen 3.6 35B-A3B pasa de aproximadamente 45 a 37 tokens/s.
Autonomía de la batería durante la inferencia
MacBook Pro 16" M4 Max 100 Wh: ~3 h de inferencia continua en un gran MoE 35B, ~5 h en modelos 7B-14B, ~8 h de uso mixto chat + lectura.
Ruido de los ventiladores
Se escuchan a partir de 30 segundos de generación continua, pero son mucho más discretos que un portátil con RTX.

#Consejos para sacar el máximo partido al M4 Max

Deja el modelo cargado
El primer prompt tras la carga es lento. Usa el modo servidor (mlx_lm.server o ollama serve) para mantener el modelo en RAM durante toda la sesión.
Prioriza el formato MLX
Los modelos publicados por mlx-community en Hugging Face están optimizados para Apple Silicon. Busca el prefijo "mlx-community/" antes de cualquier otro.
Monitorea con asitop o Stats
asitop (equivalente a nvtop para Apple Silicon) muestra en tiempo real el consumo de GPU, la memoria y la potencia instantánea.
Modo de alto rendimiento
En Configuración del sistema → Batería → elegir «Alto rendimiento». Mejora marginal pero real en los modelos de 70B.
Desactiva Spotlight durante las pruebas de rendimiento
La indexación de Spotlight puede reducir la tasa de generación entre un 5 y un 10 %. mdutil -a -i off la desactiva durante una sesión.
Instalar asitop para monitorear el GPU
# Installation
pip install asitop

# Lancement (nécessite sudo pour lire les compteurs hardware)
sudo asitop
!
Sin CUDA = sin fine-tuning serio
MLX permite fine-tuning básico con LoRA, pero el ecosistema sigue muy rezagado respecto a PyTorch + CUDA. Para fine-tuning intensivo, un Mac M4 Max no es la máquina adecuada: opta por una RTX 3090/4090 o un servicio en la nube con H100.

#Para ir más allá

Tres pistas para profundizar en el tema:

Instalar Ollama en macOS
Si prefieres la simplicidad al rendimiento puro, la guía "Instalar Ollama en macOS (Apple Silicon)" cubre todas las herramientas de Metal para Ollama.
Elegir tu cuantización
Con 128 GB de RAM unificada, tienes margen para subir a Q5_K_M, Q6 o incluso FP16; la guía «Elegir la cuantización» detalla los compromisos.
Mac Studio Ultra para ir más lejos
Si los modelos MoE de 30-35B no te bastan y buscas ejecutar en local los modelos más grandes de pesos abiertos (100B a 671B), la guía «Qué LLM usar en un Mac Studio» cubre las configuraciones Ultra de hasta 512 GB.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.