Mac Studio M5 Max / M5 Ultra: prueba y opinión para la IA local
La primera máquina de consumo que ejecuta un modelo de frontera en local. Analizamos lo que importa para ejecutar LLM en local : memoria, ancho de banda, velocidad, precio — y para quién es (o no) la compra adecuada.
Actualizado el 09/10/2026
Dónde comprarlo
La configuración indicada en el botón es la que se ofrece al comprar. En un mini-PC, reserva memoria para el sistema y comprueba el motor de inferencia; macOS/MLX y CUDA no son intercambiables.
Enlaces de afiliación — QuéLLM puede percibir una comisión por las compras, sin coste adicional para ti, lo que no influye en estas recomendaciones (establecidas de forma independiente). Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.
Ficha técnica
- MemoriaM5 Max: de 36 a 128 GB · M5 Ultra: de 96 a 512 GB de memoria unificada (la opción de 512 GB llegará a finales de octubre)
- Ancho de bandaM5 Max: 460 GB/s (GPU de 32 núcleos) / 614 GB/s (GPU de 40 núcleos) · M5 Ultra: hasta 1,2 TB/s (+50 % respecto a la generación anterior)
- CálculoM5 Max: CPU de 18 núcleos, GPU de hasta 40 núcleos · M5 Ultra: CPU de 36 núcleos, GPU de 80 núcleos, Neural Engine de 32 núcleos — Neural Accelerators en cada núcleo de la GPU, Thunderbolt 5, SSD PCIe Gen 6
- ConsumoEquipo de sobremesa, refrigeración silenciosa
- Precio orientativo2 999 € (M5 Max 36 GB / 512 GB) · 6 599 € (M5 Ultra 96 GB / 1 TB) — hasta ≈ 20 000 € en 512 GB / 16 TB
- Modelo más grande36 GB: modelos de la clase 30B · 64-96 GB: 70B en Q4 · 128 GB: GPT-OSS-120B con holgura · 256 GB: Qwen3-235B (MoE) · 512 GB: MoE de vanguardia de ~600B en Q4, de la clase DeepSeek — véase la tabla de niveles
¿Para quién?
Ventajas y limitaciones
✓ Puntos fuertes
- 512 GB de memoria unificada a 1,2 TB/s: un modelo de ~600 mil millones de parámetros (Q4) cabe ÍNTEGRAMENTE en local — algo inédito fuera de los servidores
- Apple anuncia hasta 4,3× el rendimiento de IA de la generación anterior (Aceleradores neuronales por núcleo de GPU)
- macOS + MLX: el ecosistema de LLM local más optimizado en Apple (LM Studio, Ollama, mlx-lm)
- Silencioso, compacto, de bajo consumo para la capacidad que ofrece — ninguna torre con varias GPU puede alojar 512 GB de VRAM
- Thunderbolt 5 y SSD PCIe Gen 6: carga de pesos mucho más rápida
✗ Limitaciones
- La configuración de 512 GB no se enviará hasta finales de octubre de 2026 (las demás, a partir del 22/09)
- Precio de Apple: la configuración de 512 GB supera ampliamente los 10.000 € — reservada para usos profesionales serios
- Por debajo de 96 GB, un mini-PC Strix Halo de 128 GB (≈ 3 300 a 4 000 €) ofrece más memoria por euro
- Sin CUDA: el fine-tuning pesado y algunas herramientas siguen siendo más sencillos con NVIDIA
¿Qué nivel de memoria para qué modelos?
La regla: la memoria determina el tamaño del modelo que se puede cargar, y el ancho de banda determina la velocidad de generación. Las velocidades se indican como órdenes de magnitud para la generación de texto (decodificación), con cuantización Q4, mediante MLX / llama.cpp — los modelos MoE solo utilizan sus parámetros activos, de ahí sus altas velocidades de generación.
| Configuración | Ancho de banda | Lo que puede ejecutarse (Q4) | Velocidad estimada |
|---|---|---|---|
| M5 Max 36 GB | 460 GB/s | Clase 30B: Qwen3-32B, GLM-4.7-Flash | ~25-35 tok/s |
| M5 Max 64 GB | 614 GB/s (GPU 40 c.) | 70B en Q4 (~40 GB); MoE 30B-A3B muy rápidos | ~13-16 tok/s (70B) · 80+ tok/s (MoE A3B) |
| M5 Max 128 GB | 614 GB/s | 70B en Q8, GPT-OSS-120B (MXFP4), contexto largo | ~40-60 tok/s (GPT-OSS-120B) |
| M5 Ultra 96 GB | 1,2 TB/s | 70B en Q4 con margen de contexto | ~25-30 tok/s |
| M5 Ultra 256 GB | 1,2 TB/s | Qwen3-235B-A22B en Q4 (~135 GB) | ~25-35 tok/s |
| M5 Ultra 512 GB | 1,2 TB/s | MoE frontier ~600B en Q4 (clase DeepSeek, ~380-400 GB) | ~15-20 tok/s |
El prefill (lectura del prompt) se beneficia además de los Neural Accelerators de la GPU M5: históricamente, este era el punto débil de los Mac frente a las GPU NVIDIA en contextos largos.
¿M5 Max o M5 Ultra?
Le M5 Max (2 999 € con 36 GB, BTO hasta 128 GB) cubre todos los modelos de hasta 70B y los MoE de ~120B: es la opción racional para un uso exigente de desarrollo/copiloto/RAG. Elige sin falta el GPU de 40 núcleos en cuanto superes los 36 GB: el ancho de banda pasa de 460 a 614 GB/s, lo que supone un tercio más de velocidad por token.
Le M5 Ultra (6 599 € con 96 GB) solo se justifica por su memoria: con 96 GB apenas supera a un M5 Max de 128 GB más barato. Su verdadera razón de ser son los niveles 256 y 512 GB — las únicas que permiten ejecutar los MoE de 235 a ~600 mil millones de parámetros. Si no tienes un uso específico para estos modelos, el Ultra es una mala compra; si lo tienes, es el único equipo de escritorio que permite hacerlo.
Frente a las alternativas
| Máquina | Memoria | Ancho de banda | Precio | El buen uso |
|---|---|---|---|---|
| Mac Studio M5 Max | 36-128 GB | 460-614 GB/s | a partir de 2.999 € | 70B y MoE ~120B rápidos, ecosistema MLX |
| Mac Studio M5 Ultra | 96-512 GB | 1,2 TB/s | a partir de 6.599 € | MoE 235-600B: sin equivalente en equipos de sobremesa |
| Mini-PC Strix Halo | 64-128 GB | 212 GB/s | ≈ 2 000-4 000 € | La mejor relación memoria/euro (70B lento pero accesible) |
| NVIDIA DGX Spark | 128 GB | 273 GB/s | ≈ 6 100 – 6 600 € | Ecosistema CUDA obligatorio, fine-tuning |
| RTX 5090 | 32 GB | 1,79 TB/s | ≈ 5 700 € | Velocidad bruta hasta ~32B, no más allá |
En resumen: velocidad pura en modelos pequeños → GPU dedicado; capacidad máxima por euro → Strix Halo; capacidad máxima en general → M5 Ultra.
Disponibilidad: lo que hay que saber
- En venta desde el 22 de septiembre de 2026 (reservas abiertas el 25 de agosto).
- La opción de 512 GB no se envía hasta finales de octubre — haz el pedido con antelación si es la opción que buscas.
- En tiendas francesas: M5 Max 36 GB / 512 GB en Darty y M5 Max 96 GB / 512 GB en Materiel.net; las demás opciones de memoria se eligen mediante el configurador BTO del Apple Store.
- El Mac Studio M4 Max 36 GB / 512 GB ya no está disponible como producto nuevo en los comercios que recomendamos (verificado a finales de septiembre de 2026) — nuestra ficha M4 Max para comparar.
Veredicto
Preguntas frecuentes
¿Puede el Mac Studio M5 Max / M5 Ultra ejecutar un LLM 70B localmente?
36 GB: clase 30B · 64-96 GB: 70B en Q4 · 128 GB: GPT-OSS-120B con holgura · 256 GB: Qwen3-235B (MoE) · 512 GB: MoE de vanguardia de ~600B en Q4, clase DeepSeek — véase la tabla de niveles.
¿Cuánto cuesta el Mac Studio M5 Max / M5 Ultra?
2 999 € (M5 Max 36 GB / 512 GB) · 6 599 € (M5 Ultra 96 GB / 1 TB) — hasta aproximadamente 20 000 € en 512 GB / 16 TB (a partir de 2 499 $ (M5 Max) · 5 499 $ (M5 Ultra)). Los precios cambian rápidamente — revisa el precio actual mediante los enlaces de compra.
¿Para quién está pensado el Mac Studio M5 Max / M5 Ultra?
Desarrolladores y creadores que trabajan con macOS y buscan ejecutar grandes LLM en un equipo de escritorio: desde la clase 30B (36 GB) hasta los MoE de frontera de ~600B en Q4 (512 GB).
¿Es posible ejecutar un modelo de clase DeepSeek localmente en el Mac Studio M5?
Sí, es LA novedad: con 512 GB de memoria unificada, un modelo MoE de frontera de aproximadamente 600 mil millones de parámetros cuantizado en Q4 (~380-400 GB de pesos) cabe por completo, con una generación estimada de 15-20 tok/s gracias a la arquitectura MoE (solo se leen los parámetros activos en cada token). Véase también nuestra guía de DeepSeek V4 Flash.
¿Se puede seguir optando por el Mac Studio M4 Max en lugar del M5?
Ya no se vende nuevo en nuestras tiendas asociadas: el M4 Max 36 GB / 512 GB, vendido en liquidación a 2 219 € durante el verano, ya no está en stock a finales de septiembre de 2026. El M5 Max toma el relevo a 2 999 €: mayor ancho de banda, Neural Accelerators y opciones de memoria de hasta 128 GB que el M4 Max ya no ofrece.
¿Por qué la memoria unificada supera a una GPU para los modelos grandes?
Una GPU dedicada tiene un límite de 32 GB de VRAM (RTX 5090): por encima de esa capacidad, hay que descargar parte del modelo a la RAM a través del bus PCIe y la velocidad cae drásticamente. La memoria unificada de Apple da a la GPU acceso directo a la totalidad de los 96-512 GB: el modelo entero sigue funcionando con todo el ancho de banda disponible. Es más lenta que una VRAM GDDR7 de igual capacidad, pero es la única solución de escritorio que permite «alojar» modelos gigantes.