¿Qué LLM en Mac Studio (M2 / M3 / M4 Ultra, 64–512 GB)? ?
El Mac Studio (M2 Ultra, M3 Ultra, M4 Max) es en 2026 el único equipo de consumo del mundo capaz de ejecutar localmente modelos de más de 200 mil millones de parámetros. El M3 Ultra de 512 GB (lanzado a principios de 2025 y sustituido a finales de septiembre de 2026 por el M5 Ultra) llevó la memoria unificada hasta los 512 GB por unos 11 000 €, suficiente para Llama 4 Maverick 402B en Q4 o DeepSeek V3 671B en Q4. Esta guía detalla cada configuración y sus casos de uso.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto → · Nuestra ficha Mac Studio M5 Max →
Alternativa de compra para esta guía: Mac Studio M5 Max (36 GB / 512 GB).
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
¿Por qué esta elección? Nuestra ficha completa sobre Mac Studio M5 Max (36 GB / 512 GB) →
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#Mac Studio en 2026
- Mac Studio M2 Ultra (2023)
- 24 núcleos CPU + 60 o 76 núcleos GPU, 800 GB/s, RAM de 64/128/192 GB. Sigue disponible de segunda mano a partir de 2800 €.
- Mac Studio M4 Max (2025)
- 16 núcleos de CPU + 40 núcleos de GPU, 546 GB/s, RAM de 36 a 128 GB. Sustituye al M2 Max. Apple ya no lo vende nuevo: fue reemplazado a finales de septiembre de 2026 por el M5 Max (a partir de 2 999 €).
- Mac Studio M3 Ultra (2025)
- 28 núcleos de CPU + 60 u 80 núcleos de GPU, 800 GB/s, RAM de 96/256/512 GB. El monstruo. Se vendía desde 4499 € (96 GB) hasta 11 299 € (512 GB) hasta la llegada del M5 Ultra; a finales de septiembre de 2026 ya no figuraba en el catálogo de Apple (de segunda mano o unidades restantes en stock).
- Consumo
- 15 W en reposo, 70-130 W durante la inferencia según la configuración. El M3 Ultra de 512 GB alcanza picos de ~150 W con un modelo de 405B.
#1. M2 Ultra vs M3 Ultra vs M4 Max
- M4 Max
- Modelo de entrada del Mac Studio. 546 GB/s, 128 GB como máximo. Mejor que un MBP M4 Max: sin throttling, más barato (formato de sobremesa).
- M2 Ultra
- Primera generación Ultra. 800 GB/s, hasta 192 GB. De segunda mano entre 2800 y 4500 €. Sigue siendo competitivo para 70B-123B.
- M3 Ultra
- Último Ultra (2025). 800 GB/s igual que el M2 Ultra, pero arquitectura M3 (+20 % en la práctica). 96 a 512 GB de RAM. Para quienes quieren superar los 200B.
#2. ¿Hasta qué punto se puede exprimir la RAM?
- 96 GB (M3 Ultra base)
- 4499 € en el catálogo del M3 Ultra, que ya no se vende nuevo (M5 Ultra 96 GB: 6 599 €). Ejecuta gpt-oss 120B (MXFP4, 63 GB) a ~50 tok/s y los MoE ~30B (Qwen 3.6 35B-A3B) a ~70 tok/s, con margen para un contexto largo. Punto óptimo para grandes MoE hasta ~120B.
- 256 GB (M3 Ultra + 256)
- 7299 € en el catálogo del M3 Ultra; ya no se vende nuevo. Permite ejecutar Llama 4 Maverick 402B Q4 (230 GB) a ~34 tok/s y DeepSeek V3 671B Q2 (~240 GB). Para quien quiere modelos de 400B o más.
- 512 GB (máximo del M3 Ultra)
- 11 299 € en el catálogo del M3 Ultra, que ya no se vende nuevo (M5 Ultra 512 GB: finales de octubre de 2026). DeepSeek V3 671B Q4 (380 GB) cabe, Qwen3-235B-A22B en Q8, contexto de 128k+ en los MoE grandes. Terreno de investigación e I+D.
- 192 GB (M2 Ultra max)
- Carga Qwen3-235B-A22B Q4 (133 GB) y Maverick 402B en Q3. Equivalente funcional al M3 Ultra de 256 GB, pero un poco más barato de ocasión. Buen equilibrio.
#3. Modelos exclusivos de Ultra
| Modelo | Quant | RAM requerida | M2 Ultra 192 | M3 Ultra 256 | M3 Ultra 512 |
|---|---|---|---|---|---|
| gpt-oss 120B | MXFP4 | 63 GB | ✓ 42 t/s | ✓ 50 t/s | ✓ 50 t/s |
| Qwen3-235B-A22B | Q4_K_M | 133 GB | ✓ 26 t/s | ✓ 30 t/s | ✓ 30 t/s |
| Llama 4 Maverick 402B | Q4_K_M | 230 GB | — | ✓ 34 t/s | ✓ 34 t/s |
| Llama 4 Maverick 402B | Q8_0 | 410 GB | — | — | ✓ 22 t/s |
| DeepSeek V3 671B | Q2_K | 240 GB | — | ✓ 20 t/s | ✓ 20 t/s |
| DeepSeek V3 671B | Q4_K_M | 380 GB | — | — | ✓ 16 t/s |
#4. Benchmarks 120B, 235B, 671B
| Modelo | Q4_K_M | Q5_K_M | Q6_K | Flash Attn 16k |
|---|---|---|---|---|
| gpt-oss 120B | 50 t/s | — | — | 48 t/s |
| Qwen3-235B-A22B | 30 t/s | 28 t/s | 26 t/s | 27 t/s |
| Llama 4 Maverick 402B | 34 t/s | 30 t/s | 28 t/s | 31 t/s |
| DeepSeek V3 671B | 16 t/s | 14 t/s | — | 15 t/s |
#5. Configuración de la estación de trabajo LLM
#6. DeepSeek V3 671B en M3 Ultra 512 GB
Es el caso de uso estrella del Mac Studio de 512 GB. El modelo ocupa 380 GB en Q4_K_M, cabe en la RAM de la configuración de 512 GB y funciona con un contexto de 16k a ~16 tok/s (MoE, ~37B de parámetros activos de un total de 671B). Calidad cercana a la de los mejores modelos propietarios en la mayoría de las tareas.
Sabes para qué modelos está pensado un Mac Studio. El kit Mac proporciona la tabla de referencia por chip y por cantidad de memoria (cap. 4), el cálculo del presupuesto de memoria con contextos largos (cap. 5) y la puesta en marcha de Ollama en segundo plano (cap. 7).
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
- Descarga
- Aproximadamente 380 GB a través de Hugging Face. Planifica entre 4 y 8 horas según tu conexión.
- Tiempo de carga
- ~60 segundos la primera vez (SSD → RAM). Instantáneo después siempre que el modelo permanezca en memoria.
- Consumo en inferencia
- ~150 W. Se calienta hasta 70-75 °C. Ventilador audible pero no ruidoso (con un nivel de ruido muy inferior al de un PC equivalente).
- ¿Cuándo vale la pena?
- I+D, equipos que quieren un modelo de vanguardia 100 % sin conexión, pruebas comparativas internas, conjuntos de datos sensibles. Para producción, la API en la nube es más económica.
#Mac Studio vs PC con 2× RTX 5090
- Precio 2026
- Mac Studio M3 Ultra de 512 GB: ~11 300 € en catálogo hasta septiembre de 2026; ya no se vende nuevo (M5 Ultra de 512 GB anunciado a finales de octubre). PC con 2× RTX 5090 + plataforma: ≈ 15 000 €.
- Memoria útil para LLM
- Mac: 512 GB de memoria unificada. PC: 2 × 32 GB de VRAM = 64 GB. Para modelos de 400B+ (Maverick 402B, DeepSeek 671B), el PC simplemente no puede cargar el modelo.
- Velocidad con un modelo de ~30B (Qwen 3.6 35B-A3B)
- PC con dos 5090: ~120 tok/s (CUDA, cabe en VRAM). Mac M3 Ultra: ~70 tok/s. El PC tiene ventaja con lo que cabe en VRAM.
- Velocidad en DeepSeek 671B / Maverick 402B
- Mac: 16-34 tok/s (MoE). PC: imposible sin descargar una gran parte del procesamiento en la CPU (< 2 tok/s).
- Consumo
- Mac Studio: 150 W en pico. PC con 2× 5090: 900 W máximo. Asegúrate de multiplicar por 3 el costo eléctrico del lado del PC.
- Ruido
- Mac: ruido leve pero audible. PC con 2× 5090: muy ruidoso (ventiladores de las GPU a tope).
- Veredicto
- El Mac Studio gana en capacidad (modelos 200B+) y eficiencia. El PC gana en velocidad pura en modelos que caben en VRAM (≤ ~30 GB). Elige según tu perfil de modelos objetivo.
#Preguntas frecuentes
¿Qué Mac Studio para gpt-oss 120B?+
¿El Mac Studio M3 Ultra 512 GB vale 11 000 €?+
¿Mac Studio M3 Ultra de 256 GB o 512 GB?+
¿Se puede colocar un Mac Studio en un rack de servidores?+
¿Es mejor el Mac Studio M4 Max que un MBP M4 Max?+
¿Cuál es la vida útil esperada de un Mac Studio en inferencia 24/7?+
Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.