Avanzado 13 minMac Studio

¿Qué LLM en Mac Studio (M2 / M3 / M4 Ultra, 64–512 GB)? ?

El Mac Studio (M2 Ultra, M3 Ultra, M4 Max) es en 2026 el único equipo de consumo del mundo capaz de ejecutar localmente modelos de más de 200 mil millones de parámetros. El M3 Ultra de 512 GB (lanzado a principios de 2025 y sustituido a finales de septiembre de 2026 por el M5 Ultra) llevó la memoria unificada hasta los 512 GB por unos 11 000 €, suficiente para Llama 4 Maverick 402B en Q4 o DeepSeek V3 671B en Q4. Esta guía detalla cada configuración y sus casos de uso.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto → · Nuestra ficha Mac Studio M5 Max →

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en macOS 14+
Hardware recomendado

Alternativa de compra para esta guía: Mac Studio M5 Max (36 GB / 512 GB).

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre Mac Studio M5 Max (36 GB / 512 GB) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#Mac Studio en 2026

Mac Studio M2 Ultra (2023)
24 núcleos CPU + 60 o 76 núcleos GPU, 800 GB/s, RAM de 64/128/192 GB. Sigue disponible de segunda mano a partir de 2800 €.
Mac Studio M4 Max (2025)
16 núcleos de CPU + 40 núcleos de GPU, 546 GB/s, RAM de 36 a 128 GB. Sustituye al M2 Max. Apple ya no lo vende nuevo: fue reemplazado a finales de septiembre de 2026 por el M5 Max (a partir de 2 999 €).
Mac Studio M3 Ultra (2025)
28 núcleos de CPU + 60 u 80 núcleos de GPU, 800 GB/s, RAM de 96/256/512 GB. El monstruo. Se vendía desde 4499 € (96 GB) hasta 11 299 € (512 GB) hasta la llegada del M5 Ultra; a finales de septiembre de 2026 ya no figuraba en el catálogo de Apple (de segunda mano o unidades restantes en stock).
Consumo
15 W en reposo, 70-130 W durante la inferencia según la configuración. El M3 Ultra de 512 GB alcanza picos de ~150 W con un modelo de 405B.
→
La tarjeta de memoria es el verdadero producto
El Mac Studio M3 Ultra no es solo un ordenador rápido: es la única máquina para el gran público que ofrece 512 GB de RAM a los que puede acceder la GPU. Ningún PC, ni siquiera uno de 20.000 €, lo ofrece de forma nativa. Para quien quiera ejecutar modelos de 400B o más en local, no hay alternativa.

#1. M2 Ultra vs M3 Ultra vs M4 Max

M4 Max
Modelo de entrada del Mac Studio. 546 GB/s, 128 GB como máximo. Mejor que un MBP M4 Max: sin throttling, más barato (formato de sobremesa).
M2 Ultra
Primera generación Ultra. 800 GB/s, hasta 192 GB. De segunda mano entre 2800 y 4500 €. Sigue siendo competitivo para 70B-123B.
M3 Ultra
Último Ultra (2025). 800 GB/s igual que el M2 Ultra, pero arquitectura M3 (+20 % en la práctica). 96 a 512 GB de RAM. Para quienes quieren superar los 200B.
!
¿Por qué no hay M4 Ultra en 2026?
Apple no ha lanzado un M4 Ultra. La gama M4 llega hasta el Max. Para un Ultra, había que optar por el M3 Ultra (marzo de 2025), antes de la llegada del M5 Ultra, disponible en el catálogo de Apple desde 6 599 € a finales de septiembre de 2026.

#2. ¿Hasta qué punto se puede exprimir la RAM?

96 GB (M3 Ultra base)
4499 € en el catálogo del M3 Ultra, que ya no se vende nuevo (M5 Ultra 96 GB: 6 599 €). Ejecuta gpt-oss 120B (MXFP4, 63 GB) a ~50 tok/s y los MoE ~30B (Qwen 3.6 35B-A3B) a ~70 tok/s, con margen para un contexto largo. Punto óptimo para grandes MoE hasta ~120B.
256 GB (M3 Ultra + 256)
7299 € en el catálogo del M3 Ultra; ya no se vende nuevo. Permite ejecutar Llama 4 Maverick 402B Q4 (230 GB) a ~34 tok/s y DeepSeek V3 671B Q2 (~240 GB). Para quien quiere modelos de 400B o más.
512 GB (máximo del M3 Ultra)
11 299 € en el catálogo del M3 Ultra, que ya no se vende nuevo (M5 Ultra 512 GB: finales de octubre de 2026). DeepSeek V3 671B Q4 (380 GB) cabe, Qwen3-235B-A22B en Q8, contexto de 128k+ en los MoE grandes. Terreno de investigación e I+D.
192 GB (M2 Ultra max)
Carga Qwen3-235B-A22B Q4 (133 GB) y Maverick 402B en Q3. Equivalente funcional al M3 Ultra de 256 GB, pero un poco más barato de ocasión. Buen equilibrio.

#3. Modelos exclusivos de Ultra

Modelos que solo puede cargar cómodamente un Mac Studio Ultra
ModeloQuantRAM requeridaM2 Ultra 192M3 Ultra 256M3 Ultra 512
gpt-oss 120BMXFP463 GB✓ 42 t/s✓ 50 t/s✓ 50 t/s
Qwen3-235B-A22BQ4_K_M133 GB✓ 26 t/s✓ 30 t/s✓ 30 t/s
Llama 4 Maverick 402BQ4_K_M230 GB—✓ 34 t/s✓ 34 t/s
Llama 4 Maverick 402BQ8_0410 GB——✓ 22 t/s
DeepSeek V3 671BQ2_K240 GB—✓ 20 t/s✓ 20 t/s
DeepSeek V3 671BQ4_K_M380 GB——✓ 16 t/s

#4. Benchmarks 120B, 235B, 671B

Órdenes de magnitud, Mac Studio M3 Ultra con GPU de 80 núcleos y 512 GB (llama.cpp Metal, contexto 16k)
ModeloQ4_K_MQ5_K_MQ6_KFlash Attn 16k
gpt-oss 120B50 t/s——48 t/s
Qwen3-235B-A22B30 t/s28 t/s26 t/s27 t/s
Llama 4 Maverick 402B34 t/s30 t/s28 t/s31 t/s
DeepSeek V3 671B16 t/s14 t/s—15 t/s

#5. Configuración de la estación de trabajo LLM

Configuración del Mac Studio M3 Ultra de 512 GB
# Ollama + optimisations max
brew install --cask ollama

launchctl setenv OLLAMA_FLASH_ATTENTION 1
launchctl setenv OLLAMA_KV_CACHE_TYPE q8_0
launchctl setenv OLLAMA_NUM_PARALLEL 4
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"

# Relever mémoire GPU à 480 Go (sur 512 Go)
sudo sysctl iogpu.wired_limit_mb=491520
echo "iogpu.wired_limit_mb=491520" | sudo tee -a /etc/sysctl.conf

brew services start ollama

# Pour DeepSeek V3 671B : passer par llama.cpp maison
git clone https://github.com/ggerganov/llama.cpp && cd llama.cpp
make GGML_METAL=1 LLAMA_METAL_EMBED_LIBRARY=1

# Lancement
./build/bin/llama-server \
  -m ./models/DeepSeek-V3-671B-Q4_K_M.gguf \
  -ngl 99 -fa -c 16384 \
  -ctk q8_0 -ctv q8_0 \
  --host 0.0.0.0 --port 8080

#6. DeepSeek V3 671B en M3 Ultra 512 GB

Es el caso de uso estrella del Mac Studio de 512 GB. El modelo ocupa 380 GB en Q4_K_M, cabe en la RAM de la configuración de 512 GB y funciona con un contexto de 16k a ~16 tok/s (MoE, ~37B de parámetros activos de un total de 671B). Calidad cercana a la de los mejores modelos propietarios en la mayoría de las tareas.

El kit Mac

Sabes para qué modelos está pensado un Mac Studio. El kit Mac proporciona la tabla de referencia por chip y por cantidad de memoria (cap. 4), el cálculo del presupuesto de memoria con contextos largos (cap. 5) y la puesta en marcha de Ollama en segundo plano (cap. 7).

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j
Descarga
Aproximadamente 380 GB a través de Hugging Face. Planifica entre 4 y 8 horas según tu conexión.
Tiempo de carga
~60 segundos la primera vez (SSD → RAM). Instantáneo después siempre que el modelo permanezca en memoria.
Consumo en inferencia
~150 W. Se calienta hasta 70-75 °C. Ventilador audible pero no ruidoso (con un nivel de ruido muy inferior al de un PC equivalente).
¿Cuándo vale la pena?
I+D, equipos que quieren un modelo de vanguardia 100 % sin conexión, pruebas comparativas internas, conjuntos de datos sensibles. Para producción, la API en la nube es más económica.

#Mac Studio vs PC con 2× RTX 5090

Precio 2026
Mac Studio M3 Ultra de 512 GB: ~11 300 € en catálogo hasta septiembre de 2026; ya no se vende nuevo (M5 Ultra de 512 GB anunciado a finales de octubre). PC con 2× RTX 5090 + plataforma: ≈ 15 000 €.
Memoria útil para LLM
Mac: 512 GB de memoria unificada. PC: 2 × 32 GB de VRAM = 64 GB. Para modelos de 400B+ (Maverick 402B, DeepSeek 671B), el PC simplemente no puede cargar el modelo.
Velocidad con un modelo de ~30B (Qwen 3.6 35B-A3B)
PC con dos 5090: ~120 tok/s (CUDA, cabe en VRAM). Mac M3 Ultra: ~70 tok/s. El PC tiene ventaja con lo que cabe en VRAM.
Velocidad en DeepSeek 671B / Maverick 402B
Mac: 16-34 tok/s (MoE). PC: imposible sin descargar una gran parte del procesamiento en la CPU (< 2 tok/s).
Consumo
Mac Studio: 150 W en pico. PC con 2× 5090: 900 W máximo. Asegúrate de multiplicar por 3 el costo eléctrico del lado del PC.
Ruido
Mac: ruido leve pero audible. PC con 2× 5090: muy ruidoso (ventiladores de las GPU a tope).
Veredicto
El Mac Studio gana en capacidad (modelos 200B+) y eficiencia. El PC gana en velocidad pura en modelos que caben en VRAM (≤ ~30 GB). Elige según tu perfil de modelos objetivo.

#Preguntas frecuentes

¿Qué Mac Studio para gpt-oss 120B?+
El modelo ocupa 63 GB en MXFP4: se necesita como mínimo un Mac Studio de 96 GB: un M3 Ultra de 96 GB de segunda mano o, si lo compras nuevo, un M5 Max de 96 GB o un M5 Ultra de 96 GB (6 599 €). Un M2 Ultra de 64 GB no deja suficiente margen para el contexto. Calcula unos 50 tok/s en un M3 Ultra, con espacio para un contexto largo de 128k.
¿El Mac Studio M3 Ultra 512 GB vale 11 000 €?+
Para un investigador, un equipo de I+D o una empresa que trata datos sensibles que no deben enviarse a la nube: sin duda. Ningún competidor puede ejecutar localmente Llama 4 Maverick 402B o DeepSeek 671B a ese precio. Para un particular, probablemente está sobredimensionado: un Mac Studio de 128 GB (M4 Max de segunda mano o M5 Max nuevo) basta para el 95 % de los usos.
¿Mac Studio M3 Ultra de 256 GB o 512 GB?+
A los precios del catálogo del M3 Ultra (que ya no se vende nuevo): 256 GB (7299 €) si tu objetivo máximo es Llama 4 Maverick 402B Q4 (230 GB) o DeepSeek V3 Q2. 512 GB (11299 €) si deseas Maverick en Q8 o DeepSeek V3 Q4 (380 GB). La diferencia de 4000 € solo se justifica si realmente superas los 400B.
¿Se puede colocar un Mac Studio en un rack de servidores?+
Sí, existen soluciones de rack de 19 pulgadas que alojan de 2 a 4 Mac mini/Studio. Marcas: Sonnet, MacStadium. Resultan útiles si alojas un clúster LLM para un equipo.
¿Es mejor el Mac Studio M4 Max que un MBP M4 Max?+
Mismo chip, mismo rendimiento. Mac Studio gana en precio (no hay que pagar pantalla, teclado ni batería) y por la ausencia total de throttling: es posible mantener la inferencia de forma sostenida las 24 horas del día, los 7 días de la semana. MBP gana en portabilidad. Para usarlo en un puesto fijo, Studio sin dudar.
¿Cuál es la vida útil esperada de un Mac Studio en inferencia 24/7?+
Apple no comunica una cifra oficial, pero las experiencias de la comunidad indican entre 5 y 8 años sin problemas de hardware en inferencia continua. El componente con mayor riesgo es el SSD (resistencia a las escrituras), pero los modelos LLM se leen y rara vez se escriben — desgaste mínimo del SSD.

Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.