Herramienta · Apple Silicon M1 a M6
¿Qué LLM puede ejecutarse en mi Mac ?
Elige tu chip y tu memoria: la herramienta enumera los modelos del catálogo que caben, con la cuantización que debes usar y la velocidad que puedes esperar.
Tu Mac
Cargando el catálogo…
Lo que puedes ejecutar según la memoria de tu Mac
La memoria unificada se comparte entre macOS y los modelos. Por defecto, la GPU puede utilizar aproximadamente dos tercios de esa memoria cuando el total es de hasta 32 GB, y tres cuartos cuando supera esa cantidad. Sugerencia: el modelo más grande y más reciente que quepa en Q4 con un contexto de 8K.
| Memoria | Utilizable | Sugerencia (Q4) |
|---|---|---|
| 8 GB | ≈ 5,4 GB | LFM2.5 7B · clasificación para 8 GB |
| 16 GB | ≈ 11 GB | Nemotron 3 Super 12B · clasificación para 16 GB |
| 24 GB | ≈ 16 GB | Devstral Small 2 24B · clasificación de 24 GB |
| 32 GB | ≈ 21 GB | Laguna XS.2 · clasificación de 32 GB |
| 36 GB | ≈ 27 GB | Qwen 3.6 35B-A3B |
| 48 GB | ≈ 36 GB | Qwen 3.6 35B-A3B · clasificación para 48 GB |
| 64 GB | ≈ 48 GB | Nemotron 3 Puzzle 75B-A9B · clasificación 64 GB |
| 96 GB | ≈ 72 GB | Laguna S 2.1 · clasificación de 96 GB |
| 128 GB | ≈ 96 GB | Mistral Medium 3.5 128B · clasificación para 128 GB |
| 192 GB | ≈ 144 GB | MiniMax-M2.7 |
| 256 GB | ≈ 192 GB | GLM 5.3 Flash 320B-A18B |
| 512 GB | ≈ 384 GB | Nemotron 3 Ultra (BF16) |
La velocidad depende del chip
Con cada palabra generada, el Mac vuelve a leer todo el modelo en memoria: el ancho de banda determina, por tanto, el límite de velocidad. Con la misma cantidad de memoria, un chip Max o Ultra es varias veces más rápido que un chip básico.
| Chip | Ancho de banda | Memorias propuestas |
|---|---|---|
| M1 | 68 GB/s | 8, 16 GB |
| M1 Pro | 200 GB/s | 16, 32 GB |
| M1 Max | 400 GB/s | 32, 64 GB |
| M1 Ultra | 800 GB/s | 64, 128 GB |
| M2 | 100 GB/s | 8, 16, 24 GB |
| M2 Pro | 200 GB/s | 16, 32 GB |
| M2 Max | 400 GB/s | 32, 64, 96 GB |
| M2 Ultra | 800 GB/s | 64, 128, 192 GB |
| M3 | 100 GB/s | 8, 16, 24 GB |
| M3 Pro | 150 GB/s | 18, 36 GB |
| M3 Max | 300 a 400 GB/s | 36, 48, 64, 96, 128 GB |
| M3 Ultra | 819 GB/s | 96, 256, 512 GB |
| M4 | 120 GB/s | 16, 24, 32 GB |
| M4 Pro | 273 GB/s | 24, 48, 64 GB |
| M4 Max | 410 a 546 GB/s | 36, 48, 64, 128 GB |
| M5 | 153 GB/s | 16, 24, 32 GB |
| M5 Pro | 307 GB/s | 24, 48, 64 GB |
| M5 Max | 460 a 614 GB/s | 36, 48, 64, 96, 128 GB |
| M5 Ultra | 1200 GB/s | 96, 256, 512 GB |
| M6 | 170 GB/s | 16, 24, 32 GB |
Dos valores: la versión con menos núcleos de GPU (y menos memoria) tiene un ancho de banda menor. Fuentes: fichas técnicas de Apple; M5 y M6: nuestras fichas Mac Studio M5 et Mac mini M6.
Preguntas frecuentes
¿Puede un Mac con 8 GB ejecutar un LLM?
Sí, pero solo modelos pequeños: aproximadamente 5 GB están disponibles para los modelos, lo que deja espacio para un modelo de 3 a 4 mil millones de parámetros en Q4 (Qwen 3 4B, Gemma 3 4B). A partir de 16 GB, los modelos de 7-8B pueden ejecutarse con comodidad.
¿Qué parte de la memoria unificada puede usar el GPU?
Por defecto, macOS reserva aproximadamente un tercio de la memoria para el sistema en los Mac de hasta 32 GB, y un cuarto en los de mayor capacidad. Un Mac de 24 GB ofrece, por tanto, aproximadamente 16 GB para los modelos; uno de 96 GB, aproximadamente 72 GB. El comando sysctl iogpu.wired_limit_mb permite aumentar este límite, dejando suficiente memoria para macOS.
¿Por qué dos Macs con la misma memoria no tienen la misma velocidad?
Porque la velocidad de generación depende principalmente del ancho de banda de la memoria: 120 GB/s en un M4, 273 GB/s en un M4 Pro y 546 GB/s en un M4 Max. Con cada palabra, la máquina vuelve a leer todo el modelo. Por tanto, un M4 Max va aproximadamente 4 veces más rápido que un M4 con un modelo que cabe en ambos.
¿MLX, Ollama o LM Studio en Mac?
Funcionan los tres. MLX, el framework de Apple, suele ser el más rápido en Apple Silicon; LM Studio lo ofrece con una interfaz gráfica; Ollama es el más sencillo en línea de comandos y se integra con muchas herramientas.