◆ Mac — La IA local en tu Mac, a fondo — memoria unificada, MLX, el modelo adecuado para tu chip · 24 € · o todos los kits por 49 € →

Herramienta · Apple Silicon M1 a M6

¿Qué LLM puede ejecutarse en mi Mac ?

Elige tu chip y tu memoria: la herramienta enumera los modelos del catálogo que caben, con la cuantización que debes usar y la velocidad que puedes esperar.

Tu Mac

Cargando el catálogo…

Lo que puedes ejecutar según la memoria de tu Mac

La memoria unificada se comparte entre macOS y los modelos. Por defecto, la GPU puede utilizar aproximadamente dos tercios de esa memoria cuando el total es de hasta 32 GB, y tres cuartos cuando supera esa cantidad. Sugerencia: el modelo más grande y más reciente que quepa en Q4 con un contexto de 8K.

La velocidad depende del chip

Con cada palabra generada, el Mac vuelve a leer todo el modelo en memoria: el ancho de banda determina, por tanto, el límite de velocidad. Con la misma cantidad de memoria, un chip Max o Ultra es varias veces más rápido que un chip básico.

ChipAncho de bandaMemorias propuestas
M168 GB/s8, 16 GB
M1 Pro200 GB/s16, 32 GB
M1 Max400 GB/s32, 64 GB
M1 Ultra800 GB/s64, 128 GB
M2100 GB/s8, 16, 24 GB
M2 Pro200 GB/s16, 32 GB
M2 Max400 GB/s32, 64, 96 GB
M2 Ultra800 GB/s64, 128, 192 GB
M3100 GB/s8, 16, 24 GB
M3 Pro150 GB/s18, 36 GB
M3 Max300 a 400 GB/s36, 48, 64, 96, 128 GB
M3 Ultra819 GB/s96, 256, 512 GB
M4120 GB/s16, 24, 32 GB
M4 Pro273 GB/s24, 48, 64 GB
M4 Max410 a 546 GB/s36, 48, 64, 128 GB
M5153 GB/s16, 24, 32 GB
M5 Pro307 GB/s24, 48, 64 GB
M5 Max460 a 614 GB/s36, 48, 64, 96, 128 GB
M5 Ultra1200 GB/s96, 256, 512 GB
M6170 GB/s16, 24, 32 GB

Dos valores: la versión con menos núcleos de GPU (y menos memoria) tiene un ancho de banda menor. Fuentes: fichas técnicas de Apple; M5 y M6: nuestras fichas Mac Studio M5 et Mac mini M6.

Preguntas frecuentes

¿Puede un Mac con 8 GB ejecutar un LLM?

Sí, pero solo modelos pequeños: aproximadamente 5 GB están disponibles para los modelos, lo que deja espacio para un modelo de 3 a 4 mil millones de parámetros en Q4 (Qwen 3 4B, Gemma 3 4B). A partir de 16 GB, los modelos de 7-8B pueden ejecutarse con comodidad.

¿Qué parte de la memoria unificada puede usar el GPU?

Por defecto, macOS reserva aproximadamente un tercio de la memoria para el sistema en los Mac de hasta 32 GB, y un cuarto en los de mayor capacidad. Un Mac de 24 GB ofrece, por tanto, aproximadamente 16 GB para los modelos; uno de 96 GB, aproximadamente 72 GB. El comando sysctl iogpu.wired_limit_mb permite aumentar este límite, dejando suficiente memoria para macOS.

¿Por qué dos Macs con la misma memoria no tienen la misma velocidad?

Porque la velocidad de generación depende principalmente del ancho de banda de la memoria: 120 GB/s en un M4, 273 GB/s en un M4 Pro y 546 GB/s en un M4 Max. Con cada palabra, la máquina vuelve a leer todo el modelo. Por tanto, un M4 Max va aproximadamente 4 veces más rápido que un M4 con un modelo que cabe en ambos.

¿MLX, Ollama o LM Studio en Mac?

Funcionan los tres. MLX, el framework de Apple, suele ser el más rápido en Apple Silicon; LM Studio lo ofrece con una interfaz gráfica; Ollama es el más sencillo en línea de comandos y se integra con muchas herramientas.

Más herramientas gratuitas