¿Qué LLM en iMac M4 (16 / 24 / 32 GB)? ?
El iMac M4 ejecuta cómodamente modelos de 8 a 14 mil millones de parámetros en Q4: su chip M4 ofrece 120 GB/s de ancho de banda de memoria, y una medición pública indica 24 tokens por segundo en un modelo de 7B en Q4_0 con la GPU de 10 núcleos. La memoria unificada (16, 24 o 32 GB) fija el tamaño máximo: 16 GB para un 14B, 24 GB para un 24B lento, 32 GB para un 30B aún más lento.
Un iMac es ante todo una pantalla; para la IA local, es sobre todo un chip M4 y una cantidad de memoria unificada que no podrás cambiar después. Esta guía cuantifica qué permite ejecutar cada configuración, a qué velocidad según las mediciones públicas y en qué casos un Mac mini es la mejor compra.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Para esta configuración: iMac M4 — 16 GB / 256 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#Lo que hace un iMac M4 para la IA local
El iMac M4 ejecuta bien modelos de 8 a 14 mil millones de parámetros y admite modelos más grandes a velocidad reducida. Tres cifras resumen lo esencial. El chip M4 ofrece 120 GB/s de ancho de banda de memoria según la ficha de Apple, lo que supone un límite teórico de unos 31 tokens por segundo con un modelo de 7B en Q4_0. La medición pública del repositorio llama.cpp en un M4 con GPU de 10 núcleos da 24,11 tokens por segundo en generación, es decir, el 77 % de ese límite. Por último, la memoria unificada va de 16 a 32 GB y se elige al comprar: por sí sola determina el tamaño de modelo posible. Lo que le falta a este iMac es ancho de banda, no capacidad.
- Chip
- Apple M4; la ficha Apple no ofrece variante Pro ni Max para el iMac.
- Ancho de banda
- 120 GB/s, independientemente de la configuración.
- Memoria unificada
- 16 GB de serie; 24 GB opcionales en todas las versiones, 32 GB en el modelo de 4 puertos.
- Pantalla
- 24 pulgadas 4,5K (4480 × 2520), por lo que una GPU más grande aporta poco: el límite es la memoria.
- Precio
- No indicado aquí: Apple los modifica; ver la página de hardware del sitio.
#Las configuraciones reales: dos modelos, no tres
La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
La página de Apple distingue dos familias. El modelo de 2 puertos tiene una CPU de 8 núcleos y una GPU de 8 núcleos, con 16 GB de memoria ampliable a 24 GB. El modelo de 4 puertos tiene una CPU de 10 núcleos y una GPU de 10 núcleos, con 16 GB ampliables a 24 o 32 GB. El ancho de banda de 120 GB/s es idéntico. Un error común, presente en la versión anterior de esta página, es creer que aún existe una configuración de 8 GB: la memoria base es de 16 GB. Para un LLM, lo importante es, por tanto, elegir el modelo de 4 puertos si quieres 32 GB.
| Versión | GPU | Memoria unificada | Ancho de banda |
|---|---|---|---|
| 2 puertos | 8 núcleos | 16 GB, opción 24 GB | 120 GB/s |
| 4 puertos | 10 núcleos | 16 GB, con opciones de 24 y 32 GB | 120 GB/s |
Para la generación de texto, la diferencia entre 8 y 10 núcleos de GPU probablemente sea pequeña: la velocidad depende del ancho de banda, que es idéntico. No hay ninguna medición pública en la tabla de referencia para la variante de 8 núcleos, por lo que esta afirmación sigue siendo una hipótesis. Si dudas, invierte en memoria antes que en núcleos.
#16, 24 o 32 GB: el presupuesto de memoria
En un Mac, la memoria se comparte entre el sistema y la GPU, y macOS solo deja una fracción para la GPU. El ajuste iogpu.wired_limit_mb vale 0 por defecto, lo que significa que el núcleo deduce el límite a partir de la memoria instalada. En un Mac de 32 GB medido por ModelPiper, Metal ofrecía 24,96 GiB a la GPU, es decir, el 78 % de la memoria. Se suele citar el 75 %. Para un iMac, calcula por tanto unos 11 a 12 GB disponibles para la GPU en un equipo de 16 GB, 17 a 18 GB en uno de 24 GB y 24 a 25 GB en uno de 32 GB: son estimaciones que debes comprobar en tu máquina con el comando sysctl iogpu.wired_limit_mb y la herramienta Metal descrita por ModelPiper.
| Configuración | Memoria que puede utilizar la GPU | El modelo más grande que resulta razonable usar |
|---|---|---|
| 16 GB | ≈ 11 a 12 GB | Un 14B en Q4 (≈ 9 GB), contexto medio |
| 24 GB | ≈ 17 a 18 GB | Un 24B en Q4 (≈ 14 GB), contexto corto |
| 32 GB | ≈ 24 a 25 GB | Un modelo de 30B en Q4 (≈ 17 a 18 GB), contexto medio |
Para superar estos límites, es posible aumentar la parte asignada a la GPU. La guía sobre la optimización de los Mac Apple Silicon detalla este ajuste y sus riesgos; no volvemos a explicarlo aquí.
- Sacar el máximo partido a un Mac Apple Silicon: ajustes de macOS
- Calculadora de memoria para un modelo y un contexto dados
#¿Qué modelos para qué memoria?
Los pesos en Q4 a continuación provienen del catálogo QuelLLM. Suponen que el modelo cabe en la memoria usable de la tabla anterior, incluyendo contexto. La columna «fluidez» aplica el límite de 120 GB/s a cada modelo: son órdenes de magnitud calculados, no mediciones.
| Modelo | Tamaño del modelo | Configuración mínima | Fluidez esperada en M4 |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | 16 GB | Fluido (aproximadamente 15 tokens/s) |
| Gemma 4 12B | ≈ 7 GB | 16 GB | Correcto (aproximadamente 13 tokens/s) |
| Phi-4 14B | ≈ 9 GB | 16 GB | Correcto (aproximadamente 10 tokens/s) |
| gpt-oss 20B | ≈ 13 GB | 24 GB | Variable (MoE: más rápido que un denso de 20B) |
| Devstral Small 2 24B | ≈ 14 GB | 24 GB | Lento (aproximadamente 6 a 7 tokens/s) |
| Gemma 4 31B | ≈ 18 GB | 32 GB | Muy lento (aproximadamente 5 tokens/s) |
La regla es no confundir «cabe en memoria» con «resulta agradable de usar». Un modelo denso de 24B en un M4 básico sigue produciendo texto legible, pero es lento, a unas pocas palabras por segundo, mientras que un modelo de mezcla de expertos (MoE) como gpt-oss 20B o Gemma 4 26B-A4B solo lee unos pocos miles de millones de parámetros por token, por lo que supera a un modelo denso de tamaño comparable. Para un iMac de 24 o 32 GB, un MoE suele ser la mejor opción.
Con 24 GB, suele plantearse una elección: un modelo de 12B en Q8 (aproximadamente 13 GB) o uno de 24B en Q4 (aproximadamente 14 GB). Ambos ocupan casi la misma memoria, por lo que generan a una velocidad similar, alrededor de 7 tokens por segundo según el límite de ancho de banda. El segundo ofrece mayor capacidad de razonamiento; el primero, una fidelidad más cercana al modelo original. A igual ancho de banda, es el tamaño del modelo en gigabytes lo que determina la velocidad de generación, no su número de parámetros.
#Velocidad: el ancho de banda es determinante
La única medición pública de referencia es la tabla del repositorio de llama.cpp sobre Apple Silicon, que prueba un LLaMA 7B en Q4_0. Para un M4 con GPU de 10 núcleos y 120 GB/s, indica 221,29 tokens por segundo en lectura del prompt y 24,11 en generación. Un M4 Pro con 273 GB/s y GPU de 16 núcleos alcanza 49,64 en generación, es decir, un poco más del doble. Esta proporción es cercana a la de los anchos de banda (2,3 veces): es señal de que la generación depende de la memoria, no del número de núcleos de la GPU.
| Chip | GPU | Ancho de banda | Generación tg (t/s) |
|---|---|---|---|
| M4 (iMac de 4 puertos) | 10 núcleos | 120 GB/s | 24,11 |
| M4 Pro (Mac mini M4 Pro) | 16 núcleos | 273 GB/s | 49,64 |
Estas mediciones datan de una versión temprana de llama.cpp; las versiones recientes y MLX pueden ofrecer mejores resultados. Tómalas como un orden de magnitud. La versión anterior de esta página anunciaba entre 28 y 31 tokens por segundo para un 9B en Q5: esa cifra superaría el límite de 120 GB/s para un modelo de ese tamaño, y la hemos retirado.
#Tres usos realistas según la memoria
Un presupuesto de memoria se entiende mejor aplicado a un uso concreto. En cada caso, suma el peso del modelo, la caché del contexto y los otros programas abiertos, y compara el total con la memoria utilizable de la tabla anterior. La calculadora del sitio hace esta suma por ti; quédate solo con la lógica.
| Uso | Lo que se debe cargar | Configuración mínima |
|---|---|---|
| Asistente de escritorio: resúmenes, correos, traducción | Un 8B o un 12B en Q4, contexto de varios miles de tokens | 16 GB |
| Búsqueda en tus documentos (RAG) | Un modelo de generación de 12B, un modelo de embeddings y un reranker cargados juntos | 24 GB para mantener un margen |
| Ayuda con el código en proyectos medianos | Un 24B (Devstral Small 2) o un MoE de 20 a 26B, contexto largo | 24 GB, 32 GB si el contexto crece |
En cuanto al calor y al ruido, no hemos encontrado ninguna medición pública de un iMac M4 bajo una carga sostenida de LLM y, por tanto, no afirmamos nada sobre su ventilador. La única referencia fiable es el uso: si la generación dura horas, vigila la frecuencia y la temperatura en el Monitor de Actividad y mantén un contexto razonable.
#Puesta en marcha
- 01Verificar la memoriaAnota la memoria de tu iMac en el menú Apple y luego en À propos de ce Mac. Esa memoria determina la lista de modelos posibles.
- 02Instalar Ollama o LM StudioOllama acelera los cálculos en GPUs de Apple a través de la API Metal. LM Studio ofrece una interfaz gráfica bien adaptada a pantallas grandes.
- 03Cargar un modelo adecuadoElige un modelo de la tabla según tu memoria, en Q4_K_M, y ejecútalo con ollama run.
- 04Controlar el uso de la GPUUsa ollama ps para comprobar que el modelo esté cargado en la GPU y luego Monitor de Actividad para seguir la presión de memoria.
- 05Limitar el contextoCon 16 GB, mantén un contexto de unos pocos miles de tokens para evitar que el sistema recurra a la memoria de intercambio.
#iMac M4 o Mac mini M4: el verdadero criterio
El Mac mini M4 utiliza el mismo chip y el mismo ancho de banda; con la misma cantidad de memoria, el iMac no es más lento. Lo que cambia es la pantalla integrada, que no se puede sustituir, y la ausencia de una variante Pro: el iMac alcanza como máximo 32 GB y 120 GB/s, mientras que el Mac mini M4 Pro llega a 273 GB/s según la misma discusión de referencia. Si tu objetivo es un modelo de 24B o más a una velocidad adecuada, el ancho de banda del Mac mini M4 Pro duplica la velocidad de procesamiento; si buscas un asistente de escritorio con un modelo de 8 a 14B, el iMac es equivalente.
| Criterio | iMac M4 | Mac mini M4 / M4 Pro |
|---|---|---|
| Ancho de banda | 120 GB/s | 120 GB/s (M4); 273 GB/s (M4 Pro) |
| Memoria máxima | 32 GB | Ver la página del Mac mini |
| Pantalla | Integrado 4,5K de 24 pulgadas | Elegir por separado |
| Velocidad medida 7B Q4_0 | 24,11 t/s | 24,11 t/s (M4); 49,64 t/s (M4 Pro) |
| Escalabilidad | Ninguna, memoria no reemplazable | Igual para la memoria, pantalla reemplazable |
- Mac mini M4 y M4 Pro: ¿qué LLM según la memoria?
- Hoja de especificaciones del Mac mini M4 Pro
- Ficha técnica del iMac, Apple
- Rendimiento de llama.cpp en Apple Silicon, repositorio llama.cpp
- Documentación Ollama: GPUs compatibles, incluyendo Metal
- ModelPiper: límite de memoria GPU en Mac
#Preguntas frecuentes
¿Es el iMac M4 adecuado para la IA local?+
¿16, 24 o 32 GB en un iMac M4 para un LLM?+
¿Cuál es la velocidad de un LLM en un iMac M4?+
¿Por qué no hay un iMac M4 Pro?+
¿Basta con un iMac M4 de 8 núcleos GPU para un LLM?+
¿Utiliza Ollama la tarjeta gráfica del iMac M4?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.