Principiante 11 miniMac

¿Qué LLM en iMac M4 (16 / 24 / 32 GB)? ?

Respuesta directa

El iMac M4 ejecuta cómodamente modelos de 8 a 14 mil millones de parámetros en Q4: su chip M4 ofrece 120 GB/s de ancho de banda de memoria, y una medición pública indica 24 tokens por segundo en un modelo de 7B en Q4_0 con la GPU de 10 núcleos. La memoria unificada (16, 24 o 32 GB) fija el tamaño máximo: 16 GB para un 14B, 24 GB para un 24B lento, 32 GB para un 30B aún más lento.

Un iMac es ante todo una pantalla; para la IA local, es sobre todo un chip M4 y una cantidad de memoria unificada que no podrás cambiar después. Esta guía cuantifica qué permite ejecutar cada configuración, a qué velocidad según las mediciones públicas y en qué casos un Mac mini es la mejor compra.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en macOS 14+
Hardware recomendado

Para esta configuración: iMac M4 — 16 GB / 256 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#Lo que hace un iMac M4 para la IA local

El iMac M4 ejecuta bien modelos de 8 a 14 mil millones de parámetros y admite modelos más grandes a velocidad reducida. Tres cifras resumen lo esencial. El chip M4 ofrece 120 GB/s de ancho de banda de memoria según la ficha de Apple, lo que supone un límite teórico de unos 31 tokens por segundo con un modelo de 7B en Q4_0. La medición pública del repositorio llama.cpp en un M4 con GPU de 10 núcleos da 24,11 tokens por segundo en generación, es decir, el 77 % de ese límite. Por último, la memoria unificada va de 16 a 32 GB y se elige al comprar: por sí sola determina el tamaño de modelo posible. Lo que le falta a este iMac es ancho de banda, no capacidad.

Chip
Apple M4; la ficha Apple no ofrece variante Pro ni Max para el iMac.
Ancho de banda
120 GB/s, independientemente de la configuración.
Memoria unificada
16 GB de serie; 24 GB opcionales en todas las versiones, 32 GB en el modelo de 4 puertos.
Pantalla
24 pulgadas 4,5K (4480 × 2520), por lo que una GPU más grande aporta poco: el límite es la memoria.
Precio
No indicado aquí: Apple los modifica; ver la página de hardware del sitio.

#Las configuraciones reales: dos modelos, no tres

El kit Mac

La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

La página de Apple distingue dos familias. El modelo de 2 puertos tiene una CPU de 8 núcleos y una GPU de 8 núcleos, con 16 GB de memoria ampliable a 24 GB. El modelo de 4 puertos tiene una CPU de 10 núcleos y una GPU de 10 núcleos, con 16 GB ampliables a 24 o 32 GB. El ancho de banda de 120 GB/s es idéntico. Un error común, presente en la versión anterior de esta página, es creer que aún existe una configuración de 8 GB: la memoria base es de 16 GB. Para un LLM, lo importante es, por tanto, elegir el modelo de 4 puertos si quieres 32 GB.

Configuraciones del iMac M4 útiles para un LLM (ficha técnica de Apple)
VersiónGPUMemoria unificadaAncho de banda
2 puertos8 núcleos16 GB, opción 24 GB120 GB/s
4 puertos10 núcleos16 GB, con opciones de 24 y 32 GB120 GB/s

Para la generación de texto, la diferencia entre 8 y 10 núcleos de GPU probablemente sea pequeña: la velocidad depende del ancho de banda, que es idéntico. No hay ninguna medición pública en la tabla de referencia para la variante de 8 núcleos, por lo que esta afirmación sigue siendo una hipótesis. Si dudas, invierte en memoria antes que en núcleos.

#16, 24 o 32 GB: el presupuesto de memoria

En un Mac, la memoria se comparte entre el sistema y la GPU, y macOS solo deja una fracción para la GPU. El ajuste iogpu.wired_limit_mb vale 0 por defecto, lo que significa que el núcleo deduce el límite a partir de la memoria instalada. En un Mac de 32 GB medido por ModelPiper, Metal ofrecía 24,96 GiB a la GPU, es decir, el 78 % de la memoria. Se suele citar el 75 %. Para un iMac, calcula por tanto unos 11 a 12 GB disponibles para la GPU en un equipo de 16 GB, 17 a 18 GB en uno de 24 GB y 24 a 25 GB en uno de 32 GB: son estimaciones que debes comprobar en tu máquina con el comando sysctl iogpu.wired_limit_mb y la herramienta Metal descrita por ModelPiper.

Memoria disponible para el modelo (estimación al 75 %)
ConfiguraciónMemoria que puede utilizar la GPUEl modelo más grande que resulta razonable usar
16 GB≈ 11 a 12 GBUn 14B en Q4 (≈ 9 GB), contexto medio
24 GB≈ 17 a 18 GBUn 24B en Q4 (≈ 14 GB), contexto corto
32 GB≈ 24 a 25 GBUn modelo de 30B en Q4 (≈ 17 a 18 GB), contexto medio

Para superar estos límites, es posible aumentar la parte asignada a la GPU. La guía sobre la optimización de los Mac Apple Silicon detalla este ajuste y sus riesgos; no volvemos a explicarlo aquí.

#¿Qué modelos para qué memoria?

Los pesos en Q4 a continuación provienen del catálogo QuelLLM. Suponen que el modelo cabe en la memoria usable de la tabla anterior, incluyendo contexto. La columna «fluidez» aplica el límite de 120 GB/s a cada modelo: son órdenes de magnitud calculados, no mediciones.

Modelos por configuración de memoria (Q4, solo los pesos)
ModeloTamaño del modeloConfiguración mínimaFluidez esperada en M4
Llama 3.1 8B≈ 6 GB16 GBFluido (aproximadamente 15 tokens/s)
Gemma 4 12B≈ 7 GB16 GBCorrecto (aproximadamente 13 tokens/s)
Phi-4 14B≈ 9 GB16 GBCorrecto (aproximadamente 10 tokens/s)
gpt-oss 20B≈ 13 GB24 GBVariable (MoE: más rápido que un denso de 20B)
Devstral Small 2 24B≈ 14 GB24 GBLento (aproximadamente 6 a 7 tokens/s)
Gemma 4 31B≈ 18 GB32 GBMuy lento (aproximadamente 5 tokens/s)

La regla es no confundir «cabe en memoria» con «resulta agradable de usar». Un modelo denso de 24B en un M4 básico sigue produciendo texto legible, pero es lento, a unas pocas palabras por segundo, mientras que un modelo de mezcla de expertos (MoE) como gpt-oss 20B o Gemma 4 26B-A4B solo lee unos pocos miles de millones de parámetros por token, por lo que supera a un modelo denso de tamaño comparable. Para un iMac de 24 o 32 GB, un MoE suele ser la mejor opción.

Con 24 GB, suele plantearse una elección: un modelo de 12B en Q8 (aproximadamente 13 GB) o uno de 24B en Q4 (aproximadamente 14 GB). Ambos ocupan casi la misma memoria, por lo que generan a una velocidad similar, alrededor de 7 tokens por segundo según el límite de ancho de banda. El segundo ofrece mayor capacidad de razonamiento; el primero, una fidelidad más cercana al modelo original. A igual ancho de banda, es el tamaño del modelo en gigabytes lo que determina la velocidad de generación, no su número de parámetros.

#Velocidad: el ancho de banda es determinante

La única medición pública de referencia es la tabla del repositorio de llama.cpp sobre Apple Silicon, que prueba un LLaMA 7B en Q4_0. Para un M4 con GPU de 10 núcleos y 120 GB/s, indica 221,29 tokens por segundo en lectura del prompt y 24,11 en generación. Un M4 Pro con 273 GB/s y GPU de 16 núcleos alcanza 49,64 en generación, es decir, un poco más del doble. Esta proporción es cercana a la de los anchos de banda (2,3 veces): es señal de que la generación depende de la memoria, no del número de núcleos de la GPU.

Apple Silicon con LLaMA 7B Q4_0 (discusión de llama.cpp)
ChipGPUAncho de bandaGeneración tg (t/s)
M4 (iMac de 4 puertos)10 núcleos120 GB/s24,11
M4 Pro (Mac mini M4 Pro)16 núcleos273 GB/s49,64

Estas mediciones datan de una versión temprana de llama.cpp; las versiones recientes y MLX pueden ofrecer mejores resultados. Tómalas como un orden de magnitud. La versión anterior de esta página anunciaba entre 28 y 31 tokens por segundo para un 9B en Q5: esa cifra superaría el límite de 120 GB/s para un modelo de ese tamaño, y la hemos retirado.

#Tres usos realistas según la memoria

Un presupuesto de memoria se entiende mejor aplicado a un uso concreto. En cada caso, suma el peso del modelo, la caché del contexto y los otros programas abiertos, y compara el total con la memoria utilizable de la tabla anterior. La calculadora del sitio hace esta suma por ti; quédate solo con la lógica.

Usos típicos y configuración recomendada
UsoLo que se debe cargarConfiguración mínima
Asistente de escritorio: resúmenes, correos, traducciónUn 8B o un 12B en Q4, contexto de varios miles de tokens16 GB
Búsqueda en tus documentos (RAG)Un modelo de generación de 12B, un modelo de embeddings y un reranker cargados juntos24 GB para mantener un margen
Ayuda con el código en proyectos medianosUn 24B (Devstral Small 2) o un MoE de 20 a 26B, contexto largo24 GB, 32 GB si el contexto crece

En cuanto al calor y al ruido, no hemos encontrado ninguna medición pública de un iMac M4 bajo una carga sostenida de LLM y, por tanto, no afirmamos nada sobre su ventilador. La única referencia fiable es el uso: si la generación dura horas, vigila la frecuencia y la temperatura en el Monitor de Actividad y mantén un contexto razonable.

#Puesta en marcha

  1. 01
    Verificar la memoria
    Anota la memoria de tu iMac en el menú Apple y luego en À propos de ce Mac. Esa memoria determina la lista de modelos posibles.
  2. 02
    Instalar Ollama o LM Studio
    Ollama acelera los cálculos en GPUs de Apple a través de la API Metal. LM Studio ofrece una interfaz gráfica bien adaptada a pantallas grandes.
  3. 03
    Cargar un modelo adecuado
    Elige un modelo de la tabla según tu memoria, en Q4_K_M, y ejecútalo con ollama run.
  4. 04
    Controlar el uso de la GPU
    Usa ollama ps para comprobar que el modelo esté cargado en la GPU y luego Monitor de Actividad para seguir la presión de memoria.
  5. 05
    Limitar el contexto
    Con 16 GB, mantén un contexto de unos pocos miles de tokens para evitar que el sistema recurra a la memoria de intercambio.
Terminal
ollama ps
sysctl iogpu.wired_limit_mb
sysctl hw.memsize

#iMac M4 o Mac mini M4: el verdadero criterio

El Mac mini M4 utiliza el mismo chip y el mismo ancho de banda; con la misma cantidad de memoria, el iMac no es más lento. Lo que cambia es la pantalla integrada, que no se puede sustituir, y la ausencia de una variante Pro: el iMac alcanza como máximo 32 GB y 120 GB/s, mientras que el Mac mini M4 Pro llega a 273 GB/s según la misma discusión de referencia. Si tu objetivo es un modelo de 24B o más a una velocidad adecuada, el ancho de banda del Mac mini M4 Pro duplica la velocidad de procesamiento; si buscas un asistente de escritorio con un modelo de 8 a 14B, el iMac es equivalente.

iMac M4 o Mac mini
CriterioiMac M4Mac mini M4 / M4 Pro
Ancho de banda120 GB/s120 GB/s (M4); 273 GB/s (M4 Pro)
Memoria máxima32 GBVer la página del Mac mini
PantallaIntegrado 4,5K de 24 pulgadasElegir por separado
Velocidad medida 7B Q4_024,11 t/s24,11 t/s (M4); 49,64 t/s (M4 Pro)
EscalabilidadNinguna, memoria no reemplazableIgual para la memoria, pantalla reemplazable
→
El criterio que decide
Elige el iMac si quieres un ordenador todo en uno y un asistente de 8 a 14B. Elige un Mac mini M4 Pro si buscas un modelo de 24B o más, para el que el ancho de banda duplica la velocidad de generación. Los precios cambian: revísalos en las páginas de hardware del sitio.

#Preguntas frecuentes

FAQ
¿Es el iMac M4 adecuado para la IA local?+
Sí para modelos de 8 a 14 mil millones de parámetros: el chip M4 ofrece 120 GB/s de ancho de banda y una medición pública da 24 tokens por segundo en un 7B en Q4_0. Se ralentiza significativamente con modelos de 24B y más, por falta de ancho de banda, no de capacidad.
¿16, 24 o 32 GB en un iMac M4 para un LLM?+
Dieciséis GB son suficientes para un modelo de 8B a 14B en Q4, con alrededor de 11 a 12 GB utilizables. Veinticuatro GB permiten usar modelos de 20B a 24B, y treinta y dos GB, modelos de 30B en Q4. Como la memoria no se puede reemplazar tras la compra, apunta al modelo más grande que planees usar, no al de hoy.
¿Cuál es la velocidad de un LLM en un iMac M4?+
En un M4 con GPU de 10 núcleos, la tabla de llama.cpp indica 24,11 tokens por segundo durante la generación con un LLaMA 7B en Q4_0. El cálculo del ancho de banda dividido por el tamaño del modelo sugiere unos 15 tokens por segundo para un modelo reciente de 8B en Q4 y de 6 a 7 para un 24B denso: estimaciones que hay que verificar.
¿Por qué no hay un iMac M4 Pro?+
La página de Apple solo ofrece el chip M4 para el iMac, en versiones con 8 y 10 núcleos de GPU. Para obtener un mayor ancho de banda, hay que pasar a un Mac mini M4 Pro (273 GB/s), cuya generación es más del doble de rápida en la tabla de referencia.
¿Basta con un iMac M4 de 8 núcleos GPU para un LLM?+
Probablemente sí: con 120 GB/s en todos los modelos, la generación depende poco del número de núcleos de la GPU. No hay ninguna medición en la tabla de llama.cpp para la variante de 8 núcleos, por lo que es una hipótesis. Elige más bien según la memoria: 24 GB es el primer nivel realmente útil.
¿Utiliza Ollama la tarjeta gráfica del iMac M4?+
Sí: la documentación de Ollama indica que acelera los cálculos en las GPU de Apple mediante la API Metal. Verifica con ollama ps que el modelo esté cargado en la GPU y vigila la presión de memoria en el Monitor de Actividad si te acercas al límite de tu configuración.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.