¿Qué LLM en Mac mini M4 / M4 Pro (16–64 GB)? ?
Un Mac mini M4 ejecuta correctamente un LLM local a partir de 16 GB: modelos de 7 a 12 mil millones de parámetros, a unos veinte tokens/s en el mejor de los casos con un 7B en Q4_0, ya que su ancho de banda de 120 GB/s limita la velocidad. Para ejecutar modelos de 14 a 35 mil millones de parámetros, se necesita un M4 Pro (273 GB/s, 24 a 64 GB). Apple reemplazó esta gama en agosto de 2026 con los Mac mini M6 y M5 Pro.
Esta guía utiliza las cifras de Apple y llama.cpp, así como las de la documentación de Ollama y LM Studio, para ayudarte a decidir: qué chip, qué memoria, qué modelo y qué velocidad puedes esperar. Distingue lo que anuncia Apple, lo que ha medido la comunidad y lo que es solo un cálculo, y repasa la gama M6 y M5 Pro lanzada en septiembre de 2026.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: Mac mini M5 Pro (24 GB / 512 GB).
¿Por qué esta elección? Nuestra ficha completa sobre Mac mini M5 Pro (24 GB / 512 GB) →
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene un beneficio de las compras que cumplen los requisitos.
#Mac mini M4 y LLM local: lo que la máquina sabe hacer
Un Mac mini es un buen servidor de LLM local porque su memoria unificada se comparte entre el procesador y la GPU, sin VRAM separada. Dos cifras determinan lo que puedes hacer con él. La capacidad (de 16 a 64 GB según el chip) fija el tamaño del modelo que se puede cargar: de 7 a 12 mil millones de parámetros con 16 GB, y de 24 a 35 mil millones con 32 a 48 GB. El ancho de banda determina la velocidad: 120 GB/s para el chip M4 y 273 GB/s para el M4 Pro, según Apple. Un LLM vuelve a leer sus pesos con cada token producido, por lo que la tasa máxima de generación equivale aproximadamente al ancho de banda dividido por el tamaño de los pesos. Para un modelo 7B en Q4_0, la tabla pública de llama.cpp indica 24,1 tokens/s para un M4 y alrededor de 50 para un M4 Pro. Apple presentó en agosto de 2026 los Mac mini M6 y M5 Pro, que sustituyen esta gama; el M4 todavía se encontraba en algunos distribuidores a finales de agosto.
- Mac mini M4
- CPU de 10 núcleos, GPU de 10 núcleos, 120 GB/s, 16 GB de memoria unificada (24 o 32 GB opcionales), Thunderbolt 4.
- Mac mini M4 Pro
- CPU de 12 núcleos, GPU de 16 núcleos (14 y 20 como opción), 273 GB/s, 24 GB de memoria (48 o 64 GB como opción), Thunderbolt 5.
- Formato y ruido
- 12,7 × 12,7 × 5,0 cm, 0,67 kg (M4) o 0,73 kg (M4 Pro); 5 dBA en reposo, según Apple.
- Consumo anunciado
- M4: 4 W en reposo, 65 W como máximo. M4 Pro: 5 W y 140 W. Apple no publica ningún valor durante la inferencia.
#Mac mini M4 o M4 Pro: el ancho de banda marca la diferencia
Sabes qué modelo cabe en tu Mac mini M4. El kit de Mac te enseña a sacarle el máximo partido: ampliar el límite de memoria de la GPU (cap. 2), elegir entre MLX y GGUF (cap. 3) y convertir tu Mac mini en un servidor de IA para toda la casa (cap. 12).
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Entre los dos chips, la verdadera diferencia no es la memoria máxima (32 GB frente a 64 GB), sino el ancho de banda, multiplicado por 2,3 (273 ÷ 120). En la tabla de llama.cpp, la relación medida es de 2,1 en generación (50,7 ÷ 24,1 en Q4_0) y de 2,0 en lectura del prompt (440 ÷ 221).
| Criterio | Mac mini M4 | Mac mini M4 Pro |
|---|---|---|
| Ancho de banda de memoria (Apple) | 120 GB/s | 273 GB/s |
| Memoria unificada (Apple) | 16 GB, opción 24 o 32 GB | 24 GB, opción 48 o 64 GB |
| Generación, Llama 2 7B en Q4_0 (llama.cpp) | 24,1 tokens/s | 50,7 tokens/s (GPU de 20 núcleos) |
| Generación, mismo modelo en Q8_0 | 13,5 tokens/s | 30,7 tokens/s |
| Lectura del prompt, Q4_0 | 221 tokens/s | 440 tokens/s |
| Puertos Thunderbolt (Apple) | Thunderbolt 4, 40 Gb/s | Thunderbolt 5, 120 Gb/s |
- El M4 basta si
- eres el único usuario, buscas modelos de hasta 12 mil millones de parámetros (Qwen 3.5 9B, Gemma 4 12B) y aceptas unos veinte tokens/s en el mejor de los casos. Elige 24 GB para mantener cargado además un modelo de embeddings.
- El M4 Pro se impone si
- buscas modelos de 14 a 27 mil millones de parámetros, un MoE de 30 a 35 mil millones (48 GB como mínimo), un agente de código o varios usuarios. Por encima de 64 GB, necesitas un Mac Studio.
#VRAM en Mac mini: la memoria unificada y su límite para la GPU
Un Mac mini no tiene VRAM separada, pero la GPU no puede usar toda la memoria. Según los usuarios de llama.cpp, el límite por defecto va de dos tercios a tres cuartos de la RAM; al iniciar, llama.cpp muestra la línea recommendedMaxWorkingSetSize, que da el valor real. El ajuste iogpu.wired_limit_mb tiene un valor de 0 por defecto, lo que significa «política por defecto del sistema» y no «ilimitado».
| Memoria del Mac mini | Límite estimado de GPU | Queda para macOS |
|---|---|---|
| 16 GB | 10,7 a 12 GB | 4 a 5 GB |
| 24 GB | 16 a 18 GB | 6 a 8 GB |
| 32 GB | 21 a 24 GB | 8 a 11 GB |
| 48 GB | 32 a 36 GB | 12 a 16 GB |
| 64 GB | 43 a 48 GB | 16 a 21 GB |
El límite debe dar cabida a los pesos, la caché KV (la memoria del contexto, que crece con la conversación) y los búferes de cálculo. Para cargar un modelo que roza el límite, se aumenta ese límite: MLX recomienda un valor superior al tamaño del modelo en megabytes, pero inferior a la memoria de la máquina. Deja varios gigabytes para macOS; de lo contrario, la velocidad se desploma. Un ajuste manual con sysctl puede no mantenerse tras un reinicio.
#Qué modelo para cada capacidad de memoria: lo que cabe en un Mac mini
La tabla compara el tamaño de los archivos publicados por Ollama con un límite de dos tercios de la RAM (hipótesis prudente). «Sí»: los pesos ocupan menos del 70 % del límite y queda espacio para la caché KV. «Justo»: caben, con un contexto corto. «No»: superan el límite. Son cálculos, no mediciones.
| Modelo | Peso (Ollama) | M4 16 GB | M4 24 GB | M4 32 GB | M4 Pro 48 GB | M4 Pro 64 GB |
|---|---|---|---|---|---|---|
| Qwen 3.5 9B | 6,6 GB | sí | sí | sí | sí | sí |
| Gemma 4 12B | 7,6 GB | justo | sí | sí | sí | sí |
| gpt-oss 20B | 14 GB | no | justo | sí | sí | sí |
| Mistral Small 24B | 14 GB | no | justo | sí | sí | sí |
| Qwen 3.8 27B | 18 GB | no | no | justo | sí | sí |
| Qwen3-Coder 30B-A3B | 19 GB | no | no | justo | sí | sí |
| Qwen 3.6 35B-A3B (MoE) | 23 GB | no | no | no | justo | sí |
| Qwen3-Coder 30B-A3B en Q8_0 | 32 GB | no | no | no | justo | justo |
#Mac mini M4 de 16 GB: los modelos recomendados
Con 16 GB, el límite se sitúa alrededor de 11 GB. Qwen 3.5 9B (6,6 GB en Ollama) deja aproximadamente 4 GB para la caché KV y los búferes. Gemma 4 12B (7,6 GB) funciona con un contexto corto. Un modelo de 14 GB como Mistral Small 24B supera el límite: Ollama lo distribuye entre GPU y CPU y la velocidad cae. El comando ollama ps muestra la distribución; busca un 100 % en GPU.
#Velocidad de un Mac mini: límite teórico y mediciones publicadas
La tasa de generación está limitada por el ancho de banda: tokens por segundo ≈ ancho de banda (GB/s) ÷ pesos leídos por cada token (GB). Este cálculo da un límite máximo, nunca una medición. Para un modelo denso de 14 GB, 120 ÷ 14 da 8,6 tokens/s como máximo en un M4, y 273 ÷ 14 da 19,5 en un M4 Pro.
| Modelo | Tamaño del modelo | M4 (120 GB/s) | M4 Pro (273 GB/s) |
|---|---|---|---|
| Qwen 3.5 9B | 6,6 GB | 18 | 41 |
| Gemma 4 12B | 7,6 GB | 16 | 36 |
| Mistral Small 24B | 14 GB | 8,6 | 19,5 |
Las mediciones publicadas se mantienen por debajo de este límite. Estas son las de la tabla que la comunidad llama.cpp mantiene actualizada para los chips de Apple, con Llama 2 7B. No son nuestras mediciones y corresponden a un modelo antiguo en Q4_0 y Q8_0, pero permiten comparar el rendimiento relativo de los chips.
| Chip | Ancho de banda | Generación Q4_0 | Generación Q8_0 | Prompt Q4_0 |
|---|---|---|---|---|
| M4 (GPU de 10 núcleos) | 120 GB/s | 24,1 | 13,5 | 221 |
| M4 Pro (GPU de 16 núcleos) | 273 GB/s | 49,6 | 30,5 | 364 |
| M4 Pro (GPU de 20 núcleos) | 273 GB/s | 50,7 | 30,7 | 440 |
| M5 Pro (GPU con 20 núcleos) | 307 GB/s | 66,3 | 38,9 | 1 621 |
Pasar de Q8_0 a Q4_0 acelera la generación en un factor de 1,8 en M4 y 1,7 en M4 Pro: el tamaño del archivo cuenta más que el cálculo. Los núcleos de la GPU influyen sobre todo en la lectura del prompt (364 frente a 440 tokens/s en M4 Pro). La tabla no incluye ninguna medición de M6 en la fecha de consulta.
#Mac mini M6 y M5 Pro: lo que cambia la nueva línea para un LLM
Apple anuncia que el Mac mini M6 ofrece una velocidad de procesamiento del prompt en LM Studio hasta 4,8 veces superior a la del M4, y que el M5 Pro ofrece una velocidad hasta 4 veces superior a la del M4 Pro. Estas mejoras corresponden a la lectura del prompt, que aprovecha los aceleradores neuronales añadidos en cada núcleo de la GPU. La generación sigue determinada por el ancho de banda y mejora mucho menos: del 12 % (307 frente a 273 GB/s) al 42 % (170 frente a 120 GB/s).
| Chip | Ancho de banda | Memoria unificada | Reposo / máximo |
|---|---|---|---|
| M4 | 120 GB/s | 16, 24 o 32 GB | 4 W / 65 W |
| M6 | 153 GB/s (16 GB), 170 GB/s (24 GB y más) | 16, 24 o 32 GB | 4 W / 70 W |
| M4 Pro | 273 GB/s | 24, 48 o 64 GB | 5 W / 140 W |
| M5 Pro | 307 GB/s | 24, 48 o 64 GB | 6 W / 145 W |
Un M6 base a 153 GB/s solo tiene un 28 % más de ancho de banda que el M4: el límite teórico de un 9B pasa de 18 a 23 tokens/s aproximadamente. La nueva gama beneficia sobre todo a los usos con contexto largo: un RAG que inyecta documentos largos, un agente de código que relee un repositorio.
- Equipo nuevo, modelo de 30 a 35 mil millones
- Un M5 Pro con al menos 48 GB, 64 GB para estar cómodo con un MoE de 35 mil millones: el M6 llega solo a 32 GB.
- M4 aún en stock
- Una opción adecuada para modelos de entre 7 y 12 mil millones de parámetros si la diferencia de precio con el M6 es clara. Las existencias son limitadas.
#Instalar un servidor LLM en un Mac mini con Ollama
Ollama en macOS funciona como una aplicación cuyos ajustes se configuran mediante variables de entorno definidas con launchctl. Por defecto, Ollama solo escucha en 127.0.0.1, puerto 11434: sin cambios, ningún otro dispositivo puede usarlo.
- 01Instalar la aplicación OllamaDescarga Ollama desde ollama.com y coloca la aplicación en Aplicaciones. Al iniciarla por primera vez, te propone crear el enlace para el comando ollama.
- 02Abrir el puerto a la red localDefine OLLAMA_HOST con launchctl (comando a continuación), luego vuelve a iniciar la aplicación. La dirección 0.0.0.0 abre la API a toda la red sin autenticación: úsala solo en una red de confianza.
- 03Evitar la suspensiónEn Ajustes del Sistema, en la sección Energía, activa la opción que impide que el equipo entre automáticamente en modo de suspensión cuando la pantalla esté apagada: sin ella, el servicio puede interrumpirse.
- 04Descargar un modelo adecuadoElige en la tabla un modelo marcado con «sí» para tu capacidad de memoria, por ejemplo qwen3.5:9b con 16 GB.
- 05Verificar desde otro dispositivoEnvía una solicitud a la dirección del Mac mini (nombre .local o IP), luego ejecuta ollama ps: la columna Processor debe mostrar 100 % GPU.
Dos ajustes que suelen copiarse son inútiles aquí: la documentación de Ollama indica que Flash Attention se activa automáticamente cuando el hardware lo permite, y OLLAMA_ORIGINS se refiere a las extensiones del navegador. En cambio, cuantizar la caché KV (OLLAMA_KV_CACHE_TYPE=q8_0) reduce su tamaño aproximadamente a la mitad con una pérdida muy pequeña, lo que resulta importante con 16 GB cuando el contexto se alarga.
#LM Studio : la alternativa a Ollama
LM Studio requiere un chip Apple Silicon y macOS 14 o posterior; se recomiendan 16 GB de RAM. Desde la versión 0.3.4, carga tanto modelos GGUF como MLX. Sin pantalla, su demonio llmster se inicia con lms daemon up. La opción «Serve on Local Network» abre la API a la red; la autenticación por token no está activada por defecto. El motor MLX de Ollama, presentado en versión preliminar en marzo de 2026, requería más de 32 GB: un M4 de 16 GB no podía aprovecharlo.
#Lo que un Mac mini puede ofrecer: chat, RAG, agentes, clúster
- Servidor de chat en casa
- Las API de Ollama y de LM Studio aceptan clientes en formato OpenAI (Open WebUI, Zed, scripts). Colocado cerca del router, el Mac mini da servicio a toda la casa.
- RAG documental
- Se debe cargar el modelo de generación y un modelo de embeddings. nomic-embed-text pesa 274 MB: en 16 GB, cabe al lado de Qwen 3.5 9B.
- Agente de código
- Un agente envía prompts largos en cada paso: leer el prompt cuenta más que generar, y es allí donde M6 y M5 Pro ganan más.
#¿Cuántos usuarios simultáneos?
Ollama procesa una solicitud a la vez por modelo de forma predeterminada (OLLAMA_NUM_PARALLEL vale 1). Cada solicitud paralela aumenta el contexto asignado: según la documentación, 4 solicitudes con un contexto de 2 000 tokens asignan 8 000 tokens. Memoria de la caché = caché de una conversación × solicitudes paralelas. Cada persona recibe su respuesta más lentamente; aquí no hay ninguna medición fiable para un número concreto de personas.
#Conectar varios Mac mini en un clúster
Solo el M4 Pro ofrece Thunderbolt 5 (120 Gb/s); el M4 se limita a Thunderbolt 4 (40 Gb/s). El proyecto exo admite RDMA sobre Thunderbolt 5, que reduciría en un 99 % la latencia entre máquinas, y afirma que los modelos se aceleran a medida que se añaden dispositivos, con macOS 26.2 o posterior. Sus benchmarks corresponden a Mac Studio, no a Mac mini. Un clúster sirve ante todo para cargar un modelo demasiado grande para una sola máquina.
- Compartir Ollama en tu red local (familia, equipo)
- Seguridad del servidor Ollama: autenticación y reverse proxy
- Exo: convertir varios equipos en un clúster LLM doméstico
- Optimizar tu Mac Apple Silicon: límite de GPU, Flash Attention, caché KV
- Información del hardware: Mac mini M6
- Ficha de hardware: Mac mini M5 Pro
#Mac mini M4 o MacBook Air M4: mismo chip, otro uso
El MacBook Air M4 de 13 pulgadas utiliza el mismo chip, con el mismo ancho de banda (120 GB/s) y las mismas opciones de 16, 24 o 32 GB: el límite de velocidad es idéntico. Lo que cambia es el chasis. La versión anterior de esta guía cifraba en un 20 % la ralentización del Air tras diez minutos; ninguna fuente lo confirma y esa cifra se ha retirado. Para un servicio que permanece encendido continuamente, el Mac mini es la opción natural; para un equipo portátil (1,24 kg, pantalla y batería incluidas), el MacBook.
- Fuente: Apple, ficha técnica del Mac mini (2024)
- Fuente: Apple, anuncio de los Mac mini M6 y M5 Pro (agosto de 2026)
- Fuente: llama.cpp, rendimiento en chips Apple M-series
- Fuente: documentación de Ollama, preguntas frecuentes (variables de entorno, caché KV)
- Fuente: documentación LM Studio, modo servidor sin interfaz
#Preguntas frecuentes
¿Un Mac mini M4 con 16 GB es suficiente para un LLM local?+
¿Cuál es el mejor LLM para un Mac mini M4 de 16 GB?+
¿Mac mini M4 o M4 Pro para la IA local?+
¿El Mac mini M6 es mucho más rápido que el M4 para un LLM?+
¿Se pueden conectar varios Mac mini en un clúster para un LLM?+
¿Cuánto consume un Mac mini M4 como servidor LLM 24 h/24?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.