Principiante 14 minMac mini

¿Qué LLM en Mac mini M4 / M4 Pro (16–64 GB)? ?

Respuesta directa

Un Mac mini M4 ejecuta correctamente un LLM local a partir de 16 GB: modelos de 7 a 12 mil millones de parámetros, a unos veinte tokens/s en el mejor de los casos con un 7B en Q4_0, ya que su ancho de banda de 120 GB/s limita la velocidad. Para ejecutar modelos de 14 a 35 mil millones de parámetros, se necesita un M4 Pro (273 GB/s, 24 a 64 GB). Apple reemplazó esta gama en agosto de 2026 con los Mac mini M6 y M5 Pro.

Esta guía utiliza las cifras de Apple y llama.cpp, así como las de la documentación de Ollama y LM Studio, para ayudarte a decidir: qué chip, qué memoria, qué modelo y qué velocidad puedes esperar. Distingue lo que anuncia Apple, lo que ha medido la comunidad y lo que es solo un cálculo, y repasa la gama M6 y M5 Pro lanzada en septiembre de 2026.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en macOS 14+
Hardware recomendado

Alternativa de compra para esta guía: Mac mini M5 Pro (24 GB / 512 GB).

¿Por qué esta elección? Nuestra ficha completa sobre Mac mini M5 Pro (24 GB / 512 GB) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene un beneficio de las compras que cumplen los requisitos.

#Mac mini M4 y LLM local: lo que la máquina sabe hacer

Un Mac mini es un buen servidor de LLM local porque su memoria unificada se comparte entre el procesador y la GPU, sin VRAM separada. Dos cifras determinan lo que puedes hacer con él. La capacidad (de 16 a 64 GB según el chip) fija el tamaño del modelo que se puede cargar: de 7 a 12 mil millones de parámetros con 16 GB, y de 24 a 35 mil millones con 32 a 48 GB. El ancho de banda determina la velocidad: 120 GB/s para el chip M4 y 273 GB/s para el M4 Pro, según Apple. Un LLM vuelve a leer sus pesos con cada token producido, por lo que la tasa máxima de generación equivale aproximadamente al ancho de banda dividido por el tamaño de los pesos. Para un modelo 7B en Q4_0, la tabla pública de llama.cpp indica 24,1 tokens/s para un M4 y alrededor de 50 para un M4 Pro. Apple presentó en agosto de 2026 los Mac mini M6 y M5 Pro, que sustituyen esta gama; el M4 todavía se encontraba en algunos distribuidores a finales de agosto.

Mac mini M4
CPU de 10 núcleos, GPU de 10 núcleos, 120 GB/s, 16 GB de memoria unificada (24 o 32 GB opcionales), Thunderbolt 4.
Mac mini M4 Pro
CPU de 12 núcleos, GPU de 16 núcleos (14 y 20 como opción), 273 GB/s, 24 GB de memoria (48 o 64 GB como opción), Thunderbolt 5.
Formato y ruido
12,7 × 12,7 × 5,0 cm, 0,67 kg (M4) o 0,73 kg (M4 Pro); 5 dBA en reposo, según Apple.
Consumo anunciado
M4: 4 W en reposo, 65 W como máximo. M4 Pro: 5 W y 140 W. Apple no publica ningún valor durante la inferencia.
!
La gama M4 está sustituida desde agosto de 2026
Apple presentó los Mac mini M6 y M5 Pro en agosto de 2026, disponibles a partir del 22 de septiembre. Las tablas siguientes se refieren a un M4 ya comprado, en stock o de segunda mano.

#Mac mini M4 o M4 Pro: el ancho de banda marca la diferencia

El kit Mac

Sabes qué modelo cabe en tu Mac mini M4. El kit de Mac te enseña a sacarle el máximo partido: ampliar el límite de memoria de la GPU (cap. 2), elegir entre MLX y GGUF (cap. 3) y convertir tu Mac mini en un servidor de IA para toda la casa (cap. 12).

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Entre los dos chips, la verdadera diferencia no es la memoria máxima (32 GB frente a 64 GB), sino el ancho de banda, multiplicado por 2,3 (273 ÷ 120). En la tabla de llama.cpp, la relación medida es de 2,1 en generación (50,7 ÷ 24,1 en Q4_0) y de 2,0 en lectura del prompt (440 ÷ 221).

Mac mini M4 y M4 Pro para un LLM (fuentes: Apple, llama.cpp)
CriterioMac mini M4Mac mini M4 Pro
Ancho de banda de memoria (Apple)120 GB/s273 GB/s
Memoria unificada (Apple)16 GB, opción 24 o 32 GB24 GB, opción 48 o 64 GB
Generación, Llama 2 7B en Q4_0 (llama.cpp)24,1 tokens/s50,7 tokens/s (GPU de 20 núcleos)
Generación, mismo modelo en Q8_013,5 tokens/s30,7 tokens/s
Lectura del prompt, Q4_0221 tokens/s440 tokens/s
Puertos Thunderbolt (Apple)Thunderbolt 4, 40 Gb/sThunderbolt 5, 120 Gb/s
El M4 basta si
eres el único usuario, buscas modelos de hasta 12 mil millones de parámetros (Qwen 3.5 9B, Gemma 4 12B) y aceptas unos veinte tokens/s en el mejor de los casos. Elige 24 GB para mantener cargado además un modelo de embeddings.
El M4 Pro se impone si
buscas modelos de 14 a 27 mil millones de parámetros, un MoE de 30 a 35 mil millones (48 GB como mínimo), un agente de código o varios usuarios. Por encima de 64 GB, necesitas un Mac Studio.

#VRAM en Mac mini: la memoria unificada y su límite para la GPU

Un Mac mini no tiene VRAM separada, pero la GPU no puede usar toda la memoria. Según los usuarios de llama.cpp, el límite por defecto va de dos tercios a tres cuartos de la RAM; al iniciar, llama.cpp muestra la línea recommendedMaxWorkingSetSize, que da el valor real. El ajuste iogpu.wired_limit_mb tiene un valor de 0 por defecto, lo que significa «política por defecto del sistema» y no «ilimitado».

Límite de GPU por defecto, estimado en dos tercios y tres cuartos de la RAM
Memoria del Mac miniLímite estimado de GPUQueda para macOS
16 GB10,7 a 12 GB4 a 5 GB
24 GB16 a 18 GB6 a 8 GB
32 GB21 a 24 GB8 a 11 GB
48 GB32 a 36 GB12 a 16 GB
64 GB43 a 48 GB16 a 21 GB

El límite debe dar cabida a los pesos, la caché KV (la memoria del contexto, que crece con la conversación) y los búferes de cálculo. Para cargar un modelo que roza el límite, se aumenta ese límite: MLX recomienda un valor superior al tamaño del modelo en megabytes, pero inferior a la memoria de la máquina. Deja varios gigabytes para macOS; de lo contrario, la velocidad se desploma. Un ajuste manual con sysctl puede no mantenerse tras un reinicio.

Consultar y luego aumentar el límite (ejemplo: M4 Pro de 48 GB)
# Valeur actuelle : 0 = plafond par défaut du système
sysctl iogpu.wired_limit_mb

# 40 Go pour le GPU sur 48 Go de RAM (40 x 1024 = 40960 Mo)
sudo sysctl iogpu.wired_limit_mb=40960

#Qué modelo para cada capacidad de memoria: lo que cabe en un Mac mini

La tabla compara el tamaño de los archivos publicados por Ollama con un límite de dos tercios de la RAM (hipótesis prudente). «Sí»: los pesos ocupan menos del 70 % del límite y queda espacio para la caché KV. «Justo»: caben, con un contexto corto. «No»: superan el límite. Son cálculos, no mediciones.

Cuantización predeterminada de Ollama salvo indicación contraria: ¿cabe el modelo dentro del límite de memoria predeterminado de la GPU?
ModeloPeso (Ollama)M4 16 GBM4 24 GBM4 32 GBM4 Pro 48 GBM4 Pro 64 GB
Qwen 3.5 9B6,6 GBsísísísísí
Gemma 4 12B7,6 GBjustosísísísí
gpt-oss 20B14 GBnojustosísísí
Mistral Small 24B14 GBnojustosísísí
Qwen 3.8 27B18 GBnonojustosísí
Qwen3-Coder 30B-A3B19 GBnonojustosísí
Qwen 3.6 35B-A3B (MoE)23 GBnononojustosí
Qwen3-Coder 30B-A3B en Q8_032 GBnononojustojusto

#Mac mini M4 de 16 GB: los modelos recomendados

Con 16 GB, el límite se sitúa alrededor de 11 GB. Qwen 3.5 9B (6,6 GB en Ollama) deja aproximadamente 4 GB para la caché KV y los búferes. Gemma 4 12B (7,6 GB) funciona con un contexto corto. Un modelo de 14 GB como Mistral Small 24B supera el límite: Ollama lo distribuye entre GPU y CPU y la velocidad cae. El comando ollama ps muestra la distribución; busca un 100 % en GPU.

→
Un MoE reduce el tiempo por token, no la memoria
Qwen3-Coder 30B-A3B cuenta con 30,5 mil millones de parámetros en total, pero 3,3 mil millones activos por token: lee pocos pesos y es rápido, pero todo el archivo (19 GB) permanece en memoria. Por tanto, no cabe en un Mac mini de 16 GB a pesar de sus 3 mil millones de parámetros activos.

#Velocidad de un Mac mini: límite teórico y mediciones publicadas

La tasa de generación está limitada por el ancho de banda: tokens por segundo ≈ ancho de banda (GB/s) ÷ pesos leídos por cada token (GB). Este cálculo da un límite máximo, nunca una medición. Para un modelo denso de 14 GB, 120 ÷ 14 da 8,6 tokens/s como máximo en un M4, y 273 ÷ 14 da 19,5 en un M4 Pro.

Límite teórico en tokens/s (ancho de banda ÷ peso del modelo en Ollama, modelos densos)
ModeloTamaño del modeloM4 (120 GB/s)M4 Pro (273 GB/s)
Qwen 3.5 9B6,6 GB1841
Gemma 4 12B7,6 GB1636
Mistral Small 24B14 GB8,619,5

Las mediciones publicadas se mantienen por debajo de este límite. Estas son las de la tabla que la comunidad llama.cpp mantiene actualizada para los chips de Apple, con Llama 2 7B. No son nuestras mediciones y corresponden a un modelo antiguo en Q4_0 y Q8_0, pero permiten comparar el rendimiento relativo de los chips.

llama.cpp, Llama 2 7B : tokens/s (discusión GitHub 4167, commit 8e672ef)
ChipAncho de bandaGeneración Q4_0Generación Q8_0Prompt Q4_0
M4 (GPU de 10 núcleos)120 GB/s24,113,5221
M4 Pro (GPU de 16 núcleos)273 GB/s49,630,5364
M4 Pro (GPU de 20 núcleos)273 GB/s50,730,7440
M5 Pro (GPU con 20 núcleos)307 GB/s66,338,91 621

Pasar de Q8_0 a Q4_0 acelera la generación en un factor de 1,8 en M4 y 1,7 en M4 Pro: el tamaño del archivo cuenta más que el cálculo. Los núcleos de la GPU influyen sobre todo en la lectura del prompt (364 frente a 440 tokens/s en M4 Pro). La tabla no incluye ninguna medición de M6 en la fecha de consulta.

i
Un modelo de razonamiento tarda en responder
Un modelo que reflexiona suele producir 2 000 tokens antes de responder. A 8 tokens/s (un modelo denso de 14B en M4), eso equivale a 250 segundos, más de 4 minutos. A 19 tokens/s en M4 Pro, aproximadamente 105 segundos. Este cálculo influye en la decisión entre M4 y M4 Pro.

#Mac mini M6 y M5 Pro: lo que cambia la nueva línea para un LLM

Apple anuncia que el Mac mini M6 ofrece una velocidad de procesamiento del prompt en LM Studio hasta 4,8 veces superior a la del M4, y que el M5 Pro ofrece una velocidad hasta 4 veces superior a la del M4 Pro. Estas mejoras corresponden a la lectura del prompt, que aprovecha los aceleradores neuronales añadidos en cada núcleo de la GPU. La generación sigue determinada por el ancho de banda y mejora mucho menos: del 12 % (307 frente a 273 GB/s) al 42 % (170 frente a 120 GB/s).

Los cuatro chips (fuente: Apple)
ChipAncho de bandaMemoria unificadaReposo / máximo
M4120 GB/s16, 24 o 32 GB4 W / 65 W
M6153 GB/s (16 GB), 170 GB/s (24 GB y más)16, 24 o 32 GB4 W / 70 W
M4 Pro273 GB/s24, 48 o 64 GB5 W / 140 W
M5 Pro307 GB/s24, 48 o 64 GB6 W / 145 W

Un M6 base a 153 GB/s solo tiene un 28 % más de ancho de banda que el M4: el límite teórico de un 9B pasa de 18 a 23 tokens/s aproximadamente. La nueva gama beneficia sobre todo a los usos con contexto largo: un RAG que inyecta documentos largos, un agente de código que relee un repositorio.

Equipo nuevo, modelo de 30 a 35 mil millones
Un M5 Pro con al menos 48 GB, 64 GB para estar cómodo con un MoE de 35 mil millones: el M6 llega solo a 32 GB.
M4 aún en stock
Una opción adecuada para modelos de entre 7 y 12 mil millones de parámetros si la diferencia de precio con el M6 es clara. Las existencias son limitadas.

#Instalar un servidor LLM en un Mac mini con Ollama

Ollama en macOS funciona como una aplicación cuyos ajustes se configuran mediante variables de entorno definidas con launchctl. Por defecto, Ollama solo escucha en 127.0.0.1, puerto 11434: sin cambios, ningún otro dispositivo puede usarlo.

  1. 01
    Instalar la aplicación Ollama
    Descarga Ollama desde ollama.com y coloca la aplicación en Aplicaciones. Al iniciarla por primera vez, te propone crear el enlace para el comando ollama.
  2. 02
    Abrir el puerto a la red local
    Define OLLAMA_HOST con launchctl (comando a continuación), luego vuelve a iniciar la aplicación. La dirección 0.0.0.0 abre la API a toda la red sin autenticación: úsala solo en una red de confianza.
  3. 03
    Evitar la suspensión
    En Ajustes del Sistema, en la sección Energía, activa la opción que impide que el equipo entre automáticamente en modo de suspensión cuando la pantalla esté apagada: sin ella, el servicio puede interrumpirse.
  4. 04
    Descargar un modelo adecuado
    Elige en la tabla un modelo marcado con «sí» para tu capacidad de memoria, por ejemplo qwen3.5:9b con 16 GB.
  5. 05
    Verificar desde otro dispositivo
    Envía una solicitud a la dirección del Mac mini (nombre .local o IP), luego ejecuta ollama ps: la columna Processor debe mostrar 100 % GPU.
Servidor Ollama en el Mac mini
# Écoute sur tout le réseau local, puis relancer l'application Ollama
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"

# Modèle pour 16 Go de mémoire
ollama pull qwen3.5:9b

# Test depuis un autre appareil (remplacez l'adresse)
curl http://mac-mini.local:11434/api/chat -d '{"model": "qwen3.5:9b", "messages": [{"role": "user", "content": "Bonjour"}], "stream": false}'

Dos ajustes que suelen copiarse son inútiles aquí: la documentación de Ollama indica que Flash Attention se activa automáticamente cuando el hardware lo permite, y OLLAMA_ORIGINS se refiere a las extensiones del navegador. En cambio, cuantizar la caché KV (OLLAMA_KV_CACHE_TYPE=q8_0) reduce su tamaño aproximadamente a la mitad con una pérdida muy pequeña, lo que resulta importante con 16 GB cuando el contexto se alarga.

#LM Studio : la alternativa a Ollama

LM Studio requiere un chip Apple Silicon y macOS 14 o posterior; se recomiendan 16 GB de RAM. Desde la versión 0.3.4, carga tanto modelos GGUF como MLX. Sin pantalla, su demonio llmster se inicia con lms daemon up. La opción «Serve on Local Network» abre la API a la red; la autenticación por token no está activada por defecto. El motor MLX de Ollama, presentado en versión preliminar en marzo de 2026, requería más de 32 GB: un M4 de 16 GB no podía aprovecharlo.

#Lo que un Mac mini puede ofrecer: chat, RAG, agentes, clúster

Servidor de chat en casa
Las API de Ollama y de LM Studio aceptan clientes en formato OpenAI (Open WebUI, Zed, scripts). Colocado cerca del router, el Mac mini da servicio a toda la casa.
RAG documental
Se debe cargar el modelo de generación y un modelo de embeddings. nomic-embed-text pesa 274 MB: en 16 GB, cabe al lado de Qwen 3.5 9B.
Agente de código
Un agente envía prompts largos en cada paso: leer el prompt cuenta más que generar, y es allí donde M6 y M5 Pro ganan más.

#¿Cuántos usuarios simultáneos?

Ollama procesa una solicitud a la vez por modelo de forma predeterminada (OLLAMA_NUM_PARALLEL vale 1). Cada solicitud paralela aumenta el contexto asignado: según la documentación, 4 solicitudes con un contexto de 2 000 tokens asignan 8 000 tokens. Memoria de la caché = caché de una conversación × solicitudes paralelas. Cada persona recibe su respuesta más lentamente; aquí no hay ninguna medición fiable para un número concreto de personas.

#Conectar varios Mac mini en un clúster

Solo el M4 Pro ofrece Thunderbolt 5 (120 Gb/s); el M4 se limita a Thunderbolt 4 (40 Gb/s). El proyecto exo admite RDMA sobre Thunderbolt 5, que reduciría en un 99 % la latencia entre máquinas, y afirma que los modelos se aceleran a medida que se añaden dispositivos, con macOS 26.2 o posterior. Sus benchmarks corresponden a Mac Studio, no a Mac mini. Un clúster sirve ante todo para cargar un modelo demasiado grande para una sola máquina.

#Mac mini M4 o MacBook Air M4: mismo chip, otro uso

El MacBook Air M4 de 13 pulgadas utiliza el mismo chip, con el mismo ancho de banda (120 GB/s) y las mismas opciones de 16, 24 o 32 GB: el límite de velocidad es idéntico. Lo que cambia es el chasis. La versión anterior de esta guía cifraba en un 20 % la ralentización del Air tras diez minutos; ninguna fuente lo confirma y esa cifra se ha retirado. Para un servicio que permanece encendido continuamente, el Mac mini es la opción natural; para un equipo portátil (1,24 kg, pantalla y batería incluidas), el MacBook.

#Preguntas frecuentes

¿Un Mac mini M4 con 16 GB es suficiente para un LLM local?+
Sí, para modelos de 7 a 12 mil millones de parámetros. Qwen 3.5 9B (6,6 GB) cabe dentro del límite de memoria de la GPU, de unos 11 GB, con un contexto razonable. Calcula unos veinte tokens/s como máximo: el M4 tiene un límite de 120 GB/s. Para más de 12 mil millones de parámetros, elige 24 GB o un M4 Pro.
¿Cuál es el mejor LLM para un Mac mini M4 de 16 GB?+
Qwen 3.5 9B es la opción más fiable: ocupa 6,6 GB en Ollama y deja espacio para la caché KV. Gemma 4 12B (7,6 GB) funciona con un contexto corto. Evita los modelos de 14 GB o más: se ejecutan parcialmente en la CPU y pierden velocidad.
¿Mac mini M4 o M4 Pro para la IA local?+
El M4 Pro, si buscas modelos de más de 12 mil millones de parámetros: sus 273 GB/s frente a 120 GB/s aproximadamente duplican la velocidad de generación, y sus opciones de 48 y 64 GB permiten ejecutar MoE de 30 a 35 mil millones. Para un 9B usado por una sola persona, el M4 basta.
¿El Mac mini M6 es mucho más rápido que el M4 para un LLM?+
Para la lectura del prompt, sí: Apple anuncia una velocidad hasta 4,8 veces mayor en LM Studio. Para la generación, no: el ancho de banda pasa de 120 a 153 GB/s en el M6 de base, lo que representa aproximadamente un 28 % más. Las respuestas cortas cambian poco, los contextos largos mucho.
¿Se pueden conectar varios Mac mini en un clúster para un LLM?+
Sí, con una herramienta como exo, especialmente para cargar un modelo demasiado grande para una sola máquina. El M4 Pro ofrece Thunderbolt 5 (120 Gb/s), el M4 solo Thunderbolt 4 (40 Gb/s). Los beneficios publicados por exo se refieren a Mac Studio: verifica en tu configuración.
¿Cuánto consume un Mac mini M4 como servidor LLM 24 h/24?+
Apple anuncia 4 W en reposo y 65 W como máximo para el M4 (5 W y 140 W para el M4 Pro). En reposo permanente, 4 W × 8 760 h dan aproximadamente 35 kWh al año; multiplica por tu tarifa por kWh. Durante la inferencia, Apple no publica ninguna cifra: un medidor de consumo enchufable permite conocer el valor real.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.