Principiante 12 minMac mini

¿Qué LLM en Mac mini M2 / M2 Pro (8–32 GB)? ?

Respuesta directa

Un Mac mini M2 o M2 Pro sirve como servidor LLM doméstico silencioso: con 16 GB de memoria unificada ejecuta un modelo de 8-9B en Q4; con 32 GB (solo en el M2 Pro), un modelo de 24 a 32B o un MoE de 30-35B. La comodidad de uso depende del ancho de banda: 100 GB/s en el M2 frente a 200 GB/s en el M2 Pro. Con el mismo modelo, el M2 Pro genera casi al doble de velocidad. Evita la versión de 8 GB.

El Mac mini M2 de enero de 2023 fue reemplazado por el M4 a finales de 2024, pero sigue siendo muy habitual en el mercado de segunda mano. Esta página explica qué permite realmente cada configuración de memoria, qué rendimiento en tokens por segundo muestran las mediciones publicadas, cómo configurarlo como servidor Ollama accesible desde toda la red local y cuándo pasa a ser preferible un modelo más reciente.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en macOS 14+
Hardware recomendado

Alternativa de compra para esta guía: Mac mini M5 Pro (24 GB / 512 GB).

¿Por qué esta elección? Nuestra ficha completa sobre Mac mini M5 Pro (24 GB / 512 GB) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

#Mac mini M2 / M2 Pro en 2026: lo que promete la ficha técnica

Apple presentó el Mac mini M2 en enero de 2023 con «hasta 24 GB de memoria unificada y 100 GB/s de ancho de banda» y el M2 Pro con 200 GB/s, es decir, el doble, y hasta 32 GB de memoria. Las especificaciones de Apple indican las configuraciones de serie y personalizadas: el M2 empieza en 8 GB, configurable en 16 o 24 GB; el M2 Pro empieza en 16 GB, configurable en 32 GB. Por tanto, no existe un M2 de 32 GB ni un M2 Pro de 8 GB. La memoria está soldada: la elección se hace al comprar, no después.

Mac mini M2
8 núcleos CPU, 10 núcleos GPU, 100 GB/s, 8, 16 o 24 GB de memoria unificada.
Mac mini M2 Pro
10 o 12 núcleos de CPU, 16 o 19 núcleos de GPU, 200 GB/s, 16 o 32 GB.
Refrigeración
Ventilador activo: Apple anuncia un sistema térmico diseñado para rendimiento continuo, lo cual es importante en una máquina que atiende peticiones todo el día.
Consumo
Según la ficha oficial de Apple: 7 W en reposo, 50 W máximo para el M2 y 100 W máximo para el M2 Pro. Los valores más bajos que a veces se leen (10 a 30 W) son mediciones de usuarios, no límites.
i
Por qué el M2 sigue siendo una opción viable como servidor
La principal ventaja no es la velocidad pura, sino el equilibrio entre ruido, espacio ocupado y consumo en reposo: 7 W en reposo según Apple. Una máquina que responde diez minutos al día y permanece en suspensión el resto del tiempo cuesta muy poco de mantener en funcionamiento. Para la velocidad, hay que fijarse en el ancho de banda.

#M2 o M2 Pro: la elección depende del ancho de banda

El kit Mac

La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

En la generación de texto, cada token obliga al chip a volver a leer todos los pesos activos del modelo desde la memoria. Por tanto, la velocidad está limitada por el ancho de banda dividido por el tamaño del modelo. Un M2 a 100 GB/s y un modelo de 5 GB dan un límite teórico cercano a 20 tokens por segundo; el M2 Pro, a 200 GB/s, duplica ese límite. La capacidad de memoria, por su parte, solo determina lo que cabe: un 24B en Q4 (aproximadamente 14 GB) no deja nada para el sistema en una máquina de 16 GB.

M2 o M2 Pro para un servidor LLM
CriterioMac mini M2Mac mini M2 Pro
Ancho de banda100 GB/s200 GB/s
Opciones de memoria8, 16 o 24 GB16 o 32 GB
Uso más grande cómodo8-9B en Q4 con 16 GB; 12-14B con 24 GBDe 24B a 32B en Q4 con 32 GB
Multiusuario, RAGUno o dos usuarios con un uso ligeroVarias peticiones cortas son aceptables
Consumo máximo (Apple)50 W100 W

El M2 de 24 GB es la configuración híbrida: tiene capacidad para un modelo de 14B, pero mantiene el ancho de banda del M2. Por tanto, carga modelos más grandes que el M2 de 16 GB sin ejecutarlos más rápido. Elígelo si quieres una ventana de contexto larga o dos modelos cargados; de lo contrario, el M2 Pro de 16 GB, dos veces más rápido con el mismo modelo, suele ser mejor para un uso interactivo.

#Qué modelo para qué capacidad de memoria: el cálculo, no la promesa

No todo se carga en la memoria de la GPU. En Apple Silicon, Metal limita por defecto la parte de memoria unificada que puede usar la GPU a entre dos tercios y tres cuartos, según las discusiones del repositorio llama.cpp. En una máquina de 16 GB, calcula aproximadamente entre 10 y 12 GB para el modelo y su contexto; el resto se reserva para macOS. La referencia del sitio para los pesos en Q4 es 8B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19-20 GB; a esto se añade la caché de contexto.

Lo que cabe según la memoria disponible (tamaño de los pesos en Q4 del catálogo QuelLLM, sin contar la memoria del contexto)
Modelo (Q4)Tamaño del modeloM2 8 GBM2 16 GBM2 24 GB / M2 Pro 16 GBM2 Pro 32 GB
Qwen 3.5 4B2,3 GBSíSíSíSí
Granite 4.2 8B4,6 GBExactoSíSíSí
Qwen 3.5 9B6 GBNoSíSíSí
Gemma 4 12B7 GBNoExactoSíSí
Mistral Small 3.2 24B14 GBNoNoNo (24 GB: muy justo)Sí
Qwen 3.6 35B-A3B (MoE)21 GBNoNoNoSí, con poco margen

Cómo interpretar la tabla: «Ajustado» significa que los pesos caben en la memoria, pero el contexto largo y macOS compiten por lo que queda. La versión de 8 GB debe descartarse para cualquier uso serio: macOS y el navegador ya ocupan la mitad de la memoria. El MoE 35B-A3B es un caso particular: ocupa 21 GB, pero solo activa unos 3 mil millones de parámetros por token, lo que lo hace considerablemente más rápido que un modelo denso del mismo tamaño. Es la mejor razón para elegir un M2 Pro de 32 GB.

#Las velocidades medidas: lo que permite afirmar la fuente publicada

No tenemos mediciones propias y no presentamos ninguna. La referencia pública más útil es el hilo «Performance of llama.cpp on Apple Silicon M-series» del repositorio llama.cpp, donde los usuarios publican resultados de generación de texto (tg128) de un modelo Llama 7B en cada chip de Apple. Estas cifras corresponden a la versión de llama.cpp de aquella época y a un modelo más antiguo que los actuales, pero dan una idea de la escala.

Generación de texto, Llama 7B, llama.cpp (discusión #4167)
ChipAncho de bandaQ4_0Q8_0F16
M2, 10 núcleos de GPU100 GB/s21,91 t/s12,21 t/s6,72 t/s
M2 Pro, 16 núcleos GPU200 GB/s37,87 t/s22,70 t/s12,47 t/s
M2 Pro, 19 núcleos GPU200 GB/s38,86 t/s23,01 t/s13,06 t/s

Esta tabla confirma tres cosas. Primero, la velocidad sigue el tamaño de los pesos: pasar de Q4_0 a Q8_0 divide aproximadamente por 1,8 el caudal. Segundo, el M2 Pro va aproximadamente 1,7 veces más rápido que el M2, un poco menos que las 2 veces de la anchura de banda. Tercero, los núcleos GPU adicionales del M2 Pro de 19 núcleos casi no cambian la generación (38,86 frente a 37,87 t/s): ayudan al procesamiento del prompt, no a la generación.

→
El cálculo que puedes volver a hacer por tu cuenta
Para un M2 a 100 GB/s y un archivo de 3,8 GB, el máximo teórico se aproxima a 26 t/s; la medición anterior (21,91 t/s) representa aproximadamente el 84 %. Para un modelo 9B en Q4 de unos 6 GB, el mismo cálculo da un máximo cercano a 16 t/s en M2 y a 33 t/s en M2 Pro, antes de descontar las pérdidas. Son límites máximos calculados a partir de mediciones publicadas, no velocidades garantizadas.

#El contexto y el procesamiento del prompt: lo que realmente ralentiza

Los tokens por segundo no lo dicen todo. Dos cifras influyen en la experiencia: el tiempo de procesamiento del prompt (columna pp512 de las mismas mediciones: 201 t/s en F16 para el M2, 384 t/s para el M2 Pro de 19 núcleos) y el crecimiento de la caché de contexto. Un documento de 20 000 tokens de entrada requiere varias decenas de segundos antes de que aparezca la primera palabra, en cualquier Mac de esta generación. Para RAG o análisis de documentos, utiliza extractos cortos en lugar de pegar un PDF entero.

El caché de contexto también ocupa memoria: cuanto más larga es la ventana, menos memoria queda para los pesos. Con 16 GB, reducir la ventana a 8.000 o 16.000 tokens deja espacio para un modelo más grande. La guía sobre la ventana de contexto detalla la regla, y la guía sobre el caché KV explica cómo cuantizarlo.

#Instalar Ollama como servidor 24/7: el procedimiento que funciona

Ollama pide macOS Sonoma (14) o más reciente y escucha por defecto en 127.0.0.1, puerto 11434: es decir, únicamente desde la propia máquina. Para hacerlo accesible desde otros dispositivos, hay que cambiar la dirección de escucha. En Mac, la documentación oficial de la FAQ indica que, cuando Ollama corre como aplicación, las variables de entorno se definen con launchctl, y luego la aplicación debe reiniciarse.

  1. 01
    Instalar la aplicación Ollama
    Descarga la aplicación desde el sitio oficial o usa Homebrew; la guía de instalación en macOS detalla ambas opciones. No uses la aplicación y un servicio de Homebrew al mismo tiempo: compiten por el mismo puerto.
  2. 02
    Definir la dirección de escucha
    Ejecuta launchctl setenv OLLAMA_HOST 0.0.0.0:11434 en Terminal, luego cierra y vuelve a abrir la aplicación Ollama.
  3. 03
    Evitar la suspensión
    En Ajustes del Sistema, en la sección Ahorro de energía, activa la opción que impide la suspensión automática cuando la pantalla está apagada y activa el inicio de sesión automático si el Mac debe reiniciarse solo.
  4. 04
    Reservar una dirección fija
    Asigna una dirección IP fija al Mac mini en tu router, o úsalo con el nombre mac-mini.local en la red local.
  5. 05
    Precargar el modelo
    Descarga el modelo con ollama pull y luego pruébalo desde otro equipo con el comando curl que aparece a continuación.
Configuración y prueba
# Sur le Mac mini
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"
# quitter puis relancer l'application Ollama
ollama pull qwen3:8b

# Depuis un autre poste du réseau local
curl http://mac-mini.local:11434/api/chat -d '{"model":"qwen3:8b","stream":false,"messages":[{"role":"user","content":"Bonjour"}]}'
!
Exponer la API: una decisión de seguridad
Ollama no tiene autenticación. Escuchar en 0.0.0.0 es adecuado para una red doméstica de confianza; para cualquier acceso desde el exterior, nunca configures una redirección del puerto 11434 en tu router. Usa una VPN o un proxy inverso con autenticación. Por defecto, un modelo permanece 5 minutos en memoria después de la última solicitud: ajusta OLLAMA_KEEP_ALIVE si la primera llamada del día te parece lenta.

#Lo que el Mac mini ofrece a toda la casa

El Mac mini M2 no es un servidor de producción, pero es excelente para tres usos: un chat familiar, una API compatible con OpenAI para tus herramientas y automatizaciones ligeras. Ollama admite un subconjunto de la API de OpenAI en el mismo puerto, lo que permite conectar muchos clientes existentes cambiando solo la dirección; verifica que las funciones que necesitas (herramientas, salidas estructuradas) estén cubiertas.

Chat
Open WebUI o una aplicación móvil compatible con Ollama: introduce la dirección http://mac-mini.local:11434 en los ajustes.
Código
Continue, Aider o Zed: indica la URL del servidor Ollama como proveedor.
Automatización
n8n, Home Assistant o Atajos de iOS: pueden llamar a una API HTTP compatible con OpenAI.
Indexación de documentos
Un modelo de embedding ligero, como nomic-embed-text, deja espacio para un modelo de chat de 8-9B en 16 GB.

Una limitación que debes conocer: Ollama procesa por defecto una solicitud a la vez por modelo (OLLAMA_NUM_PARALLEL vale 1). Dos personas que hacen una pregunta al mismo tiempo comparten la capacidad de procesamiento o esperan su turno. Para una familia, es suficiente; para un equipo de más de tres o cuatro personas activas, conviene una máquina más potente o un servidor de inferencia diseñado para el paralelismo.

#Mac mini M2 o máquina más reciente: ¿cuándo cambiar?

La versión base del M4 pasa a 120 GB/s (valor de la tabla de llama.cpp) y el M4 Pro a 273 GB/s, según Apple; al ser el ancho de banda el factor limitante, la diferencia de velocidad es de aproximadamente un 20 % entre las versiones base del M2 y del M4, y mucho mayor entre el M2 Pro y el M4 Pro. El M2 Pro de 32 GB de segunda mano sigue siendo una opción pertinente si buscas un modelo de 24 a 32B; para tareas con agentes o programación con contextos largos, un chip más reciente con más memoria aporta mayor comodidad.

¿Cuándo quedarse en M2 y cuándo cambiar?
SituaciónRecomendación
Chat familiar 8-9B, presupuesto ajustadoUn M2 de segunda mano con 16 GB es suficiente
Modelo de 24 a 32B o MoE de 30-35BM2 Pro de 32 GB, o un Mac más reciente con 32 GB o más
Contextos largos, agentes, varios usuariosUn Mac mini M4 Pro o superior
Necesitas 64 GB o másMac Studio, nunca un M2 mini

#Preguntas frecuentes

FAQ
¿Puede el Mac mini M2 funcionar las 24 horas del día como servidor LLM?+
Sí, está diseñado para permanecer encendido: Apple indica un consumo de 7 W en reposo y lo equipa con un ventilador activo para soportar cargas sostenidas. El ajuste que realmente hay que hacer es impedir la suspensión automática. Durante la inferencia intensiva, el consumo aumenta, pero Apple indica un máximo de 50 W para el M2 y de 100 W para el M2 Pro.
¿Qué Mac mini M2 elegir de segunda mano para la IA local?+
El M2 Pro de 32 GB para modelos de 24 a 32B o un MoE de 30-35B, el M2 de 16 GB para modelos de 8-9B al mejor precio. Evita el de 8 GB: macOS ya consume la mitad. Como la memoria está soldada, verifica la configuración exacta en «Acerca de este Mac» antes de comprar.
¿Cuántos tokens por segundo da un Mac mini M2?+
Las mediciones publicadas en el repositorio de llama.cpp dan 21,9 t/s en M2 y entre 37,9 y 38,9 t/s en M2 Pro, para un Llama 7B en Q4_0. Para un modelo 9B en Q4, espera valores inferiores. Son mediciones de usuarios que deben tomarse como una orientación aproximada.
¿Se puede usar el Mac mini M2 desde un iPhone u otro ordenador?+
Sí. Una vez definido OLLAMA_HOST como 0.0.0.0:11434, cualquier cliente de la red local compatible con Ollama u OpenAI puede conectarse a él, incluidas las aplicaciones iOS que piden la dirección del servidor. Sin embargo, no lo expongas en Internet sin una VPN ni un proxy inverso con autenticación, porque la API de Ollama no ofrece ninguna.
¿El Mac mini M2 es más rápido que un MacBook Air M2?+
Con el mismo chip, el ancho de banda es el mismo, por lo que las velocidades máximas de generación son similares. La ventaja del Mac mini es su ventilador: soporta la carga sin reducir su frecuencia, mientras que un MacBook Air sin ventilador termina ralentizándose durante las generaciones largas.
¿Se puede afinar un modelo en un Mac mini M2 Pro?+
Para un modelo pequeño, un fine-tuning con LoRA mediante MLX es posible, pero lento: prevé varias horas según el tamaño del conjunto de datos. Un fine-tuning completo no es viable con 32 GB de memoria compartida con macOS. Lo más razonable es usar el Mac mini para la inferencia y alquilar una GPU de forma puntual para el entrenamiento.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.