¿Qué LLM en Mac mini M2 / M2 Pro (8–32 GB)? ?
Un Mac mini M2 o M2 Pro sirve como servidor LLM doméstico silencioso: con 16 GB de memoria unificada ejecuta un modelo de 8-9B en Q4; con 32 GB (solo en el M2 Pro), un modelo de 24 a 32B o un MoE de 30-35B. La comodidad de uso depende del ancho de banda: 100 GB/s en el M2 frente a 200 GB/s en el M2 Pro. Con el mismo modelo, el M2 Pro genera casi al doble de velocidad. Evita la versión de 8 GB.
El Mac mini M2 de enero de 2023 fue reemplazado por el M4 a finales de 2024, pero sigue siendo muy habitual en el mercado de segunda mano. Esta página explica qué permite realmente cada configuración de memoria, qué rendimiento en tokens por segundo muestran las mediciones publicadas, cómo configurarlo como servidor Ollama accesible desde toda la red local y cuándo pasa a ser preferible un modelo más reciente.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: Mac mini M5 Pro (24 GB / 512 GB).
¿Por qué esta elección? Nuestra ficha completa sobre Mac mini M5 Pro (24 GB / 512 GB) →
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.
#Mac mini M2 / M2 Pro en 2026: lo que promete la ficha técnica
Apple presentó el Mac mini M2 en enero de 2023 con «hasta 24 GB de memoria unificada y 100 GB/s de ancho de banda» y el M2 Pro con 200 GB/s, es decir, el doble, y hasta 32 GB de memoria. Las especificaciones de Apple indican las configuraciones de serie y personalizadas: el M2 empieza en 8 GB, configurable en 16 o 24 GB; el M2 Pro empieza en 16 GB, configurable en 32 GB. Por tanto, no existe un M2 de 32 GB ni un M2 Pro de 8 GB. La memoria está soldada: la elección se hace al comprar, no después.
- Mac mini M2
- 8 núcleos CPU, 10 núcleos GPU, 100 GB/s, 8, 16 o 24 GB de memoria unificada.
- Mac mini M2 Pro
- 10 o 12 núcleos de CPU, 16 o 19 núcleos de GPU, 200 GB/s, 16 o 32 GB.
- Refrigeración
- Ventilador activo: Apple anuncia un sistema térmico diseñado para rendimiento continuo, lo cual es importante en una máquina que atiende peticiones todo el día.
- Consumo
- Según la ficha oficial de Apple: 7 W en reposo, 50 W máximo para el M2 y 100 W máximo para el M2 Pro. Los valores más bajos que a veces se leen (10 a 30 W) son mediciones de usuarios, no límites.
#M2 o M2 Pro: la elección depende del ancho de banda
La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
En la generación de texto, cada token obliga al chip a volver a leer todos los pesos activos del modelo desde la memoria. Por tanto, la velocidad está limitada por el ancho de banda dividido por el tamaño del modelo. Un M2 a 100 GB/s y un modelo de 5 GB dan un límite teórico cercano a 20 tokens por segundo; el M2 Pro, a 200 GB/s, duplica ese límite. La capacidad de memoria, por su parte, solo determina lo que cabe: un 24B en Q4 (aproximadamente 14 GB) no deja nada para el sistema en una máquina de 16 GB.
| Criterio | Mac mini M2 | Mac mini M2 Pro |
|---|---|---|
| Ancho de banda | 100 GB/s | 200 GB/s |
| Opciones de memoria | 8, 16 o 24 GB | 16 o 32 GB |
| Uso más grande cómodo | 8-9B en Q4 con 16 GB; 12-14B con 24 GB | De 24B a 32B en Q4 con 32 GB |
| Multiusuario, RAG | Uno o dos usuarios con un uso ligero | Varias peticiones cortas son aceptables |
| Consumo máximo (Apple) | 50 W | 100 W |
El M2 de 24 GB es la configuración híbrida: tiene capacidad para un modelo de 14B, pero mantiene el ancho de banda del M2. Por tanto, carga modelos más grandes que el M2 de 16 GB sin ejecutarlos más rápido. Elígelo si quieres una ventana de contexto larga o dos modelos cargados; de lo contrario, el M2 Pro de 16 GB, dos veces más rápido con el mismo modelo, suele ser mejor para un uso interactivo.
#Qué modelo para qué capacidad de memoria: el cálculo, no la promesa
No todo se carga en la memoria de la GPU. En Apple Silicon, Metal limita por defecto la parte de memoria unificada que puede usar la GPU a entre dos tercios y tres cuartos, según las discusiones del repositorio llama.cpp. En una máquina de 16 GB, calcula aproximadamente entre 10 y 12 GB para el modelo y su contexto; el resto se reserva para macOS. La referencia del sitio para los pesos en Q4 es 8B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19-20 GB; a esto se añade la caché de contexto.
| Modelo (Q4) | Tamaño del modelo | M2 8 GB | M2 16 GB | M2 24 GB / M2 Pro 16 GB | M2 Pro 32 GB |
|---|---|---|---|---|---|
| Qwen 3.5 4B | 2,3 GB | Sí | Sí | Sí | Sí |
| Granite 4.2 8B | 4,6 GB | Exacto | Sí | Sí | Sí |
| Qwen 3.5 9B | 6 GB | No | Sí | Sí | Sí |
| Gemma 4 12B | 7 GB | No | Exacto | Sí | Sí |
| Mistral Small 3.2 24B | 14 GB | No | No | No (24 GB: muy justo) | Sí |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | No | No | No | Sí, con poco margen |
Cómo interpretar la tabla: «Ajustado» significa que los pesos caben en la memoria, pero el contexto largo y macOS compiten por lo que queda. La versión de 8 GB debe descartarse para cualquier uso serio: macOS y el navegador ya ocupan la mitad de la memoria. El MoE 35B-A3B es un caso particular: ocupa 21 GB, pero solo activa unos 3 mil millones de parámetros por token, lo que lo hace considerablemente más rápido que un modelo denso del mismo tamaño. Es la mejor razón para elegir un M2 Pro de 32 GB.
#Las velocidades medidas: lo que permite afirmar la fuente publicada
No tenemos mediciones propias y no presentamos ninguna. La referencia pública más útil es el hilo «Performance of llama.cpp on Apple Silicon M-series» del repositorio llama.cpp, donde los usuarios publican resultados de generación de texto (tg128) de un modelo Llama 7B en cada chip de Apple. Estas cifras corresponden a la versión de llama.cpp de aquella época y a un modelo más antiguo que los actuales, pero dan una idea de la escala.
| Chip | Ancho de banda | Q4_0 | Q8_0 | F16 |
|---|---|---|---|---|
| M2, 10 núcleos de GPU | 100 GB/s | 21,91 t/s | 12,21 t/s | 6,72 t/s |
| M2 Pro, 16 núcleos GPU | 200 GB/s | 37,87 t/s | 22,70 t/s | 12,47 t/s |
| M2 Pro, 19 núcleos GPU | 200 GB/s | 38,86 t/s | 23,01 t/s | 13,06 t/s |
Esta tabla confirma tres cosas. Primero, la velocidad sigue el tamaño de los pesos: pasar de Q4_0 a Q8_0 divide aproximadamente por 1,8 el caudal. Segundo, el M2 Pro va aproximadamente 1,7 veces más rápido que el M2, un poco menos que las 2 veces de la anchura de banda. Tercero, los núcleos GPU adicionales del M2 Pro de 19 núcleos casi no cambian la generación (38,86 frente a 37,87 t/s): ayudan al procesamiento del prompt, no a la generación.
#El contexto y el procesamiento del prompt: lo que realmente ralentiza
Los tokens por segundo no lo dicen todo. Dos cifras influyen en la experiencia: el tiempo de procesamiento del prompt (columna pp512 de las mismas mediciones: 201 t/s en F16 para el M2, 384 t/s para el M2 Pro de 19 núcleos) y el crecimiento de la caché de contexto. Un documento de 20 000 tokens de entrada requiere varias decenas de segundos antes de que aparezca la primera palabra, en cualquier Mac de esta generación. Para RAG o análisis de documentos, utiliza extractos cortos en lugar de pegar un PDF entero.
El caché de contexto también ocupa memoria: cuanto más larga es la ventana, menos memoria queda para los pesos. Con 16 GB, reducir la ventana a 8.000 o 16.000 tokens deja espacio para un modelo más grande. La guía sobre la ventana de contexto detalla la regla, y la guía sobre el caché KV explica cómo cuantizarlo.
#Instalar Ollama como servidor 24/7: el procedimiento que funciona
Ollama pide macOS Sonoma (14) o más reciente y escucha por defecto en 127.0.0.1, puerto 11434: es decir, únicamente desde la propia máquina. Para hacerlo accesible desde otros dispositivos, hay que cambiar la dirección de escucha. En Mac, la documentación oficial de la FAQ indica que, cuando Ollama corre como aplicación, las variables de entorno se definen con launchctl, y luego la aplicación debe reiniciarse.
- 01Instalar la aplicación OllamaDescarga la aplicación desde el sitio oficial o usa Homebrew; la guía de instalación en macOS detalla ambas opciones. No uses la aplicación y un servicio de Homebrew al mismo tiempo: compiten por el mismo puerto.
- 02Definir la dirección de escuchaEjecuta launchctl setenv OLLAMA_HOST 0.0.0.0:11434 en Terminal, luego cierra y vuelve a abrir la aplicación Ollama.
- 03Evitar la suspensiónEn Ajustes del Sistema, en la sección Ahorro de energía, activa la opción que impide la suspensión automática cuando la pantalla está apagada y activa el inicio de sesión automático si el Mac debe reiniciarse solo.
- 04Reservar una dirección fijaAsigna una dirección IP fija al Mac mini en tu router, o úsalo con el nombre mac-mini.local en la red local.
- 05Precargar el modeloDescarga el modelo con ollama pull y luego pruébalo desde otro equipo con el comando curl que aparece a continuación.
#Lo que el Mac mini ofrece a toda la casa
El Mac mini M2 no es un servidor de producción, pero es excelente para tres usos: un chat familiar, una API compatible con OpenAI para tus herramientas y automatizaciones ligeras. Ollama admite un subconjunto de la API de OpenAI en el mismo puerto, lo que permite conectar muchos clientes existentes cambiando solo la dirección; verifica que las funciones que necesitas (herramientas, salidas estructuradas) estén cubiertas.
- Chat
- Open WebUI o una aplicación móvil compatible con Ollama: introduce la dirección http://mac-mini.local:11434 en los ajustes.
- Código
- Continue, Aider o Zed: indica la URL del servidor Ollama como proveedor.
- Automatización
- n8n, Home Assistant o Atajos de iOS: pueden llamar a una API HTTP compatible con OpenAI.
- Indexación de documentos
- Un modelo de embedding ligero, como nomic-embed-text, deja espacio para un modelo de chat de 8-9B en 16 GB.
Una limitación que debes conocer: Ollama procesa por defecto una solicitud a la vez por modelo (OLLAMA_NUM_PARALLEL vale 1). Dos personas que hacen una pregunta al mismo tiempo comparten la capacidad de procesamiento o esperan su turno. Para una familia, es suficiente; para un equipo de más de tres o cuatro personas activas, conviene una máquina más potente o un servidor de inferencia diseñado para el paralelismo.
#Mac mini M2 o máquina más reciente: ¿cuándo cambiar?
La versión base del M4 pasa a 120 GB/s (valor de la tabla de llama.cpp) y el M4 Pro a 273 GB/s, según Apple; al ser el ancho de banda el factor limitante, la diferencia de velocidad es de aproximadamente un 20 % entre las versiones base del M2 y del M4, y mucho mayor entre el M2 Pro y el M4 Pro. El M2 Pro de 32 GB de segunda mano sigue siendo una opción pertinente si buscas un modelo de 24 a 32B; para tareas con agentes o programación con contextos largos, un chip más reciente con más memoria aporta mayor comodidad.
| Situación | Recomendación |
|---|---|
| Chat familiar 8-9B, presupuesto ajustado | Un M2 de segunda mano con 16 GB es suficiente |
| Modelo de 24 a 32B o MoE de 30-35B | M2 Pro de 32 GB, o un Mac más reciente con 32 GB o más |
| Contextos largos, agentes, varios usuarios | Un Mac mini M4 Pro o superior |
| Necesitas 64 GB o más | Mac Studio, nunca un M2 mini |
- Mac mini M4 / M4 Pro: el sucesor
- Hoja de especificaciones: Mac mini M4 Pro
- Ajustes de macOS para Apple Silicon
- Instalar Ollama en macOS
- Fuente: Apple, ficha técnica del Mac mini (2023)
- Fuente: Apple, consumo y disipación térmica del Mac mini
- Fuente: mediciones de llama.cpp en chips Apple
- Fuente: FAQ oficial de Ollama
#Preguntas frecuentes
¿Puede el Mac mini M2 funcionar las 24 horas del día como servidor LLM?+
¿Qué Mac mini M2 elegir de segunda mano para la IA local?+
¿Cuántos tokens por segundo da un Mac mini M2?+
¿Se puede usar el Mac mini M2 desde un iPhone u otro ordenador?+
¿El Mac mini M2 es más rápido que un MacBook Air M2?+
¿Se puede afinar un modelo en un Mac mini M2 Pro?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.