Inicio › Catálogo › Mejor LLM en Mac con 24 GB de memoria unificada en 2026

Mejor LLM en Mac con 24 GB de memoria unificada en 2026

◆ Mac — La IA local en tu Mac, a fondo — memoria unificada, MLX, el modelo adecuado para tu chip · 24 € · o todos los kits por 49 € →

Clasificación actualizada el 09/10/2026

24 GB de memoria unificada (MacBook Air M2/M3/M4 en sus configuraciones superiores, M4 Pro básico, iMac M4 en sus configuraciones superiores) permiten ejecutar los modelos 13-14B en Q4 y los MoE 30B-A3B. Punto óptimo para una inferencia local de calidad.

Ofertas y alternativas para la IA local

Compara los precios de Mac mini M5 Pro (24 GB / 512 GB) en nuestros comercios asociados (fichas de producto verificadas):

¿Por qué esta elección? Nuestra ficha completa sobre Mac mini M5 Pro (24 GB / 512 GB) →

¿Qué PC elegir según tu presupuesto? Nuestras opciones de 800 a 3 500 € →

Enlaces de afiliación — QuéLLM puede percibir una comisión por las compras, sin coste adicional para ti, lo que no influye en la clasificación (establecida de forma independiente). Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

Clasificación

1

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B de parámetros · Apache 2.0 · 128 000 tokens ctx

Variante MoE de Gemma 4. 26B/4B activos. Multimodal completo (texto+imagen+audio).

Por qué esta posición Variante MoE de Gemma 4. 26B/4B activos. Multimodal completo (texto+imagen+audio).
ollama run gemma4:26b
En Apple M4 Pro (48 GB)
Q8
28 GB · 22 tok/s
2

🇺🇸 Granite 4.1 8B Instruct

IBM · 8 mil millones de parámetros · Apache 2.0 · 131 072 tokens ctx

Dense 8B Apache 2.0, 12 idiomas, incluido FR, 131k ctx, GQA 32Q/8KV. MMLU 73.84, HumanEval 85.37. Salida 29 de abril de 2026.

Por qué esta posición Dense 8B Apache 2.0, 12 idiomas, incluido FR, 131k ctx, GQA 32Q/8KV. MMLU 73.84, HumanEval 85.37. Salida 29 de abril de 2026.
# HuggingFace : ibm-granite/granite-4.1-8b
En Apple M4 Pro (48 GB)
FP16
16 GB · 35 tok/s
3

🇺🇸 Gemma 4 12B

Google · 12 mil millones de parámetros · Apache 2.0 · 262 144 tokens ctx

Gemma 4 12B (Google): modelo denso multimodal (texto, visión, audio), 256k de contexto, ~7 GB de VRAM en Q4. Apache 2.0, multilingüe.

Por qué esta posición Gemma 4 12B (Google): modelo denso multimodal (texto, visión, audio), 256k de contexto, ~7 GB de VRAM en Q4. Apache 2.0, multilingüe.
# HuggingFace : google/gemma-4-12B
En Apple M4 Pro (48 GB)
FP16
24 GB · 28 tok/s
4

🇺🇸 Granite 4.2 8B

IBM · 8 mil millones de parámetros · Apache 2.0 · 128 000 tokens ctx

Granite 4.2 8B (IBM): modelo denso con licencia Apache 2.0, contexto de 128k, ~4,6 GB de VRAM en Q4. Chat, código y razonamiento multilingües para empresas.

Por qué esta posición Granite 4.2 8B (IBM): modelo denso con licencia Apache 2.0, contexto de 128k, ~4,6 GB de VRAM en Q4. Chat, código y razonamiento multilingües para empresas.
ollama pull granite4.2
En Apple M4 Pro (48 GB)
FP16
16 GB · 50 tok/s
5

🇺🇸 OLMo 3 7B Think (SFT)

zimplex · 7B parámetros · Apache 2.0 · 16 000 tokens ctx

Ajuste fino SFT «thinking» de OLMo 3 7B: razonamiento paso a paso, contexto de 16k, ~4,2 GB de VRAM en Q4. 100 % abierto, licencia Apache 2.0.

Por qué esta posición Ajuste fino SFT «thinking» de OLMo 3 7B: razonamiento paso a paso, contexto de 16k, ~4,2 GB de VRAM en Q4. 100 % abierto, licencia Apache 2.0.
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
En Apple M4 Pro (48 GB)
FP16
15 GB · 50 tok/s
6

🇨🇳 GLM 5.3 7B

Zhipu AI · 7B parámetros · MIT · 128 000 tokens ctx

GLM 5.3 (Zhipu): modelo denso de 7B especializado en código y razonamiento, contexto de 128k, ~4,1 GB de VRAM en Q4. Ligero, funciona en GPU de 6-8 GB, licencia MIT.

Por qué esta posición GLM 5.3 (Zhipu): modelo denso de 7B especializado en código y razonamiento, contexto de 128k, ~4,1 GB de VRAM en Q4. Ligero, funciona en GPU de 6-8 GB, licencia MIT.
ollama pull glm-5.3
En Apple M4 Pro (48 GB)
FP16
14 GB · 50 tok/s
7

🇨🇳 Qwen 3 14B

Alibaba · 14B parámetros · Apache 2.0 · 131 072 tokens ctx

Modelo denso de 14B con razonamiento híbrido. Iguala a Qwen 2.5 32B Base en STEM/código.

Por qué esta posición Modelo denso de 14B con razonamiento híbrido. Iguala a Qwen 2.5 32B Base en STEM/código.
ollama run qwen3:14b
En Apple M4 Pro (48 GB)
FP16
28 GB · 20 tok/s
8

🇺🇸 Phi-4 Reasoning 14B

Microsoft · 14B parámetros · MIT · 32 768 tokens ctx

Modelo de razonamiento de 14B con licencia MIT. Supera a R1-Distill-Llama-70B en las evaluaciones AIME24/25 de Microsoft con una quinta parte de los parámetros.

Por qué esta posición Modelo de razonamiento de 14B con licencia MIT. Supera a R1-Distill-Llama-70B en las evaluaciones AIME24/25 de Microsoft con una quinta parte de los parámetros.
ollama run phi4-reasoning:14b
En Apple M4 Pro (48 GB)
FP16
28 GB · 20 tok/s

Tabla comparativa

Puesto Modelo Params VRAM Q4 Contexto Licencia En Apple M4 Pro (48 GB)
#1 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0 22 tok/s · Q8
#2 Granite 4.1 8B Instruct 8B 5 GB 131 072 Apache 2.0 35 tok/s · FP16
#3 Gemma 4 12B 12B 7 GB 262 144 Apache 2.0 28 tok/s · FP16
#4 Granite 4.2 8B 8B 4.6 GB 128 000 Apache 2.0 50 tok/s · FP16
#5 OLMo 3 7B Think (SFT) 7B 4.2 GB 16 000 Apache 2.0 50 tok/s · FP16
#6 GLM 5.3 7B 7B 4.1 GB 128 000 MIT 50 tok/s · FP16
#7 Qwen 3 14B 14B 9 GB 131 072 Apache 2.0 20 tok/s · FP16
#8 Phi-4 Reasoning 14B 14B 9 GB 32 768 MIT 20 tok/s · FP16
El kit Mac

La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Memo gratuito

¿Qué modelo para programar ejecutar en TU máquina?

Recibe el resumen VRAM → mejor modelo de código → comando Ollama (una sola pantalla, copiar y pegar). Y pasa al kit Copiloto Local para convertirlo en una configuración que realmente funcione.

El kit Copiloto Local — las configuraciones de Ollama + Cline + Aider listas para pegar, Modelfiles ajustados, solución de problemas, espacio en línea de por vida →

Sin spam. Darte de baja en 1 clic. Tus datos se quedan con nosotros (nunca se venden).

Metodología del ranking

Filtro: modelos de 3 a 32B con Q4_K_M que ocupan menos de 16 GB (deja 8 GB para macOS + contexto). Bonus de 7 a 14B (densidad pico de 24 GB) y MoE 30B-A3B (punto ideal Apple).

Criterios considerados:

  • Q4_K_M ≤ 16 GB
  • Punto óptimo 7-14B + MoE 30B-A3B
  • Contexto cómodo de 16-32k
  • Tokens/sec ≥ 20

La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.

Preguntas frecuentes

Mac de 24 GB: ¿el punto ideal para los LLM en 2026?

Sí para modelos de 1 usuario. Qwen 3 14B Q4 (~8 GB), Mistral Nemo 12B Q4 (~7 GB), Qwen 3 30B-A3B (MoE, ~17 GB) — todos funcionan a 25-40 tokens/seg. Para 13B+ densos soportados, se necesitan 32 GB o más.

¿MacBook Air M4 24 GB vs Mac mini M4 24 GB?

Exactamente el mismo chip M4 + 120 GB/s. Diferencia: Air = sin ventilador (reduce su rendimiento tras ~10 min de generación sostenida), mini = con ventilador y, por tanto, estable 24/7. Ver MBA M4 o mini M4.

¿Qué modelo permite programar en un Mac con 24 GB?

Qwen 2.5 Coder 14B Q4 (~8 GB) o DeepSeek Coder V2 16B Q4 (~9 GB) — excelentes para Python/JS/Go. Qwen 3 14B como modelo generalista. Consulta clasificación para programación.

¿Bastan 24 GB para un asistente + RAG?

Sí: Mistral Nemo 12B Q4 (~7 GB) + ChromaDB (1-2 GB) + contexto 32k (~3 GB) = ~12 GB consumidos. Margen cómodo. Ver el guía RAG.

Para ir más allá

Los kits de QuelLLM La guía de referencia según el uso
Todos los kits de por vida — 49 €