Principiante 11 minMacBook Air

Qué LLM usar en un MacBook Air M4 (16 / 24 / 32 GB) ?

Respuesta directa

El MacBook Air M4 ejecuta cómodamente modelos de 8 a 12 mil millones de parámetros con 16 GB, un modelo de 24B en Q4 con 24 GB y un modelo de expertos de 30B con 32 GB. Su ancho de banda de 120 GB/s limita la velocidad de un 8B en Q4 a aproximadamente 24 tokens por segundo; la memoria, no ampliable, determina el tamaño del modelo.

El M4 es el primer Air que parte de 16 GB y llega hasta 32 GB. Esta página indica qué memoria elegir, calcula la velocidad máxima que puede alcanzar el chip, lo compara con el Air M5, el MacBook Pro y el Mac mini, y señala los límites del Air.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en macOS 14+
Hardware recomendado

Alternativa de compra para esta guía: MacBook Pro M5 Pro — 24 GB / 1 TB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#MacBook Air M4: 120 GB/s y hasta 32 GB de memoria

El MacBook Air M4 es el primer Air que parte de 16 GB de memoria unificada y puede llegar hasta 32 GB, con un ancho de banda de 120 GB/s. Para un LLM, estas dos cifras importan más que el número de núcleos: la memoria determina el tamaño del modelo que se puede cargar y el ancho de banda determina su velocidad máxima. A 120 GB/s, un modelo de 8 mil millones de parámetros en Q4 no supera los 24 tokens por segundo en teoría; la velocidad real es más baja.

Chip
Apple M4: CPU de 10 núcleos (4 de rendimiento, 6 de eficiencia), GPU de 8 o 10 núcleos, Neural Engine de 16 núcleos, según la ficha técnica de Apple.
Memoria
16 GB de serie, configurable con 24 o 32 GB. Está soldada: la configuración se elige al comprar.
Ancho de banda
120 GB/s, según la ficha Apple, lo que representa un 20 % más que los 100 GB/s del Air M3.
Neural Engine
Apple anuncia hasta 38 billones de operaciones por segundo para el M4. Los motores comunes (Ollama, llama.cpp) se ejecutan principalmente en la GPU mediante Metal; por tanto, esta cifra no se traduce en tokens por segundo.
Refrigeración
Sin ventilador: el calor se evacúa por el chasis, lo que limita cargas muy largas.

No hay VRAM separada en un Mac: la GPU utiliza la memoria unificada. Cuando se busca «VRAM del MacBook Air M4», la respuesta práctica es la memoria total menos la parte reservada al sistema, dentro del límite que macOS permite utilizar a la GPU. Este límite se puede ajustar; la guía de optimización de macOS del sitio explica cómo hacerlo y qué riesgos conlleva.

#16, 24 o 32 GB: elegir la memoria

El kit Mac

La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

El modelo, su contexto y el sistema comparten la memoria. Las cantidades indicadas a continuación son estimaciones prudentes que debes contrastar con la presión de memoria del Monitor de Actividad: alrededor de 11 a 12 GB para el modelo en una máquina con 16 GB, de 17 a 19 GB en una con 24 GB y de 24 a 26 GB en una con 32 GB. El tamaño de los modelos sigue las referencias del sitio: 8B, aproximadamente 5 GB; 14B, aproximadamente 9 GB; 24B, aproximadamente 14 GB; 32B, aproximadamente de 19 a 20 GB en Q4.

MacBook Air M4: clase de modelo según la memoria (Q4_K_M)
MemoriaMargen estimadoClase de modelo para un uso cómodoAl límite
16 GB≈ 11 a 12 GB8-9B con contexto medio, 12B en Q414B en Q4 con contexto corto
24 GB≈ 17 a 19 GB12-14B cómodo, 24B en Q4 (≈ 14 GB)27B en Q4 (≈ 16 GB) con contexto reducido
32 GB≈ 24 a 26 GB24B en Q5-Q6, 27B en Q4, modelos MoE de 30B32B denso en Q4 (≈ 19-20 GB) con contexto largo
i
El umbral útil depende de la generación de modelos
Los modelos con expertos (MoE) cambian el cálculo: un 30B con 3B activos ocupa aproximadamente 19 GB en memoria, pero solo vuelve a leer una pequeña fracción de los pesos por cada token. Con 32 GB, funciona mucho más rápido que un modelo denso del mismo tamaño en memoria. Con 16 GB, no se carga: la memoria sigue siendo el primer filtro.

La cuestión es, por tanto, a qué tamaño quieres apuntar. Si te limitas a modelos de 8 a 12 mil millones de parámetros, 16 GB son suficientes. Para modelos de 24B o para un RAG con embedder y reranker en paralelo, 24 GB son el primer nivel cómodo. Con 32 GB, ganas sobre todo contexto largo y modelos MoE de 30B.

#La velocidad máxima con 120 GB/s

El principio: cada token generado obliga a leer los pesos activos. El límite es el ancho de banda dividido entre el tamaño de los pesos en gigabytes. La tabla aplica esta fórmula al M4 (120 GB/s). Son límites calculados, no mediciones: la velocidad real depende del motor, de la cuantización, del contexto y de la temperatura del chip.

Límite teórico de generación en Air M4 (120 GB/s, pesos activos en Q4): cálculo, no medición
ModeloPesos activosCálculoLímite máximo
3B≈ 2 GB120 ÷ 2≈ 60 tok/s
8B≈ 5 GB120 ÷ 5≈ 24 tok/s
9B≈ 6 GB120 ÷ 6≈ 20 tok/s
14B≈ 9 GB120 ÷ 9≈ 13 tok/s
24B≈ 14 GB120 ÷ 14≈ 8 a 9 tok/s
32B denso≈ 19 a 20 GB120 ÷ 19,5≈ 6 tok/s

Dos consecuencias prácticas. Un 8B en Q4 no superará aproximadamente los 24 tokens por segundo en este chip: una cifra anunciada de 34 tokens por segundo para este modelo es imposible sin otra técnica. Y un 24B denso se mantiene en torno a los 8 tokens por segundo en el mejor de los casos, es decir, a la velocidad de una lectura atenta: cómoda para un texto tranquilo, lenta para un agente que encadena llamadas. Para consultar mediciones reales, visita /benchmarks y fuentes externas que especifiquen el chip y la cuantización.

#M4 o M5: ¿cambia el panorama con la siguiente generación?

Apple ahora ofrece un MacBook Air M5. Su ficha indica 153 GB/s de ancho de banda, frente a 120 GB/s para el M4, lo que representa aproximadamente un 28 % más, con las mismas opciones de 16, 24 o 32 GB de memoria. Para un LLM limitado por el ancho de banda, la diferencia teórica máxima de velocidad es del mismo orden: un 8B en Q4 pasaría de unos 24 a unos 30 tokens por segundo en el límite.

Air M4 y Air M5: los datos útiles para un LLM, según Apple
CriterioAir M4Air M5
Ancho de banda120 GB/s153 GB/s
Memoria16, 24 o 32 GB16, 24 o 32 GB
Límite teórico 8B Q4≈ 24 tok/s≈ 30 tok/s

La memoria no cambia: un Air M5 de 16 GB no permite ejecutar más modelos que un Air M4 de 16 GB. Si encuentras un M4 configurado con 24 o 32 GB, es mejor que un M5 de 16 GB en cuanto al tamaño de los modelos; con la misma memoria, el M5 gana en velocidad. Compara los precios actuales en las tiendas: cambian demasiado para incluirlos aquí.

#Instalar y elegir el motor

  1. 01
    Instalar Ollama
    Descárgalo en ollama.com o con Homebrew. La guía de instalación para macOS detalla el arranque automático.
  2. 02
    Iniciar un modelo según la memoria
    9B con 16 GB, 24B en Q4 con 24 GB, un MoE de 30B con 32 GB. Al ejecutarlo por primera vez, se descarga el modelo.
  3. 03
    Verificar la GPU
    ollama ps affiche la répartition CPU/GPU dans la colonne PROCESSOR : tout sur le GPU est l'état attendu.
  4. 04
    Ajustar el contexto
    Con menos de 24 GiB de memoria, Ollama fija el contexto predeterminado en 4.000 tokens. Amplíalo según lo que necesites: la caché KV crece con él.
Terminal
brew install --cask ollama
ollama run qwen3.5:9b
ollama ps

MLX, el framework de Apple, aprovecha la memoria compartida del Mac sin copiar los datos entre CPU y GPU; LM Studio lo ofrece en forma de modelos MLX. Ambas vías funcionan: Ollama por su simplicidad y su API local, MLX y LM Studio para explorar los formatos de Apple. La guía de MLX frente a llama.cpp compara ambos enfoques, sin necesidad de repetir sus conclusiones aquí.

#Contexto largo y límite de memoria GPU

El modelo solo representa una parte del consumo de memoria: cada token de contexto añade una entrada al caché KV y la memoria realmente disponible para la GPU está limitada por macOS. Ollama utiliza automáticamente la atención flash cuando el motor y el hardware lo permiten, y permite cuantizar el caché KV mediante la variable OLLAMA_KV_CACHE_TYPE (f16 por defecto). Con 16 GB, este ajuste suele marcar la diferencia entre un contexto corto y uno de varios miles de tokens.

En cuanto a MLX, el repositorio mlx-lm indica que un modelo que cabe en memoria a menudo puede acelerarse aumentando el límite de memoria cableada del sistema mediante un ajuste sysctl. Es una modificación del sistema: requiere privilegios de administrador, no necesariamente persiste tras un reinicio y puede desestabilizar la máquina si el valor es demasiado alto. La guía de optimización de macOS detalla el procedimiento y el valor razonable según la memoria; no cambies ese límite sin haber leído la guía.

Terminal
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_FLASH_ATTENTION=1
ollama serve

#Air M4, MacBook Pro o Mac mini: cuál elegir para cada uso

El Air M4 gana en ligereza y silencio, pero no tiene ventilador: una carga prolongada hace que baje la frecuencia del chip. El MacBook Pro M4 Pro o Max añade ventiladores, un ancho de banda de 273 a 546 GB/s y hasta 128 GB de memoria según la ficha de Apple; el Mac mini M4 ofrece un equipo de sobremesa con refrigeración activa.

Elegir según el uso
Tu necesidadEquipo adecuadoPor qué
Chat, resumen, código ligero, movilidadAir M4 16 o 24 GBSilencio, autonomía, modelos de 8 a 14B
Modelos de 24 a 32B, contexto largoAir M4 32 GB o Mac miniMemoria suficiente; Mac mini si el equipo se queda en la oficina
Tareas de larga duración, varios modelosMacBook Pro M4 Pro o Max, Mac miniVentilación activa, mayor ancho de banda
Modelos de 70BMacBook Pro Max o Mac StudioUn modelo de 70B pesa aproximadamente 40 GB en Q4: fuera de alcance de un Air

#Limitaciones que debes conocer

Carga prolongada
Sin ventilador, una generación continua durante varias decenas de minutos termina reduciendo la frecuencia. Para un chat, el efecto no se nota; para indexación o procesos en lote, es mejor usar una máquina con ventilador.
Sin 70B
Un 70B pesa aproximadamente 40 GB en Q4: más de los 32 GB máximos del Air.
El Neural Engine no acelera Ollama
Los motores habituales utilizan la GPU mediante Metal. La NPU solo interviene en ciertos usos con Core ML.
Almacenamiento
Los modelos ocupan varios gigaoctetos cada uno en el directorio de modelos de Ollama: un SSD de 256 GB se llena rápidamente con varios modelos de 5 a 15 GB.

#Preguntas frecuentes

FAQ
¿Basta con un MacBook Air M4 de 16 GB para un LLM local?+
Sí para modelos de 8 a 12 mil millones de parámetros en Q4, que pesan entre 5 y 8 GB y dejan margen para el sistema y el contexto. Un modelo de 14 mil millones cabe con un contexto corto. Para modelos de 24B o un RAG pesado, hay que optar por 24 o 32 GB, ya que la memoria no se puede ampliar.
¿Cuánta VRAM tiene un MacBook Air M4?+
Sin VRAM separada: la GPU comparte la memoria unificada con el procesador, de 16, 24 o 32 GB según la configuración. macOS limita la parte que la GPU puede reservar, por lo que el modelo cargado no puede ocupar toda la memoria. La guía de optimización para macOS explica cómo aumentar este límite.
¿Qué velocidad se puede esperar de un modelo 8B en un MacBook Air M4?+
El techo teórico es de 120 GB/s divididos por aproximadamente 5 GB, es decir, 24 tokens por segundo como máximo para un 8B en Q4. La velocidad real es inferior y depende del motor y del contexto. Una velocidad de generación anunciada claramente por encima de este techo debe generar dudas.
¿Es posible ejecutar un modelo de 30 mil millones de parámetros en un Air M4?+
Solo con 32 GB, y preferiblemente con un modelo de expertos que tenga pocos parámetros activos. Un 30B pesa aproximadamente 19 GB en Q4: cabe en el margen de 24 a 26 GB, pero un 30B denso sigue siendo lento, con un máximo de unos 6 tokens por segundo. Con 16 GB, no se carga.
¿Hay que esperar al Air M5 para la IA local?+
El M5 ofrece 153 GB/s frente a 120 GB/s, es decir, aproximadamente un 28 % más de ancho de banda, pero las mismas opciones de 16, 24 o 32 GB. Si encuentras un M4 con más memoria que un M5 por el mismo presupuesto, prioriza la memoria: determina el tamaño del modelo.
¿Se calienta el MacBook Air M4 con un LLM?+
No tiene ventilador, por lo que se calienta y reduce su frecuencia bajo carga sostenida. En intercambios cortos, el efecto es pequeño. En procesos largos, conecta el equipo a la red eléctrica, elévalo un poco y elige un modelo más pequeño. Para cargas continuas, opta por un Mac mini o un MacBook Pro.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.