Qué LLM usar en un MacBook Air M4 (16 / 24 / 32 GB) ?
El MacBook Air M4 ejecuta cómodamente modelos de 8 a 12 mil millones de parámetros con 16 GB, un modelo de 24B en Q4 con 24 GB y un modelo de expertos de 30B con 32 GB. Su ancho de banda de 120 GB/s limita la velocidad de un 8B en Q4 a aproximadamente 24 tokens por segundo; la memoria, no ampliable, determina el tamaño del modelo.
El M4 es el primer Air que parte de 16 GB y llega hasta 32 GB. Esta página indica qué memoria elegir, calcula la velocidad máxima que puede alcanzar el chip, lo compara con el Air M5, el MacBook Pro y el Mac mini, y señala los límites del Air.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: MacBook Pro M5 Pro — 24 GB / 1 TB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#MacBook Air M4: 120 GB/s y hasta 32 GB de memoria
El MacBook Air M4 es el primer Air que parte de 16 GB de memoria unificada y puede llegar hasta 32 GB, con un ancho de banda de 120 GB/s. Para un LLM, estas dos cifras importan más que el número de núcleos: la memoria determina el tamaño del modelo que se puede cargar y el ancho de banda determina su velocidad máxima. A 120 GB/s, un modelo de 8 mil millones de parámetros en Q4 no supera los 24 tokens por segundo en teoría; la velocidad real es más baja.
- Chip
- Apple M4: CPU de 10 núcleos (4 de rendimiento, 6 de eficiencia), GPU de 8 o 10 núcleos, Neural Engine de 16 núcleos, según la ficha técnica de Apple.
- Memoria
- 16 GB de serie, configurable con 24 o 32 GB. Está soldada: la configuración se elige al comprar.
- Ancho de banda
- 120 GB/s, según la ficha Apple, lo que representa un 20 % más que los 100 GB/s del Air M3.
- Neural Engine
- Apple anuncia hasta 38 billones de operaciones por segundo para el M4. Los motores comunes (Ollama, llama.cpp) se ejecutan principalmente en la GPU mediante Metal; por tanto, esta cifra no se traduce en tokens por segundo.
- Refrigeración
- Sin ventilador: el calor se evacúa por el chasis, lo que limita cargas muy largas.
No hay VRAM separada en un Mac: la GPU utiliza la memoria unificada. Cuando se busca «VRAM del MacBook Air M4», la respuesta práctica es la memoria total menos la parte reservada al sistema, dentro del límite que macOS permite utilizar a la GPU. Este límite se puede ajustar; la guía de optimización de macOS del sitio explica cómo hacerlo y qué riesgos conlleva.
#16, 24 o 32 GB: elegir la memoria
La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
El modelo, su contexto y el sistema comparten la memoria. Las cantidades indicadas a continuación son estimaciones prudentes que debes contrastar con la presión de memoria del Monitor de Actividad: alrededor de 11 a 12 GB para el modelo en una máquina con 16 GB, de 17 a 19 GB en una con 24 GB y de 24 a 26 GB en una con 32 GB. El tamaño de los modelos sigue las referencias del sitio: 8B, aproximadamente 5 GB; 14B, aproximadamente 9 GB; 24B, aproximadamente 14 GB; 32B, aproximadamente de 19 a 20 GB en Q4.
| Memoria | Margen estimado | Clase de modelo para un uso cómodo | Al límite |
|---|---|---|---|
| 16 GB | ≈ 11 a 12 GB | 8-9B con contexto medio, 12B en Q4 | 14B en Q4 con contexto corto |
| 24 GB | ≈ 17 a 19 GB | 12-14B cómodo, 24B en Q4 (≈ 14 GB) | 27B en Q4 (≈ 16 GB) con contexto reducido |
| 32 GB | ≈ 24 a 26 GB | 24B en Q5-Q6, 27B en Q4, modelos MoE de 30B | 32B denso en Q4 (≈ 19-20 GB) con contexto largo |
La cuestión es, por tanto, a qué tamaño quieres apuntar. Si te limitas a modelos de 8 a 12 mil millones de parámetros, 16 GB son suficientes. Para modelos de 24B o para un RAG con embedder y reranker en paralelo, 24 GB son el primer nivel cómodo. Con 32 GB, ganas sobre todo contexto largo y modelos MoE de 30B.
#La velocidad máxima con 120 GB/s
El principio: cada token generado obliga a leer los pesos activos. El límite es el ancho de banda dividido entre el tamaño de los pesos en gigabytes. La tabla aplica esta fórmula al M4 (120 GB/s). Son límites calculados, no mediciones: la velocidad real depende del motor, de la cuantización, del contexto y de la temperatura del chip.
| Modelo | Pesos activos | Cálculo | Límite máximo |
|---|---|---|---|
| 3B | ≈ 2 GB | 120 ÷ 2 | ≈ 60 tok/s |
| 8B | ≈ 5 GB | 120 ÷ 5 | ≈ 24 tok/s |
| 9B | ≈ 6 GB | 120 ÷ 6 | ≈ 20 tok/s |
| 14B | ≈ 9 GB | 120 ÷ 9 | ≈ 13 tok/s |
| 24B | ≈ 14 GB | 120 ÷ 14 | ≈ 8 a 9 tok/s |
| 32B denso | ≈ 19 a 20 GB | 120 ÷ 19,5 | ≈ 6 tok/s |
Dos consecuencias prácticas. Un 8B en Q4 no superará aproximadamente los 24 tokens por segundo en este chip: una cifra anunciada de 34 tokens por segundo para este modelo es imposible sin otra técnica. Y un 24B denso se mantiene en torno a los 8 tokens por segundo en el mejor de los casos, es decir, a la velocidad de una lectura atenta: cómoda para un texto tranquilo, lenta para un agente que encadena llamadas. Para consultar mediciones reales, visita /benchmarks y fuentes externas que especifiquen el chip y la cuantización.
#M4 o M5: ¿cambia el panorama con la siguiente generación?
Apple ahora ofrece un MacBook Air M5. Su ficha indica 153 GB/s de ancho de banda, frente a 120 GB/s para el M4, lo que representa aproximadamente un 28 % más, con las mismas opciones de 16, 24 o 32 GB de memoria. Para un LLM limitado por el ancho de banda, la diferencia teórica máxima de velocidad es del mismo orden: un 8B en Q4 pasaría de unos 24 a unos 30 tokens por segundo en el límite.
| Criterio | Air M4 | Air M5 |
|---|---|---|
| Ancho de banda | 120 GB/s | 153 GB/s |
| Memoria | 16, 24 o 32 GB | 16, 24 o 32 GB |
| Límite teórico 8B Q4 | ≈ 24 tok/s | ≈ 30 tok/s |
La memoria no cambia: un Air M5 de 16 GB no permite ejecutar más modelos que un Air M4 de 16 GB. Si encuentras un M4 configurado con 24 o 32 GB, es mejor que un M5 de 16 GB en cuanto al tamaño de los modelos; con la misma memoria, el M5 gana en velocidad. Compara los precios actuales en las tiendas: cambian demasiado para incluirlos aquí.
#Instalar y elegir el motor
- 01Instalar OllamaDescárgalo en ollama.com o con Homebrew. La guía de instalación para macOS detalla el arranque automático.
- 02Iniciar un modelo según la memoria9B con 16 GB, 24B en Q4 con 24 GB, un MoE de 30B con 32 GB. Al ejecutarlo por primera vez, se descarga el modelo.
- 03Verificar la GPUollama ps affiche la répartition CPU/GPU dans la colonne PROCESSOR : tout sur le GPU est l'état attendu.
- 04Ajustar el contextoCon menos de 24 GiB de memoria, Ollama fija el contexto predeterminado en 4.000 tokens. Amplíalo según lo que necesites: la caché KV crece con él.
MLX, el framework de Apple, aprovecha la memoria compartida del Mac sin copiar los datos entre CPU y GPU; LM Studio lo ofrece en forma de modelos MLX. Ambas vías funcionan: Ollama por su simplicidad y su API local, MLX y LM Studio para explorar los formatos de Apple. La guía de MLX frente a llama.cpp compara ambos enfoques, sin necesidad de repetir sus conclusiones aquí.
#Contexto largo y límite de memoria GPU
El modelo solo representa una parte del consumo de memoria: cada token de contexto añade una entrada al caché KV y la memoria realmente disponible para la GPU está limitada por macOS. Ollama utiliza automáticamente la atención flash cuando el motor y el hardware lo permiten, y permite cuantizar el caché KV mediante la variable OLLAMA_KV_CACHE_TYPE (f16 por defecto). Con 16 GB, este ajuste suele marcar la diferencia entre un contexto corto y uno de varios miles de tokens.
En cuanto a MLX, el repositorio mlx-lm indica que un modelo que cabe en memoria a menudo puede acelerarse aumentando el límite de memoria cableada del sistema mediante un ajuste sysctl. Es una modificación del sistema: requiere privilegios de administrador, no necesariamente persiste tras un reinicio y puede desestabilizar la máquina si el valor es demasiado alto. La guía de optimización de macOS detalla el procedimiento y el valor razonable según la memoria; no cambies ese límite sin haber leído la guía.
#Air M4, MacBook Pro o Mac mini: cuál elegir para cada uso
El Air M4 gana en ligereza y silencio, pero no tiene ventilador: una carga prolongada hace que baje la frecuencia del chip. El MacBook Pro M4 Pro o Max añade ventiladores, un ancho de banda de 273 a 546 GB/s y hasta 128 GB de memoria según la ficha de Apple; el Mac mini M4 ofrece un equipo de sobremesa con refrigeración activa.
| Tu necesidad | Equipo adecuado | Por qué |
|---|---|---|
| Chat, resumen, código ligero, movilidad | Air M4 16 o 24 GB | Silencio, autonomía, modelos de 8 a 14B |
| Modelos de 24 a 32B, contexto largo | Air M4 32 GB o Mac mini | Memoria suficiente; Mac mini si el equipo se queda en la oficina |
| Tareas de larga duración, varios modelos | MacBook Pro M4 Pro o Max, Mac mini | Ventilación activa, mayor ancho de banda |
| Modelos de 70B | MacBook Pro Max o Mac Studio | Un modelo de 70B pesa aproximadamente 40 GB en Q4: fuera de alcance de un Air |
- MacBook Pro M4 Pro y Max: 273 a 546 GB/s
- Mac mini M4 y M4 Pro para un LLM
- MacBook Air M2: 100 GB/s, 24 GB máximo
- MLX frente a llama.cpp en Mac
- Optimizar un Mac Apple Silicon para los LLM
- ¿Qué LLM para 16 GB de memoria?
- Fuente: ficha técnica de Apple del MacBook Air M4
- Fuente: ficha técnica de Apple del MacBook Air actual
- Fuente: ficha técnica de Apple del MacBook Pro M4 Pro y Max
- Fuente: documentación de Ollama, contexto
#Limitaciones que debes conocer
- Carga prolongada
- Sin ventilador, una generación continua durante varias decenas de minutos termina reduciendo la frecuencia. Para un chat, el efecto no se nota; para indexación o procesos en lote, es mejor usar una máquina con ventilador.
- Sin 70B
- Un 70B pesa aproximadamente 40 GB en Q4: más de los 32 GB máximos del Air.
- El Neural Engine no acelera Ollama
- Los motores habituales utilizan la GPU mediante Metal. La NPU solo interviene en ciertos usos con Core ML.
- Almacenamiento
- Los modelos ocupan varios gigaoctetos cada uno en el directorio de modelos de Ollama: un SSD de 256 GB se llena rápidamente con varios modelos de 5 a 15 GB.
#Preguntas frecuentes
¿Basta con un MacBook Air M4 de 16 GB para un LLM local?+
¿Cuánta VRAM tiene un MacBook Air M4?+
¿Qué velocidad se puede esperar de un modelo 8B en un MacBook Air M4?+
¿Es posible ejecutar un modelo de 30 mil millones de parámetros en un Air M4?+
¿Hay que esperar al Air M5 para la IA local?+
¿Se calienta el MacBook Air M4 con un LLM?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.