¿Qué LLM en MacBook Air M1 (8 / 16 GB)? ?
El MacBook Air M1 ejecuta modelos de 3 a 4 mil millones de parámetros con 8 GB y de 8 a 9 mil millones con 16 GB, con cuantización Q4_K_M. El límite no es la potencia de cálculo, sino la memoria unificada (8 o 16 GB, no ampliable) y el ancho de banda de aproximadamente 68 GB/s, que limita un modelo de 8B a una docena de tokens por segundo.
El MacBook Air M1 sigue siendo una buena puerta de entrada a la IA local, siempre que elijas la categoría de modelo adecuada. Esta página decide por ti según la memoria de tu equipo, calcula la velocidad máxima que la máquina puede alcanzar físicamente y señala el momento en que debes pasar a otra opción.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: MacBook Pro M5 Pro — 24 GB / 1 TB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.
#MacBook Air M1: lo que realmente ofrece la máquina para un LLM
Para un LLM local, el MacBook Air M1 se resume en tres cifras: la memoria unificada (8 GB de serie, 16 GB como opción, sin posibilidad de ampliarla después de la compra), el ancho de banda de memoria (del orden de 68 GB/s) y la ausencia de ventilador. La memoria determina qué se puede cargar, el ancho de banda determina la velocidad de generación y la refrigeración pasiva determina durante cuánto tiempo se mantiene esa velocidad.
- Chip
- Apple M1 (2020): 8 núcleos CPU (4 de rendimiento, 4 de eficiencia), 7 o 8 núcleos GPU según la configuración, Neural Engine con 16 núcleos, según la ficha técnica de Apple.
- Memoria
- 8 GB de memoria unificada, configurable a 16 GB. La CPU y la GPU utilizan la misma reserva de memoria: no existe una VRAM separada que se pueda sumar.
- Ancho de banda
- Apple no publica el ancho de banda en la ficha del M1. En cambio, anuncia 100 GB/s para el M2, un 50 % más que para el M1: esto sitúa al M1 en unos 67-68 GB/s, la cifra habitualmente citada (LPDDR4X).
- Refrigeración
- Sin ventilador: Apple presenta el MacBook Air M1 como completamente silencioso, independientemente de la tarea. La contrapartida es térmica; ver más abajo.
- Batería
- Batería de 49,9 Wh; la inferencia sostenida la descarga mucho más rápido que la navegación web en la que Apple basa las 15 horas de autonomía anunciadas.
Apple dejó de vender esta máquina nueva hace mucho tiempo; se encuentra de segunda mano y los precios varían demasiado para incluirlos aquí. Las páginas de hardware del sitio (/materiel-ia) ofrecen referencias actuales si dudas entre un Air de segunda mano y una máquina más reciente. El Mac mini de 2020 incorpora el mismo chip M1 y está sujeto a los mismos límites de memoria y ancho de banda; añade un ventilador, por lo que su velocidad sostenida es más estable.
#8 GB o 16 GB: lo que la RAM permite y lo que limita
La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Con 8 GB, el sistema, el navegador y tus aplicaciones ya comparten el mismo espacio que el modelo. Quedan alrededor de 4 a 5 GB para un LLM, incluido el contexto: es una estimación razonable, no una medición, ya que macOS ajusta su propio consumo. Con 16 GB, el margen pasa a unos 10 a 11 GB, lo que abre la puerta a modelos de 8 a 9 mil millones de parámetros.
| Modelo | Peso en Q4 | Air M1 8 GB | Air M1 16 GB |
|---|---|---|---|
| 3B (Granite 4.1 3B, Llama 3.2 3B) | ≈ 2 a 2,5 GB | Cómodo | Cómodo |
| 4B (Qwen 3.5 4B, Phi-4 mini) | ≈ 2,5 a 3 GB | Cómodo, contexto corto | Cómodo, contexto largo |
| 7-9B (Granite 4.1 8B, Qwen 3.5 9B) | ≈ 5 a 6 GB | Memoria demasiado justa: swap probable | Buen equilibrio |
| 12B (Gemma 4 12B) | ≈ 7 a 8 GB | No | Límite: solo contexto corto |
| 24B y más | ≥ 14 GB | No | No |
La clasificación de la última fila no depende de la velocidad, sino de un límite estricto: un modelo de 14 GB no cabe en 16 GB una vez cargado el sistema. Si dudas sobre el tamaño exacto de un modelo, la calculadora de VRAM del sitio indica el consumo de memoria según la cuantización y el contexto.
#¿Qué modelos elegir según el uso?
El M1 se evalúa según el tamaño del modelo, no según su marca. Con 8 GB, busca un modelo de 3B o 4B en Q4_K_M: resumen de texto, reescritura, preguntas-respuestas sobre un fragmento, código simple. Con 16 GB, un modelo de 8 a 9 mil millones de parámetros ofrece una mejora notable en precisión y cumplimiento de instrucciones largas, a costa de una generación más lenta. Los nombres de los modelos evolucionan cada mes: lo importante es recordar la clase de tamaño y revisar el catálogo del sitio para el estado actual.
- Redacción, resumen, traducción
- Un modelo de 4B con 8 GB, uno de 8-9B con 16 GB. La calidad de redacción en francés depende más de la familia del modelo que de su tamaño: prueba dos candidatos con tus propios textos.
- Código
- Un 4B basta para funciones cortas y explicaciones; para un proyecto completo, la memoria del Air M1 exige contextos cortos, por lo que un asistente de código local sigue siendo limitado.
- Documentos y RAG
- Un embedder ligero más un modelo de generación de 4B (8 GB) o 8-9B (16 GB). El contexto introducido consume memoria: mantén pocos fragmentos, bien seleccionados.
- Visión
- Los modelos multimodales añaden el codificador de imagen a la memoria del modelo. Con 8 GB, resérvalos para modelos pequeños; con 16 GB, funcionan, pero lentamente.
#Cuántos tokens por segundo: el límite teórico
Durante la generación, el procesador vuelve a leer aproximadamente todos los pesos activos del modelo por cada token producido. La velocidad máxima está, por tanto, limitada por el ancho de banda dividido por el tamaño de los pesos. En un M1 con aproximadamente 68 GB/s, un modelo que pesa 5 GB no puede superar alrededor de 13 tokens por segundo, independientemente del número de núcleos GPU disponibles. Es un límite calculado, no una medición: la velocidad real es más baja porque el cálculo, la caché KV y el sistema también consumen ancho de banda.
| Modelo | Peso en Q4 | Cálculo | Límite máximo |
|---|---|---|---|
| 3B | ≈ 2 GB | 68 ÷ 2 | ≈ 34 tok/s |
| 4B | ≈ 2,5 a 3 GB | 68 ÷ 2,5 à 3 | ≈ 23 a 27 tok/s |
| 8B | ≈ 5 GB | 68 ÷ 5 | ≈ 13 tok/s |
| 9B | ≈ 6 GB | 68 ÷ 6 | ≈ 11 tok/s |
| 12B | ≈ 7,5 GB | 68 ÷ 7,5 | ≈ 9 tok/s |
Este cálculo sirve de filtro. Cualquier promesa de más de 30 tokens por segundo con un modelo de 8 mil millones de parámetros en Q4 en un M1 es físicamente incompatible con el ancho de banda, salvo que se trate de un modelo de mezcla de expertos en el que solo una fracción de los expertos esté activa. Para obtener mediciones reales, consulta la página /benchmarks del sitio y los benchmarks publicados por terceros, comprobando el chip, la cuantización y el motor utilizados.
#Instalar y verificar en unos minutos
Ollama es la vía más sencilla: instala el motor, descarga los modelos y detecta la GPU del Mac sin configuración. Los modelos se almacenan en ~/.ollama/models en macOS: calcula varios gigabytes por modelo y tenlo en cuenta si tienes un SSD de 256 GB.
- 01Instalar OllamaDescarga la aplicación en ollama.com, o usa Homebrew con el comando a continuación. La guía de instalación para macOS del sitio detalla el arranque automático.
- 02Iniciar un modelo adaptado a la RAMCon 8 GB, un 4B; con 16 GB, un 8-9B. La primera ejecución descarga el modelo; las siguientes son inmediatas.
- 03Comprobar que se está utilizando la GPUEn un segundo terminal, escribe ollama ps: la columna PROCESSOR debe indicar 100 % GPU. Una distribución CPU/GPU indica que el modelo supera la memoria asignada a la GPU.
- 04Fijar el contextoOllama elige un contexto por defecto según la memoria disponible; con menos de 24 GB, es de 4 000 tokens. Auméntalo solo si lo necesitas: cada token de contexto ocupa memoria.
LM Studio es la alternativa con una interfaz gráfica completa, útil si el terminal te echa para atrás. Consume un poco más de memoria que Ollama por sí solo, algo que importa con 8 GB. MLX, el framework de Apple, aprovecha la memoria compartida del Mac sin copias entre CPU y GPU; los ajustes de MLX y llama.cpp se tratan en la guía de optimización de macOS.
#El contexto largo: la trampa de los 8 GB
El peso del modelo es solo una parte de la memoria. Cada token de contexto añade una entrada en la caché KV, que crece con la longitud de la conversación. Ollama utiliza automáticamente la atención flash cuando el motor y el hardware lo permiten, lo que limita este crecimiento. También permite cuantizar la caché KV mediante la variable OLLAMA_KV_CACHE_TYPE, cuyo valor predeterminado es f16. En un Air M1 de 8 GB, esta opción puede marcar la diferencia entre un contexto de 4.000 tokens y uno de 8.000, a costa de una ligera pérdida de precisión.
La guía sobre la cuantización de la caché KV explica cuándo vale la pena esta opción. La regla práctica: con 8 GB, mantén el contexto corto e inyecta solo los pasajes útiles; con 16 GB, un contexto de 8 000 tokens sigue siendo razonable con un modelo de 8-9B.
#El calentamiento de un Air sin ventilador
Sin ventilador, el MacBook Air M1 disipa el calor a través del chasis. En un uso breve (una pregunta, una respuesta), no hay nada que señalar. En un uso sostenido, como un procesamiento por lotes de varias decenas de minutos o la indexación de documentos, el chip reduce su frecuencia para protegerse: la velocidad baja sin que la máquina se detenga. Esta página no indica ningún umbral en minutos ni en grados: depende de la habitación y de la carga, y ninguna fuente fiable lo establece.
- Elevar la máquina
- Un soporte de ordenador mejora la circulación de aire bajo el chasis.
- Cerrar aplicaciones pesadas
- Los navegadores con mucha carga y las aplicaciones de videoconferencia consumen recursos del procesador en paralelo y calientan el mismo chip.
- Preferir un modelo más pequeño en lugar de Q8
- Menos memoria que volver a leer, menos energía consumida por token.
- Conectar a la corriente para las tareas largas
- Al funcionar con batería, macOS puede limitar más el rendimiento. Depende del modo de energía elegido en los ajustes.
#Límites y señales para pasar a otra máquina
El M1 no se descarta por su antigüedad, sino por su memoria. Los criterios que deben llevarte a buscar otra opción son simples y medibles.
- Quieres un modelo de más de 12B
- El modelo no cabe con holgura en ninguna configuración del MacBook Air M1. Mira el MacBook Air M4 (con opciones de 32 GB) o un MacBook Pro con chip Pro/Max.
- Estás trabajando con documentos grandes
- Un contexto largo agota la memoria antes de alcanzar el límite de la capacidad de cálculo. Más RAM es la única solución real.
- Realizas procesos de varias horas
- Un Mac mini, que tiene ventilador, o un PC de sobremesa soporta mejor la carga continua.
- El fine-tuning te interesa
- Un Air M1 no tiene la capacidad necesaria para ello; opta por un servicio en la nube para un uso puntual.
| Criterio | MacBook Air M1 | MacBook Air M2 | MacBook Air M4 |
|---|---|---|---|
| Memoria máxima | 16 GB | 24 GB | 32 GB |
| Ancho de banda | ≈ 68 GB/s | 100 GB/s | 120 GB/s |
| Modelo que funciona con holgura en Q4 | 8-9B | 8-9B, 14B con 24 GB | 14B, 24B en 32 GB |
- MacBook Air M2: 24 GB y 100 GB/s de ancho de banda
- MacBook Air M4: hasta 32 GB de memoria
- Instalar Ollama en macOS, paso a paso
- Cuantizar la caché KV para ahorrar memoria
- ¿Qué LLM para 8 GB de memoria?
- Calculadora de VRAM del sitio
- Fuente: ficha técnica de Apple del MacBook Air M1
- Fuente: Apple, anuncio del chip M2 (ancho de banda)
- Fuente: documentación de Ollama, longitud de contexto
- Fuente: FAQ Ollama, GPU, caché KV y atención flash
#Preguntas frecuentes
¿Un MacBook Air M1 8 GB es suficiente para un LLM local?+
¿Qué velocidad se puede esperar de un LLM de 8B en un MacBook Air M1?+
¿Se puede ejecutar un 70B en un MacBook Air M1?+
¿Debe elegirse Ollama, LM Studio o MLX en M1?+
¿El MacBook Air M1 se calienta mucho con un LLM?+
¿Valdría la pena pasar a un Air M4 para la IA local?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.