Principiante 12 minMacBook Air

¿Qué LLM en MacBook Air M1 (8 / 16 GB)? ?

Respuesta directa

El MacBook Air M1 ejecuta modelos de 3 a 4 mil millones de parámetros con 8 GB y de 8 a 9 mil millones con 16 GB, con cuantización Q4_K_M. El límite no es la potencia de cálculo, sino la memoria unificada (8 o 16 GB, no ampliable) y el ancho de banda de aproximadamente 68 GB/s, que limita un modelo de 8B a una docena de tokens por segundo.

El MacBook Air M1 sigue siendo una buena puerta de entrada a la IA local, siempre que elijas la categoría de modelo adecuada. Esta página decide por ti según la memoria de tu equipo, calcula la velocidad máxima que la máquina puede alcanzar físicamente y señala el momento en que debes pasar a otra opción.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en macOS 14+
Hardware recomendado

Alternativa de compra para esta guía: MacBook Pro M5 Pro — 24 GB / 1 TB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

#MacBook Air M1: lo que realmente ofrece la máquina para un LLM

Para un LLM local, el MacBook Air M1 se resume en tres cifras: la memoria unificada (8 GB de serie, 16 GB como opción, sin posibilidad de ampliarla después de la compra), el ancho de banda de memoria (del orden de 68 GB/s) y la ausencia de ventilador. La memoria determina qué se puede cargar, el ancho de banda determina la velocidad de generación y la refrigeración pasiva determina durante cuánto tiempo se mantiene esa velocidad.

Chip
Apple M1 (2020): 8 núcleos CPU (4 de rendimiento, 4 de eficiencia), 7 o 8 núcleos GPU según la configuración, Neural Engine con 16 núcleos, según la ficha técnica de Apple.
Memoria
8 GB de memoria unificada, configurable a 16 GB. La CPU y la GPU utilizan la misma reserva de memoria: no existe una VRAM separada que se pueda sumar.
Ancho de banda
Apple no publica el ancho de banda en la ficha del M1. En cambio, anuncia 100 GB/s para el M2, un 50 % más que para el M1: esto sitúa al M1 en unos 67-68 GB/s, la cifra habitualmente citada (LPDDR4X).
Refrigeración
Sin ventilador: Apple presenta el MacBook Air M1 como completamente silencioso, independientemente de la tarea. La contrapartida es térmica; ver más abajo.
Batería
Batería de 49,9 Wh; la inferencia sostenida la descarga mucho más rápido que la navegación web en la que Apple basa las 15 horas de autonomía anunciadas.

Apple dejó de vender esta máquina nueva hace mucho tiempo; se encuentra de segunda mano y los precios varían demasiado para incluirlos aquí. Las páginas de hardware del sitio (/materiel-ia) ofrecen referencias actuales si dudas entre un Air de segunda mano y una máquina más reciente. El Mac mini de 2020 incorpora el mismo chip M1 y está sujeto a los mismos límites de memoria y ancho de banda; añade un ventilador, por lo que su velocidad sostenida es más estable.

#8 GB o 16 GB: lo que la RAM permite y lo que limita

El kit Mac

La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Con 8 GB, el sistema, el navegador y tus aplicaciones ya comparten el mismo espacio que el modelo. Quedan alrededor de 4 a 5 GB para un LLM, incluido el contexto: es una estimación razonable, no una medición, ya que macOS ajusta su propio consumo. Con 16 GB, el margen pasa a unos 10 a 11 GB, lo que abre la puerta a modelos de 8 a 9 mil millones de parámetros.

Lo que cabe en un Air M1 según la memoria (Q4_K_M, solo los pesos según las referencias del sitio, más el contexto)
ModeloPeso en Q4Air M1 8 GBAir M1 16 GB
3B (Granite 4.1 3B, Llama 3.2 3B)≈ 2 a 2,5 GBCómodoCómodo
4B (Qwen 3.5 4B, Phi-4 mini)≈ 2,5 a 3 GBCómodo, contexto cortoCómodo, contexto largo
7-9B (Granite 4.1 8B, Qwen 3.5 9B)≈ 5 a 6 GBMemoria demasiado justa: swap probableBuen equilibrio
12B (Gemma 4 12B)≈ 7 a 8 GBNoLímite: solo contexto corto
24B y más≥ 14 GBNoNo

La clasificación de la última fila no depende de la velocidad, sino de un límite estricto: un modelo de 14 GB no cabe en 16 GB una vez cargado el sistema. Si dudas sobre el tamaño exacto de un modelo, la calculadora de VRAM del sitio indica el consumo de memoria según la cuantización y el contexto.

!
El swap es la verdadera señal de alarma
Cuando macOS agota la RAM disponible, escribe en el SSD: la generación se ralentiza considerablemente y el desgaste del disco aumenta. Abre el Monitor de Actividad, pestaña Memoria: si la «presión de memoria» pasa al amarillo o al rojo durante la generación, elige un modelo más pequeño o reduce el contexto. Es más eficaz que cerrar pestañas una por una.

#¿Qué modelos elegir según el uso?

El M1 se evalúa según el tamaño del modelo, no según su marca. Con 8 GB, busca un modelo de 3B o 4B en Q4_K_M: resumen de texto, reescritura, preguntas-respuestas sobre un fragmento, código simple. Con 16 GB, un modelo de 8 a 9 mil millones de parámetros ofrece una mejora notable en precisión y cumplimiento de instrucciones largas, a costa de una generación más lenta. Los nombres de los modelos evolucionan cada mes: lo importante es recordar la clase de tamaño y revisar el catálogo del sitio para el estado actual.

Redacción, resumen, traducción
Un modelo de 4B con 8 GB, uno de 8-9B con 16 GB. La calidad de redacción en francés depende más de la familia del modelo que de su tamaño: prueba dos candidatos con tus propios textos.
Código
Un 4B basta para funciones cortas y explicaciones; para un proyecto completo, la memoria del Air M1 exige contextos cortos, por lo que un asistente de código local sigue siendo limitado.
Documentos y RAG
Un embedder ligero más un modelo de generación de 4B (8 GB) o 8-9B (16 GB). El contexto introducido consume memoria: mantén pocos fragmentos, bien seleccionados.
Visión
Los modelos multimodales añaden el codificador de imagen a la memoria del modelo. Con 8 GB, resérvalos para modelos pequeños; con 16 GB, funcionan, pero lentamente.

#Cuántos tokens por segundo: el límite teórico

Durante la generación, el procesador vuelve a leer aproximadamente todos los pesos activos del modelo por cada token producido. La velocidad máxima está, por tanto, limitada por el ancho de banda dividido por el tamaño de los pesos. En un M1 con aproximadamente 68 GB/s, un modelo que pesa 5 GB no puede superar alrededor de 13 tokens por segundo, independientemente del número de núcleos GPU disponibles. Es un límite calculado, no una medición: la velocidad real es más baja porque el cálculo, la caché KV y el sistema también consumen ancho de banda.

Límite teórico de generación en Air M1 (≈ 68 GB/s, solo los pesos en Q4): cálculo, no medición
ModeloPeso en Q4CálculoLímite máximo
3B≈ 2 GB68 ÷ 2≈ 34 tok/s
4B≈ 2,5 a 3 GB68 ÷ 2,5 à 3≈ 23 a 27 tok/s
8B≈ 5 GB68 ÷ 5≈ 13 tok/s
9B≈ 6 GB68 ÷ 6≈ 11 tok/s
12B≈ 7,5 GB68 ÷ 7,5≈ 9 tok/s

Este cálculo sirve de filtro. Cualquier promesa de más de 30 tokens por segundo con un modelo de 8 mil millones de parámetros en Q4 en un M1 es físicamente incompatible con el ancho de banda, salvo que se trate de un modelo de mezcla de expertos en el que solo una fracción de los expertos esté activa. Para obtener mediciones reales, consulta la página /benchmarks del sitio y los benchmarks publicados por terceros, comprobando el chip, la cuantización y el motor utilizados.

i
¿Por qué Q4 en lugar de Q8 en M1?
Un Q8 pesa casi el doble que un Q4: con el mismo ancho de banda, genera aproximadamente a la mitad de velocidad y ocupa más memoria. En modelos de 8-9B, la pérdida de calidad del Q4_K_M es generalmente baja. La guía sobre cuantización detalla la elección entre Q4, Q5 y Q8.

#Instalar y verificar en unos minutos

Ollama es la vía más sencilla: instala el motor, descarga los modelos y detecta la GPU del Mac sin configuración. Los modelos se almacenan en ~/.ollama/models en macOS: calcula varios gigabytes por modelo y tenlo en cuenta si tienes un SSD de 256 GB.

  1. 01
    Instalar Ollama
    Descarga la aplicación en ollama.com, o usa Homebrew con el comando a continuación. La guía de instalación para macOS del sitio detalla el arranque automático.
  2. 02
    Iniciar un modelo adaptado a la RAM
    Con 8 GB, un 4B; con 16 GB, un 8-9B. La primera ejecución descarga el modelo; las siguientes son inmediatas.
  3. 03
    Comprobar que se está utilizando la GPU
    En un segundo terminal, escribe ollama ps: la columna PROCESSOR debe indicar 100 % GPU. Una distribución CPU/GPU indica que el modelo supera la memoria asignada a la GPU.
  4. 04
    Fijar el contexto
    Ollama elige un contexto por defecto según la memoria disponible; con menos de 24 GB, es de 4 000 tokens. Auméntalo solo si lo necesitas: cada token de contexto ocupa memoria.
Terminal
brew install --cask ollama
ollama run qwen3.5:4b
ollama ps

LM Studio es la alternativa con una interfaz gráfica completa, útil si el terminal te echa para atrás. Consume un poco más de memoria que Ollama por sí solo, algo que importa con 8 GB. MLX, el framework de Apple, aprovecha la memoria compartida del Mac sin copias entre CPU y GPU; los ajustes de MLX y llama.cpp se tratan en la guía de optimización de macOS.

#El contexto largo: la trampa de los 8 GB

El peso del modelo es solo una parte de la memoria. Cada token de contexto añade una entrada en la caché KV, que crece con la longitud de la conversación. Ollama utiliza automáticamente la atención flash cuando el motor y el hardware lo permiten, lo que limita este crecimiento. También permite cuantizar la caché KV mediante la variable OLLAMA_KV_CACHE_TYPE, cuyo valor predeterminado es f16. En un Air M1 de 8 GB, esta opción puede marcar la diferencia entre un contexto de 4.000 tokens y uno de 8.000, a costa de una ligera pérdida de precisión.

Terminal
# Quantifier le cache KV en q8_0 avant de démarrer le serveur
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_FLASH_ATTENTION=1
ollama serve

La guía sobre la cuantización de la caché KV explica cuándo vale la pena esta opción. La regla práctica: con 8 GB, mantén el contexto corto e inyecta solo los pasajes útiles; con 16 GB, un contexto de 8 000 tokens sigue siendo razonable con un modelo de 8-9B.

#El calentamiento de un Air sin ventilador

Sin ventilador, el MacBook Air M1 disipa el calor a través del chasis. En un uso breve (una pregunta, una respuesta), no hay nada que señalar. En un uso sostenido, como un procesamiento por lotes de varias decenas de minutos o la indexación de documentos, el chip reduce su frecuencia para protegerse: la velocidad baja sin que la máquina se detenga. Esta página no indica ningún umbral en minutos ni en grados: depende de la habitación y de la carga, y ninguna fuente fiable lo establece.

Elevar la máquina
Un soporte de ordenador mejora la circulación de aire bajo el chasis.
Cerrar aplicaciones pesadas
Los navegadores con mucha carga y las aplicaciones de videoconferencia consumen recursos del procesador en paralelo y calientan el mismo chip.
Preferir un modelo más pequeño en lugar de Q8
Menos memoria que volver a leer, menos energía consumida por token.
Conectar a la corriente para las tareas largas
Al funcionar con batería, macOS puede limitar más el rendimiento. Depende del modo de energía elegido en los ajustes.

#Límites y señales para pasar a otra máquina

El M1 no se descarta por su antigüedad, sino por su memoria. Los criterios que deben llevarte a buscar otra opción son simples y medibles.

Quieres un modelo de más de 12B
El modelo no cabe con holgura en ninguna configuración del MacBook Air M1. Mira el MacBook Air M4 (con opciones de 32 GB) o un MacBook Pro con chip Pro/Max.
Estás trabajando con documentos grandes
Un contexto largo agota la memoria antes de alcanzar el límite de la capacidad de cálculo. Más RAM es la única solución real.
Realizas procesos de varias horas
Un Mac mini, que tiene ventilador, o un PC de sobremesa soporta mejor la carga continua.
El fine-tuning te interesa
Un Air M1 no tiene la capacidad necesaria para ello; opta por un servicio en la nube para un uso puntual.
Air M1 o una generación posterior: lo que cambia para un LLM local
CriterioMacBook Air M1MacBook Air M2MacBook Air M4
Memoria máxima16 GB24 GB32 GB
Ancho de banda≈ 68 GB/s100 GB/s120 GB/s
Modelo que funciona con holgura en Q48-9B8-9B, 14B con 24 GB14B, 24B en 32 GB

#Preguntas frecuentes

FAQ
¿Un MacBook Air M1 8 GB es suficiente para un LLM local?+
Sí para modelos de 3 a 4 mil millones de parámetros en Q4, que pesan aproximadamente entre 2 y 3 GB y dejan margen al sistema. Un modelo de 8 mil millones en Q4 (aproximadamente 5 GB) sigue siendo posible, pero hace que macOS escriba en el SSD en cuanto crece el contexto. Para un uso regular, 16 GB resultan mucho más cómodos.
¿Qué velocidad se puede esperar de un LLM de 8B en un MacBook Air M1?+
El límite teórico se calcula dividiendo el ancho de banda (aproximadamente 68 GB/s) por el tamaño del modelo: para un 8B en Q4 (aproximadamente 5 GB), esto da unos 13 tokens por segundo como máximo. La velocidad real es más baja. Este cálculo sirve para descartar cifras poco realistas, no para predecir el rendimiento de tu máquina.
¿Se puede ejecutar un 70B en un MacBook Air M1?+
No. Un modelo de 70 mil millones de parámetros pesa aproximadamente 40 GB en Q4, es decir, más del doble de la memoria máxima de un Air M1 (16 GB). Incluso con una cuantización muy agresiva, no se carga correctamente. El tamaño máximo realista en esta máquina ronda los 8 a 12 mil millones de parámetros.
¿Debe elegirse Ollama, LM Studio o MLX en M1?+
Ollama para empezar rápido y escribir scripts, LM Studio si prefieres una interfaz gráfica completa, MLX si quieres aprovechar directamente el framework de Apple desde Python. Con 8 GB, el consumo adicional de memoria de una interfaz gráfica importa: empieza con Ollama y cambia solo si surge una necesidad concreta.
¿El MacBook Air M1 se calienta mucho con un LLM?+
No tiene ventilador, por lo que se calienta y reduce su frecuencia bajo carga continua. En conversaciones cortas, el efecto es despreciable. En procesos largos, eleva el equipo, conéctalo a la red eléctrica y elige un modelo más pequeño. Si ejecutas tareas de varias horas, un Mac mini con ventilador resulta más adecuado.
¿Valdría la pena pasar a un Air M4 para la IA local?+
Sí, si la memoria te limita: el Air M4 llega a 32 GB y ofrece 120 GB/s de ancho de banda frente a unos 68 GB/s. Si sigues usando modelos de entre 4 y 8 mil millones de parámetros para texto, el M1 de 16 GB sigue siendo utilizable; en ese caso, cambiar de equipo aporta sobre todo comodidad.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.