Principiante 11 minMacBook Air

Qué LLM en MacBook Air M2 (8 / 16 / 24 GB) ?

Respuesta directa

El MacBook Air M2 ejecuta modelos de 3 a 4 mil millones de parámetros con 8 GB, de 8 a 9 mil millones con 16 GB y hasta un modelo de 24B en Q4 con 24 GB. Su ancho de banda de 100 GB/s, un 50 % más que el del M1 según Apple, limita la velocidad de un modelo de 8B en Q4 a unos 20 tokens por segundo; la memoria determina qué se puede cargar.

El M2 es el primer chip del Air que ofrece 24 GB y 100 GB/s. Esta página indica qué clase de modelo elegir según tengas 8, 16 o 24 GB, calcula la velocidad máxima físicamente posible y señala cuándo pasar a un M4.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en macOS 14+
Hardware recomendado

Alternativa de compra para esta guía: MacBook Pro M5 Pro — 24 GB / 1 TB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#MacBook Air M2: ancho de banda de 100 GB/s y hasta 24 GB

El MacBook Air M2 introduce dos cambios respecto al M1 que importan para un LLM: el ancho de banda aumenta a 100 GB/s y la memoria puede alcanzar los 24 GB. Apple anuncia 100 GB/s para el M2, un 50 % más que para el M1; es la cifra oficial, y no un aumento del 47 % como a veces se lee. Por tanto, la velocidad máxima de generación aumenta entre aproximadamente un tercio y la mitad, según el modelo, y la categoría de modelos que se pueden ejecutar sube un nivel.

Chip
Apple M2: CPU de 8 núcleos (4 de rendimiento, 4 de eficiencia), GPU de 8 núcleos, o 10 núcleos en configuración superior, Neural Engine de 16 núcleos, según la ficha técnica de Apple.
Memoria
Según la ficha de Apple, los MacBook Air M2 están disponibles en versiones de 8 GB (configurables con 16 o 24 GB) y de 16 GB (configurables con 24 GB). La memoria está soldada: debes elegirla al comprar.
Ancho de banda
100 GB/s, según Apple, es decir un 50 % más que el M1.
Refrigeración
Sin ventilador: Apple describe el MacBook Air M2 como un equipo de diseño silencioso sin ventilador. Ese silencio tiene un coste bajo carga sostenida; consulta la sección sobre comportamiento térmico.
Batería
52,6 Wh; Apple anuncia hasta 15 horas de navegación web inalámbrica. Un LLM que somete la GPU a una carga de trabajo consume mucho más que una página web.

#8, 16 o 24 GB: lo que cada nivel permite

El kit Mac

En un MacBook Air M2, cada gigaocteto cuenta. El kit Mac te ayuda a elegir el modelo que realmente cabe (cap. 4), a calcular tu presupuesto de memoria (cap. 5) y a medir el efecto sobre el calor y la batería (cap. 6).

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Un modelo no puede ocupar toda la memoria: macOS, el navegador y tus aplicaciones reservan una parte. Cuenta con un margen de unos 4 a 5 GB en una máquina de 8 GB, de 10 a 11 GB en una de 16 GB y de 16 a 18 GB en una de 24 GB para el modelo y su contexto. Son estimaciones prudentes, que deben contrastarse con la presión de memoria del Monitor de actividad. El tamaño de un modelo sigue las referencias del sitio: 3B aproximadamente 2 GB, 7-8B aproximadamente 5 GB, 14B aproximadamente 9 GB, 32B aproximadamente 19 a 20 GB en Q4.

Air M2: clase de modelo realista según la memoria (Q4_K_M)
MemoriaMargen para el modelo y el contextoClase de modelo para un uso cómodoAl límite
8 GB≈ 4 a 5 GB3-4B8B con contexto muy corto
16 GB≈ 10 a 11 GB8-9B, contexto medio12B con contexto corto
24 GB≈ 16 a 18 GBModelos de 12-14B con comodidad, de 8-9B en Q8 o con contexto largo24B en Q4 (≈ 14 GB) con contexto reducido

El nivel de 24 GB es el que cambia la naturaleza de la máquina: permite ejecutar modelos de 24 mil millones de parámetros en Q4 (aproximadamente 14 GB de pesos), algo que ningún Air M1 permite. Sin embargo, es poco habitual: como la memoria no se puede ampliar, la mayoría de los Air M2 en circulación tienen 8 o 16 GB. Comprueba en el menú Apple, «Acerca de este Mac», qué memoria tiene realmente la máquina antes de elegir un modelo.

→
16 GB: el umbral que cubre lo esencial
Para resumir, redactar, recibir ayuda con el código y usar RAG ligero, un modelo de 8 a 9 mil millones de parámetros en Q4 basta para la mayoría de los usos comunes. La versión de 24 GB se justifica principalmente si quieres un modelo de 24B, un contexto muy largo o un embedder y un reranker en paralelo al modelo de generación.

#La velocidad máxima que puede alcanzar el M2

La generación lee los pesos activos en cada token: la velocidad máxima es el ancho de banda dividido por el peso en gigabytes. La tabla siguiente aplica la fórmula al M2 (100 GB/s) y al M1 (aproximadamente 68 GB/s). Son límites máximos calculados, nunca mediciones: la velocidad real es más baja y depende del motor, de la cuantización y de la longitud del contexto. Permiten verificar que una cifra anunciada en otro lugar sea físicamente posible.

Límite teórico de generación (solo los pesos en Q4): cálculo, no medición
ModeloTamaño del modeloAir M1 (≈ 68 GB/s)Air M2 (100 GB/s)
3B≈ 2 GB≈ 34 tok/s≈ 50 tok/s
4B≈ 2,5 a 3 GB≈ 23 a 27 tok/s≈ 33 a 40 tok/s
8B≈ 5 GB≈ 13 tok/s≈ 20 tok/s
12B≈ 7,5 GB≈ 9 tok/s≈ 13 tok/s
24B≈ 14 GBno aplicable (memoria)≈ 7 tok/s

De aquí se desprenden dos conclusiones. En primer lugar, un modelo de 8B en Q4 en M2 se sitúa, en teoría, por debajo de 20 tokens por segundo: una velocidad indicada de 25 o 28 tokens por segundo para este modelo en este chip no puede proceder de la generación clásica. En segundo lugar, un modelo de 24B alcanza un máximo de unos 7 tokens por segundo: sirve para una respuesta pausada, pero no para un intercambio rápido. Para mediciones reales, consulta /benchmarks y los benchmarks de terceros, comprobando el chip, la cuantización y el motor.

#Instalar un modelo y verificar el GPU

  1. 01
    Instalar Ollama
    Descárgalo en ollama.com o con Homebrew. La guía de instalación para macOS del sitio detalla las opciones de arranque.
  2. 02
    Elegir el modelo según la memoria
    4B en 8 GB, 8-9B en 16 GB, 12-14B o un 24B en Q4 en 24 GB. Inícialo con ollama run seguido del nombre del modelo.
  3. 03
    Verificar la GPU
    En otro terminal, ollama ps muestra la distribución CPU/GPU en la columna PROCESSOR. Lo esperado es que todo esté en la GPU.
  4. 04
    Ajustar el contexto
    Ollama fija el contexto predeterminado en 4.000 tokens cuando hay menos de 24 GiB de memoria. Auméntalo progresivamente en lugar de hacerlo de golpe: la caché KV ocupa memoria por cada token.
Terminal
brew install --cask ollama
ollama run qwen3.5:9b
ollama ps

Los modelos se instalan en ~/.ollama/models. En un Air M2 con un SSD de 256 GB, unos pocos modelos de 5 a 15 GB bastan para llenar el espacio libre: utiliza ollama rm para eliminar los que ya no uses.

Una pauta útil para elegir: empieza con el modelo más pequeño que responda correctamente a tu tarea y pasa al tamaño inmediatamente superior solo si las respuestas siguen siendo insuficientes. En una máquina con ancho de banda limitado, cada mil millones de parámetros adicionales se traducen en una pérdida de velocidad. Prueba dos candidatos con cinco de tus propias consultas reales antes de decidir: lleva diez minutos y evita descargar un modelo demasiado pesado.

#La configuración de 24 GB y el RAG: lo que realmente permite este nivel

Un asistente que trabaja con tus documentos requiere tres componentes: un modelo de embeddings que indexa, un modelo de generación que responde y, opcionalmente, un reranker que ordena los pasajes. Con 8 GB, el conjunto cabe con poco margen. Con 16 GB, un embedder ligero y un modelo de 8-9B pueden coexistir con un contexto corto. Con 24 GB, puedes añadir un reranker y mantener un contexto de varios miles de tokens sin escribir en el SSD. Es en este uso donde optar por una capacidad de memoria superior cobra pleno sentido.

Antes de la indexación
Comprueba que haya memoria suficiente para el modelo de embeddings junto con el modelo de generación: ambos permanecen cargados durante la solicitud.
Durante la solicitud
Inyecta algunos pasajes bien seleccionados en lugar de un documento entero: el contexto consume memoria y tiempo de cálculo.
Después
Si la presión de memoria llega al amarillo, reduce el número de pasos o pasa a un modelo más pequeño.

#Quantización y caché KV en M2

En una máquina limitada por el ancho de banda, Q4_K_M sigue siendo el ajuste predeterminado: el modelo es más pequeño, por lo que es más rápido de leer. Q5_K_M se justifica cuando la memoria lo permite y la calidad es prioritaria. Q8_0 casi duplica el peso y reduce aproximadamente a la mitad el límite de velocidad. Para la caché KV, Ollama utiliza automáticamente la atención flash cuando el motor y el hardware lo permiten; la variable OLLAMA_KV_CACHE_TYPE cuantiza la caché, con f16 por defecto. Hace que los contextos largos sean más accesibles con 16 GB, a costa de una ligera pérdida de precisión.

#Autonomía, silencio y calentamiento

El Air M2 no tiene ventilador: se mantiene silencioso, lo que resulta adecuado para una oficina tranquila o para un asistente que se deja funcionando por la noche. El chasis disipa el calor de forma pasiva, por lo que una carga de varias decenas de minutos reduce la frecuencia del chip. Esta página no indica ni el tiempo ni la temperatura a partir de los cuales ocurre: ninguna fuente primaria los establece y varían según la habitación. Con batería, la autonomía disminuye mucho más rápido que al navegar, ya que la GPU trabaja continuamente; para una sesión larga, conecta el equipo a la red eléctrica.

Procesos prolongados
Conecta el equipo a la corriente, elévalo y evita las aplicaciones que sometan al procesador a una carga simultánea.
Modo de ahorro de energía
macOS lo ofrece en los ajustes de batería. Limita el rendimiento: resérvalo para los desplazamientos en los que la autonomía prime sobre la velocidad.
Carga continua
Para un servidor local que responde todo el día, un Mac mini, que tiene un ventilador, es más adecuado que un Air.

#¿Quedarse con el M2 o pasar a un M3 o un M4?

El M3 mantiene el mismo ancho de banda de 100 GB/s y el mismo límite de 24 GB en el Air, según las fichas de Apple: para un LLM, pasar de M2 a M3 no aporta casi nada medible en cuanto a generación. El M4 aumenta el ancho de banda a 120 GB/s y la memoria a 32 GB, lo que cambia tanto la velocidad máxima como la clase de modelos.

Air M2, M3 y M4: lo esencial para un LLM local, según las fichas Apple
CriterioAir M2Air M3Air M4
Ancho de banda100 GB/s100 GB/s120 GB/s
Memoria máxima24 GB24 GB32 GB
DecisiónMantener si tienes 16 GB o 24 GBPocos motivos para cambiar si ya tienes un M2Cambiar si quieres más de 24 GB
Conserva tu M2 de 16 o 24 GB
Permite usar modelos de 8-9B y 12-14B sin esfuerzo; el M4 solo mejora la velocidad máxima en aproximadamente un 20 %.
Cambia si tienes 8 GB
La mejora está en la categoría del modelo, no en la velocidad: un Air con al menos 16 GB permite pasar de un 4B a un 8-9B.
Cambia si quieres más de 24 GB
Solo el M4 ofrece 32 GB en el Air; si necesitas más, considera el MacBook Pro M4 Pro o Max.

#Preguntas frecuentes

FAQ
¿Puede un MacBook Air M2 de 8 GB ejecutar un modelo de 8B?+
Técnicamente sí en Q4 (unos 5 GB de pesos), pero el margen de 4 a 5 GB que deja macOS se supera en cuanto crece el contexto: el sistema escribe entonces en el SSD y todo se ralentiza. Con 8 GB, usa un modelo de 3 a 4 mil millones de parámetros y mantén el contexto corto.
¿Cuál es la verdadera diferencia entre el MacBook Air M2 y el M3 para un LLM?+
Muy pequeña para la generación: según las fichas de Apple, el Air M3 ofrece el mismo ancho de banda de 100 GB/s y el mismo máximo de 24 GB de memoria. El M3 aporta principalmente otras mejoras, sin efecto directo sobre la velocidad de lectura de los pesos. Si tienes un M2, es preferible esperar al M4.
¿El MacBook Air M2 24 GB vale la pena para la IA local?+
Sí, si quieres un modelo de 24 mil millones de parámetros en Q4 (aproximadamente 14 GB) o un RAG con embedder y reranker: estos usos no caben en 16 GB. De lo contrario, 16 GB ya bastan para los modelos de 8 a 9 mil millones de parámetros. Verifica la memoria real de la máquina antes de comprar.
¿A qué velocidad corre un LLM de 8B en un MacBook Air M2?+
El techo teórico es el ancho de banda dividido por el tamaño del modelo: 100 GB/s divididos por aproximadamente 5 GB dan un máximo de 20 tokens por segundo para un modelo de 8B en Q4. La velocidad real es inferior y depende del motor y del contexto. Consulta /benchmarks o mediciones de terceros que especifiquen el chip y la cuantización.
¿Se enciende el ventilador del Air M2 con un modelo grande?+
No: no tiene ventilador. Apple describe un diseño silencioso y sin ventilador. La contrapartida es térmica: bajo una carga prolongada, el chip reduce su frecuencia y la generación se ralentiza sin hacer ruido. Para procesos de varias horas, opta por un Mac mini o un MacBook Pro.
¿Ollama o LM Studio en un Air M2?+
Ollama para empezar rápido, escribir scripts e integrarse con otras herramientas; LM Studio para disponer de una interfaz gráfica y explorar modelos de Hugging Face. Ambos pueden coexistir, pero no deben cargar dos modelos al mismo tiempo en equipos con 8 o 16 GB: la memoria es el principal factor limitante.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.