Qué LLM en MacBook Air M2 (8 / 16 / 24 GB) ?
El MacBook Air M2 ejecuta modelos de 3 a 4 mil millones de parámetros con 8 GB, de 8 a 9 mil millones con 16 GB y hasta un modelo de 24B en Q4 con 24 GB. Su ancho de banda de 100 GB/s, un 50 % más que el del M1 según Apple, limita la velocidad de un modelo de 8B en Q4 a unos 20 tokens por segundo; la memoria determina qué se puede cargar.
El M2 es el primer chip del Air que ofrece 24 GB y 100 GB/s. Esta página indica qué clase de modelo elegir según tengas 8, 16 o 24 GB, calcula la velocidad máxima físicamente posible y señala cuándo pasar a un M4.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: MacBook Pro M5 Pro — 24 GB / 1 TB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#MacBook Air M2: ancho de banda de 100 GB/s y hasta 24 GB
El MacBook Air M2 introduce dos cambios respecto al M1 que importan para un LLM: el ancho de banda aumenta a 100 GB/s y la memoria puede alcanzar los 24 GB. Apple anuncia 100 GB/s para el M2, un 50 % más que para el M1; es la cifra oficial, y no un aumento del 47 % como a veces se lee. Por tanto, la velocidad máxima de generación aumenta entre aproximadamente un tercio y la mitad, según el modelo, y la categoría de modelos que se pueden ejecutar sube un nivel.
- Chip
- Apple M2: CPU de 8 núcleos (4 de rendimiento, 4 de eficiencia), GPU de 8 núcleos, o 10 núcleos en configuración superior, Neural Engine de 16 núcleos, según la ficha técnica de Apple.
- Memoria
- Según la ficha de Apple, los MacBook Air M2 están disponibles en versiones de 8 GB (configurables con 16 o 24 GB) y de 16 GB (configurables con 24 GB). La memoria está soldada: debes elegirla al comprar.
- Ancho de banda
- 100 GB/s, según Apple, es decir un 50 % más que el M1.
- Refrigeración
- Sin ventilador: Apple describe el MacBook Air M2 como un equipo de diseño silencioso sin ventilador. Ese silencio tiene un coste bajo carga sostenida; consulta la sección sobre comportamiento térmico.
- Batería
- 52,6 Wh; Apple anuncia hasta 15 horas de navegación web inalámbrica. Un LLM que somete la GPU a una carga de trabajo consume mucho más que una página web.
#8, 16 o 24 GB: lo que cada nivel permite
En un MacBook Air M2, cada gigaocteto cuenta. El kit Mac te ayuda a elegir el modelo que realmente cabe (cap. 4), a calcular tu presupuesto de memoria (cap. 5) y a medir el efecto sobre el calor y la batería (cap. 6).
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
Un modelo no puede ocupar toda la memoria: macOS, el navegador y tus aplicaciones reservan una parte. Cuenta con un margen de unos 4 a 5 GB en una máquina de 8 GB, de 10 a 11 GB en una de 16 GB y de 16 a 18 GB en una de 24 GB para el modelo y su contexto. Son estimaciones prudentes, que deben contrastarse con la presión de memoria del Monitor de actividad. El tamaño de un modelo sigue las referencias del sitio: 3B aproximadamente 2 GB, 7-8B aproximadamente 5 GB, 14B aproximadamente 9 GB, 32B aproximadamente 19 a 20 GB en Q4.
| Memoria | Margen para el modelo y el contexto | Clase de modelo para un uso cómodo | Al límite |
|---|---|---|---|
| 8 GB | ≈ 4 a 5 GB | 3-4B | 8B con contexto muy corto |
| 16 GB | ≈ 10 a 11 GB | 8-9B, contexto medio | 12B con contexto corto |
| 24 GB | ≈ 16 a 18 GB | Modelos de 12-14B con comodidad, de 8-9B en Q8 o con contexto largo | 24B en Q4 (≈ 14 GB) con contexto reducido |
El nivel de 24 GB es el que cambia la naturaleza de la máquina: permite ejecutar modelos de 24 mil millones de parámetros en Q4 (aproximadamente 14 GB de pesos), algo que ningún Air M1 permite. Sin embargo, es poco habitual: como la memoria no se puede ampliar, la mayoría de los Air M2 en circulación tienen 8 o 16 GB. Comprueba en el menú Apple, «Acerca de este Mac», qué memoria tiene realmente la máquina antes de elegir un modelo.
#La velocidad máxima que puede alcanzar el M2
La generación lee los pesos activos en cada token: la velocidad máxima es el ancho de banda dividido por el peso en gigabytes. La tabla siguiente aplica la fórmula al M2 (100 GB/s) y al M1 (aproximadamente 68 GB/s). Son límites máximos calculados, nunca mediciones: la velocidad real es más baja y depende del motor, de la cuantización y de la longitud del contexto. Permiten verificar que una cifra anunciada en otro lugar sea físicamente posible.
| Modelo | Tamaño del modelo | Air M1 (≈ 68 GB/s) | Air M2 (100 GB/s) |
|---|---|---|---|
| 3B | ≈ 2 GB | ≈ 34 tok/s | ≈ 50 tok/s |
| 4B | ≈ 2,5 a 3 GB | ≈ 23 a 27 tok/s | ≈ 33 a 40 tok/s |
| 8B | ≈ 5 GB | ≈ 13 tok/s | ≈ 20 tok/s |
| 12B | ≈ 7,5 GB | ≈ 9 tok/s | ≈ 13 tok/s |
| 24B | ≈ 14 GB | no aplicable (memoria) | ≈ 7 tok/s |
De aquí se desprenden dos conclusiones. En primer lugar, un modelo de 8B en Q4 en M2 se sitúa, en teoría, por debajo de 20 tokens por segundo: una velocidad indicada de 25 o 28 tokens por segundo para este modelo en este chip no puede proceder de la generación clásica. En segundo lugar, un modelo de 24B alcanza un máximo de unos 7 tokens por segundo: sirve para una respuesta pausada, pero no para un intercambio rápido. Para mediciones reales, consulta /benchmarks y los benchmarks de terceros, comprobando el chip, la cuantización y el motor.
#Instalar un modelo y verificar el GPU
- 01Instalar OllamaDescárgalo en ollama.com o con Homebrew. La guía de instalación para macOS del sitio detalla las opciones de arranque.
- 02Elegir el modelo según la memoria4B en 8 GB, 8-9B en 16 GB, 12-14B o un 24B en Q4 en 24 GB. Inícialo con ollama run seguido del nombre del modelo.
- 03Verificar la GPUEn otro terminal, ollama ps muestra la distribución CPU/GPU en la columna PROCESSOR. Lo esperado es que todo esté en la GPU.
- 04Ajustar el contextoOllama fija el contexto predeterminado en 4.000 tokens cuando hay menos de 24 GiB de memoria. Auméntalo progresivamente en lugar de hacerlo de golpe: la caché KV ocupa memoria por cada token.
Los modelos se instalan en ~/.ollama/models. En un Air M2 con un SSD de 256 GB, unos pocos modelos de 5 a 15 GB bastan para llenar el espacio libre: utiliza ollama rm para eliminar los que ya no uses.
Una pauta útil para elegir: empieza con el modelo más pequeño que responda correctamente a tu tarea y pasa al tamaño inmediatamente superior solo si las respuestas siguen siendo insuficientes. En una máquina con ancho de banda limitado, cada mil millones de parámetros adicionales se traducen en una pérdida de velocidad. Prueba dos candidatos con cinco de tus propias consultas reales antes de decidir: lleva diez minutos y evita descargar un modelo demasiado pesado.
#La configuración de 24 GB y el RAG: lo que realmente permite este nivel
Un asistente que trabaja con tus documentos requiere tres componentes: un modelo de embeddings que indexa, un modelo de generación que responde y, opcionalmente, un reranker que ordena los pasajes. Con 8 GB, el conjunto cabe con poco margen. Con 16 GB, un embedder ligero y un modelo de 8-9B pueden coexistir con un contexto corto. Con 24 GB, puedes añadir un reranker y mantener un contexto de varios miles de tokens sin escribir en el SSD. Es en este uso donde optar por una capacidad de memoria superior cobra pleno sentido.
- Antes de la indexación
- Comprueba que haya memoria suficiente para el modelo de embeddings junto con el modelo de generación: ambos permanecen cargados durante la solicitud.
- Durante la solicitud
- Inyecta algunos pasajes bien seleccionados en lugar de un documento entero: el contexto consume memoria y tiempo de cálculo.
- Después
- Si la presión de memoria llega al amarillo, reduce el número de pasos o pasa a un modelo más pequeño.
#Quantización y caché KV en M2
En una máquina limitada por el ancho de banda, Q4_K_M sigue siendo el ajuste predeterminado: el modelo es más pequeño, por lo que es más rápido de leer. Q5_K_M se justifica cuando la memoria lo permite y la calidad es prioritaria. Q8_0 casi duplica el peso y reduce aproximadamente a la mitad el límite de velocidad. Para la caché KV, Ollama utiliza automáticamente la atención flash cuando el motor y el hardware lo permiten; la variable OLLAMA_KV_CACHE_TYPE cuantiza la caché, con f16 por defecto. Hace que los contextos largos sean más accesibles con 16 GB, a costa de una ligera pérdida de precisión.
#Autonomía, silencio y calentamiento
El Air M2 no tiene ventilador: se mantiene silencioso, lo que resulta adecuado para una oficina tranquila o para un asistente que se deja funcionando por la noche. El chasis disipa el calor de forma pasiva, por lo que una carga de varias decenas de minutos reduce la frecuencia del chip. Esta página no indica ni el tiempo ni la temperatura a partir de los cuales ocurre: ninguna fuente primaria los establece y varían según la habitación. Con batería, la autonomía disminuye mucho más rápido que al navegar, ya que la GPU trabaja continuamente; para una sesión larga, conecta el equipo a la red eléctrica.
- Procesos prolongados
- Conecta el equipo a la corriente, elévalo y evita las aplicaciones que sometan al procesador a una carga simultánea.
- Modo de ahorro de energía
- macOS lo ofrece en los ajustes de batería. Limita el rendimiento: resérvalo para los desplazamientos en los que la autonomía prime sobre la velocidad.
- Carga continua
- Para un servidor local que responde todo el día, un Mac mini, que tiene un ventilador, es más adecuado que un Air.
#¿Quedarse con el M2 o pasar a un M3 o un M4?
El M3 mantiene el mismo ancho de banda de 100 GB/s y el mismo límite de 24 GB en el Air, según las fichas de Apple: para un LLM, pasar de M2 a M3 no aporta casi nada medible en cuanto a generación. El M4 aumenta el ancho de banda a 120 GB/s y la memoria a 32 GB, lo que cambia tanto la velocidad máxima como la clase de modelos.
| Criterio | Air M2 | Air M3 | Air M4 |
|---|---|---|---|
| Ancho de banda | 100 GB/s | 100 GB/s | 120 GB/s |
| Memoria máxima | 24 GB | 24 GB | 32 GB |
| Decisión | Mantener si tienes 16 GB o 24 GB | Pocos motivos para cambiar si ya tienes un M2 | Cambiar si quieres más de 24 GB |
- Conserva tu M2 de 16 o 24 GB
- Permite usar modelos de 8-9B y 12-14B sin esfuerzo; el M4 solo mejora la velocidad máxima en aproximadamente un 20 %.
- Cambia si tienes 8 GB
- La mejora está en la categoría del modelo, no en la velocidad: un Air con al menos 16 GB permite pasar de un 4B a un 8-9B.
- Cambia si quieres más de 24 GB
- Solo el M4 ofrece 32 GB en el Air; si necesitas más, considera el MacBook Pro M4 Pro o Max.
- MacBook Air M1: las limitaciones con 8 y 16 GB
- MacBook Air M3: los mismos 100 GB/s
- MacBook Air M4: 32 GB y 120 GB/s
- Instalar Ollama en macOS
- MacBook Pro M4 Pro y Max, hasta 128 GB
- Calculadora de VRAM del sitio
- Fuente: ficha técnica de Apple del MacBook Air M2
- Fuente: Apple, anuncio del chip M2
- Fuente: ficha técnica de Apple del MacBook Air M4
- Fuente: documentación de Ollama, contexto
#Preguntas frecuentes
¿Puede un MacBook Air M2 de 8 GB ejecutar un modelo de 8B?+
¿Cuál es la verdadera diferencia entre el MacBook Air M2 y el M3 para un LLM?+
¿El MacBook Air M2 24 GB vale la pena para la IA local?+
¿A qué velocidad corre un LLM de 8B en un MacBook Air M2?+
¿Se enciende el ventilador del Air M2 con un modelo grande?+
¿Ollama o LM Studio en un Air M2?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.