¿Qué LLM en MacBook Air M3 (8 / 16 / 24 GB)? ?
IA local en MacBook Air M3: con 16 GB de memoria unificada, un modelo de 8 a 9 mil millones de parámetros en Q4 funciona con soltura; con 8 GB, limítate a modelos de 3-4B; con 24 GB, un modelo de 24B se carga, pero el ancho de banda de 100 GB/s lo hace lento. El M3 no es más rápido que el M2 para generar texto: las mediciones publicadas muestran tasas de generación casi idénticas. No lo confundas con Apple Intelligence, que es un servicio distinto.
El MacBook Air M3 es el portátil de Apple más extendido para probar la IA local. Es silencioso, no tiene ventilador y ejecuta sin problemas modelos de 8 a 9 mil millones de parámetros. Aquí explicamos qué permite cada configuración de memoria, qué dicen las mediciones publicadas sobre la velocidad, qué no ha cambiado desde el M2 y qué ajustes cuentan realmente.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: MacBook Pro M5 Pro — 24 GB / 1 TB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#MacBook Air M3 en 2026: la ficha técnica útil para los LLM
Según la ficha técnica de Apple, el chip M3 del MacBook Air combina una CPU de 8 núcleos (4 de rendimiento y 4 de eficiencia), una GPU de 8 o 10 núcleos, un Neural Engine de 16 núcleos y un ancho de banda de memoria de 100 GB/s. La memoria unificada está soldada: Apple indica dos configuraciones de entrada, 8 GB o 16 GB, ambas ampliables a 24 GB en el momento de la compra. El modelo está disponible en 13 y 15 pulgadas con el mismo chip.
- Ancho de banda
- 100 GB/s, idéntico al del M2. Es el ancho de banda, más que el número de núcleos GPU, lo que limita la velocidad de generación.
- Refrigeración
- Sin ventilador. El chip solo puede disipar el calor a través del chasis: durante una generación larga, acaba reduciendo su frecuencia.
- Neural Engine
- 16 núcleos, pero las herramientas habituales de IA local (Ollama, llama.cpp, LM Studio) utilizan la GPU a través de Metal, no el Neural Engine.
- Novedad del M3
- Dynamic Caching, que asigna en tiempo real la memoria local de la GPU. No tenemos mediciones de su efecto sobre los LLM ni prometemos ningún efecto.
#IA local o Apple Intelligence: dos cosas diferentes
La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
Muchas búsquedas sobre el MacBook Air M3 se centran en la «IA» en sentido amplio. Apple Intelligence es el conjunto de funciones integrado en macOS (resúmenes, escritura, Siri); según Apple, funciona en los Mac equipados con un chip M1 o más reciente y, por tanto, en el MacBook Air M3. No te permite elegir el modelo, ni exponer una API, ni trabajar con tus propios documentos usando un modelo abierto.
La IA local, de la que se habla en esta guía, consiste en descargar un modelo abierto (Qwen, Gemma, Granite, Mistral) y ejecutarlo con Ollama, LM Studio o MLX. Tú decides el modelo, el tamaño de contexto y lo que permanece en la máquina. Ambos pueden coexistir; sin embargo, la memoria es compartida, y un modelo de 9 mil millones de parámetros cargado reduce lo que queda para macOS y las aplicaciones.
#¿Cuánta memoria: 8, 16 o 24 GB?
La memoria es el primer criterio, porque un modelo que supera la capacidad de memoria no se ralentiza: se vuelve inutilizable. En Apple Silicon, la GPU no puede usar toda la memoria unificada; según las discusiones en el repositorio llama.cpp, Metal asigna por defecto entre dos tercios y tres cuartos. En una máquina de 16 GB, cuenta con unos 10 a 12 GB para el modelo y su contexto.
| Memoria | Utilizable para el modelo (estimación) | Lo que cabe holgadamente | Lo que cabe por poco |
|---|---|---|---|
| 8 GB | 5 a 6 GB | Qwen 3.5 4B (2,3 GB), Gemma 4 2B (1,2 GB) | Granite 4.2 8B (4,6 GB), contexto corto |
| 16 GB | 10 a 12 GB | Qwen 3.5 9B (6 GB), Granite 4.2 8B, Gemma 4 12B (7 GB) | Modelos de 14 GB y más: no |
| 24 GB | 16 a 18 GB | Qwen 3.5 9B en Q8, Gemma 4 12B, modelos de 14 a 16 GB | Mistral Small 3.2 24B (14 GB) o Qwen 3.5 27B (16 GB): cargan, pero son lentos |
La columna «utilizable» es una estimación basada en la regla de los dos tercios a tres cuartos, no un valor de Apple. La versión de 8 GB solo se justifica si sabes que seguirás usando únicamente modelos pequeños; como no se puede añadir memoria después, la versión de 16 GB es la opción razonable para la IA local. Para comprobar que un modelo y su contexto caben, la calculadora de memoria del sitio da el total.
#¿Qué modelo elegir, con qué velocidad esperada?
La tasa de generación está limitada por el ancho de banda dividido entre el tamaño de los pesos leídos en cada token. Con 100 GB/s, un modelo de 4,6 GB tiene un límite de unos 21 tokens por segundo, uno de 6 GB de unos 16 y uno de 14 GB de unos 7. En las mediciones publicadas para un Llama 7B, el M3 alcanza 21,34 tokens por segundo en Q4_0, lo que equivale a aproximadamente un 80 % del límite teórico. Se trata de límites teóricos, no de garantías.
| Modelo (Q4) | Tamaño del modelo | Límite (100 ÷ peso) | Puntos clave |
|---|---|---|---|
| Qwen 3.5 4B | 2,3 GB | aproximadamente 43 t/s | Muy fluido, respuestas cortas y rápidas |
| Granite 4.2 8B | 4,6 GB | aproximadamente 21 t/s | Buen equilibrio para el chat y los resúmenes |
| Qwen 3.5 9B | 6 GB | aproximadamente 16 t/s | La opción de 16 GB para la calidad |
| Gemma 4 12B | 7 GB | aproximadamente 14 t/s | Correcto con 16 GB, con contexto moderado |
| Mistral Small 3.2 24B | 14 GB | aproximadamente 7 t/s | Legible, pero ya no es un uso interactivo |
| Qwen 3.5 27B | 16 GB | aproximadamente 6 t/s | Reservar para tareas largas en equipos con 24 GB |
Si el resultado es demasiado lento, la solución no está en un ajuste, sino en el tamaño del modelo: pasar de 9B a 4B duplica aproximadamente la tasa de generación. Para programar, un modelo especializado de 7 a 9B resulta más útil que un 24B demasiado lento para usarlo de forma interactiva. La tabla de velocidades del sitio (/benchmarks) recoge las mediciones publicadas según el hardware.
#Sin ventilador: la temperatura limita las generaciones largas
El MacBook Air no tiene ventilador. Para una pregunta breve, no lo notarás. Para un resumen de varias decenas de páginas o una generación de varios minutos, el chip se calienta y acaba reduciendo su frecuencia y, por tanto, su velocidad de generación. El fenómeno depende de la habitación, de la carga y del entorno; no tenemos ninguna medición que citar, y es mejor comprobarlo en tu máquina con una generación larga.
- Colocar la máquina sobre un soporte ventilado
- Un soporte de aluminio o una superficie dura ayuda al chasis a evacuar el calor; un sofá o una cama lo impide.
- Planificar pausas
- En tareas largas, divide el trabajo en lotes en lugar de una sola generación de varios minutos.
- Usar un modelo más pequeño
- Un modelo de 4B o de 8B genera mucho menos calor que uno que satura el ancho de banda de forma continua.
- Conectar a la red eléctrica
- Cuando funciona con batería, macOS puede limitar el rendimiento para ahorrar energía.
#Instalar Ollama y lanzar un primer modelo
Ollama requiere macOS Sonoma (14) o una versión posterior. La forma más sencilla es descargar la aplicación desde el sitio oficial; la guía de instalación detalla la variante con Homebrew. Una vez iniciada, la aplicación escucha en el puerto 11434 de la máquina, y los modelos se descargan con un solo comando.
- 01Instalar OllamaDescarga la aplicación o sigue la guía de instalación en macOS, luego iníciala por primera vez.
- 02Elegir un modelo según la memoria8 GB: un modelo de 3 a 4 mil millones de parámetros. 16 GB: un 8B (5,2 GB en la biblioteca Ollama). 24 GB: un 14B (9,3 GB) o más.
- 03Iniciar la generaciónEjecuta ollama run seguido del nombre del modelo: la descarga se realiza en la primera invocación.
- 04Verificar la memoria durante el usoAbre el Monitor de actividad, pestaña Memoria: la presión debe mantenerse en verde. Si pasa a amarillo o rojo, el modelo es demasiado grande o el contexto demasiado largo.
La biblioteca de Ollama indica 5,2 GB para qwen3:8b y 9,3 GB para qwen3:14b. El segundo es adecuado para un MacBook Air de 24 GB, pero no para uno de 16 GB, donde deja demasiado poco margen. Si quieres probar MLX en lugar de Ollama, la guía específica explica la diferencia y las limitaciones de cada herramienta.
#Dos ajustes de Ollama que importan con 16 GB
El primero es el tamaño del contexto. Las preguntas frecuentes oficiales de Ollama indican una ventana predeterminada de 4.096 tokens, que se puede modificar; ampliarla consume memoria para el caché. Para documentos largos, auméntala progresivamente en lugar de fijar un valor máximo. El segundo es la cuantización del caché KV: según esas mismas preguntas frecuentes, Ollama acepta la variable OLLAMA_KV_CACHE_TYPE con el valor q8_0, que utiliza aproximadamente la mitad de la memoria del formato f16 predeterminado, siempre que Flash Attention esté activado.
En Mac, la FAQ especifica que, cuando Ollama se ejecuta como aplicación, las variables se definen con launchctl y después hay que reiniciar la aplicación. La guía de optimización de los Mac con Apple Silicon complementa estos ajustes en macOS.
#MLX o Ollama en MacBook Air M3
MLX es el marco de aprendizaje automático de Apple para sus chips. Es adecuado para desarrolladores que quieran controlar el modelo desde Python o realizar un ajuste fino con LoRA en local. Ollama, por su parte, se encarga de la descarga, la carga y la API; es el punto de entrada más sencillo. Las diferencias de velocidad entre ambos dependen del modelo y de la versión: en lugar de prometer un porcentaje, consulta la comparación detallada del sitio.
#¿Se debe pasar a un MacBook Air M4 o superior?
El M4 aumenta el ancho de banda a 120 GB/s según la tabla de llama.cpp, un 20 % más que el M3: en esta tabla, un Llama 7B en Q4_0 pasa de 21,34 a 24,11 tokens por segundo. La mejora se nota en los modelos de 8B o más, pero no supone un cambio radical. La verdadera limitación del M3 sigue siendo la memoria, no la velocidad.
| Tu situación | Recomendación |
|---|---|
| Air M3 de 16 GB, uso para chat y síntesis con modelos de 8-9B | Consérvalo: la mejora de un M4 es de aproximadamente un 20 % en velocidad de generación. |
| Air M3 de 8 GB, con ganas de usar modelos de 8B o más | Cambia a 16 GB o más: la memoria es el límite |
| Necesitas ejecutar con comodidad un modelo de 24 a 32B | Un Mac con más ancho de banda y memoria (MacBook Pro, Mac mini M4 Pro) |
| Generaciones largas continuas | Un Mac con ventilador, para evitar la bajada de frecuencia |
- MacBook Air M4: el sucesor
- MacBook Air M2: la generación anterior
- MacBook Pro M2: con ventilador
- Ajustes de macOS para Apple Silicon
- Fuente: ficha técnica del MacBook Air M3 (Apple)
- Fuente: mediciones de llama.cpp en chips Apple
- Fuente: FAQ oficial de Ollama
#Preguntas frecuentes
¿Puede el MacBook Air M3 ejecutar un LLM de 70B?+
¿Qué velocidad se puede esperar en un MacBook Air M3?+
¿MacBook Air M3 con 8 GB o MacBook Air M2 con 16 GB para la IA local?+
¿Se puede usar el Neural Engine para ejecutar LLM?+
¿El MacBook Air M3 se calienta demasiado para la IA local?+
¿Qué modelo usar para programar en un MacBook Air M3 de 16 GB?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.