Principiante 11 minMacBook Air

¿Qué LLM en MacBook Air M3 (8 / 16 / 24 GB)? ?

Respuesta directa

IA local en MacBook Air M3: con 16 GB de memoria unificada, un modelo de 8 a 9 mil millones de parámetros en Q4 funciona con soltura; con 8 GB, limítate a modelos de 3-4B; con 24 GB, un modelo de 24B se carga, pero el ancho de banda de 100 GB/s lo hace lento. El M3 no es más rápido que el M2 para generar texto: las mediciones publicadas muestran tasas de generación casi idénticas. No lo confundas con Apple Intelligence, que es un servicio distinto.

El MacBook Air M3 es el portátil de Apple más extendido para probar la IA local. Es silencioso, no tiene ventilador y ejecuta sin problemas modelos de 8 a 9 mil millones de parámetros. Aquí explicamos qué permite cada configuración de memoria, qué dicen las mediciones publicadas sobre la velocidad, qué no ha cambiado desde el M2 y qué ajustes cuentan realmente.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en macOS 14+
Hardware recomendado

Alternativa de compra para esta guía: MacBook Pro M5 Pro — 24 GB / 1 TB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#MacBook Air M3 en 2026: la ficha técnica útil para los LLM

Según la ficha técnica de Apple, el chip M3 del MacBook Air combina una CPU de 8 núcleos (4 de rendimiento y 4 de eficiencia), una GPU de 8 o 10 núcleos, un Neural Engine de 16 núcleos y un ancho de banda de memoria de 100 GB/s. La memoria unificada está soldada: Apple indica dos configuraciones de entrada, 8 GB o 16 GB, ambas ampliables a 24 GB en el momento de la compra. El modelo está disponible en 13 y 15 pulgadas con el mismo chip.

Ancho de banda
100 GB/s, idéntico al del M2. Es el ancho de banda, más que el número de núcleos GPU, lo que limita la velocidad de generación.
Refrigeración
Sin ventilador. El chip solo puede disipar el calor a través del chasis: durante una generación larga, acaba reduciendo su frecuencia.
Neural Engine
16 núcleos, pero las herramientas habituales de IA local (Ollama, llama.cpp, LM Studio) utilizan la GPU a través de Metal, no el Neural Engine.
Novedad del M3
Dynamic Caching, que asigna en tiempo real la memoria local de la GPU. No tenemos mediciones de su efecto sobre los LLM ni prometemos ningún efecto.
i
Lo que el M3 no ha cambiado
El M3 mantiene los 100 GB/s del M2. La tabla de mediciones de llama.cpp lo confirma: un Llama 7B en Q4_0 genera 21,34 tokens por segundo en M3 frente a 21,91 en M2 (Q8_0: 12,27 frente a 12,21). Por tanto, pasar de un Air M2 a un Air M3 no acelera la generación de texto. El ancho de banda solo cambia con el M4, a 120 GB/s.

#IA local o Apple Intelligence: dos cosas diferentes

El kit Mac

La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Muchas búsquedas sobre el MacBook Air M3 se centran en la «IA» en sentido amplio. Apple Intelligence es el conjunto de funciones integrado en macOS (resúmenes, escritura, Siri); según Apple, funciona en los Mac equipados con un chip M1 o más reciente y, por tanto, en el MacBook Air M3. No te permite elegir el modelo, ni exponer una API, ni trabajar con tus propios documentos usando un modelo abierto.

La IA local, de la que se habla en esta guía, consiste en descargar un modelo abierto (Qwen, Gemma, Granite, Mistral) y ejecutarlo con Ollama, LM Studio o MLX. Tú decides el modelo, el tamaño de contexto y lo que permanece en la máquina. Ambos pueden coexistir; sin embargo, la memoria es compartida, y un modelo de 9 mil millones de parámetros cargado reduce lo que queda para macOS y las aplicaciones.

#¿Cuánta memoria: 8, 16 o 24 GB?

La memoria es el primer criterio, porque un modelo que supera la capacidad de memoria no se ralentiza: se vuelve inutilizable. En Apple Silicon, la GPU no puede usar toda la memoria unificada; según las discusiones en el repositorio llama.cpp, Metal asigna por defecto entre dos tercios y tres cuartos. En una máquina de 16 GB, cuenta con unos 10 a 12 GB para el modelo y su contexto.

Lo que cada configuración permite (peso en Q4 del catálogo QuelLLM)
MemoriaUtilizable para el modelo (estimación)Lo que cabe holgadamenteLo que cabe por poco
8 GB5 a 6 GBQwen 3.5 4B (2,3 GB), Gemma 4 2B (1,2 GB)Granite 4.2 8B (4,6 GB), contexto corto
16 GB10 a 12 GBQwen 3.5 9B (6 GB), Granite 4.2 8B, Gemma 4 12B (7 GB)Modelos de 14 GB y más: no
24 GB16 a 18 GBQwen 3.5 9B en Q8, Gemma 4 12B, modelos de 14 a 16 GBMistral Small 3.2 24B (14 GB) o Qwen 3.5 27B (16 GB): cargan, pero son lentos

La columna «utilizable» es una estimación basada en la regla de los dos tercios a tres cuartos, no un valor de Apple. La versión de 8 GB solo se justifica si sabes que seguirás usando únicamente modelos pequeños; como no se puede añadir memoria después, la versión de 16 GB es la opción razonable para la IA local. Para comprobar que un modelo y su contexto caben, la calculadora de memoria del sitio da el total.

#¿Qué modelo elegir, con qué velocidad esperada?

La tasa de generación está limitada por el ancho de banda dividido entre el tamaño de los pesos leídos en cada token. Con 100 GB/s, un modelo de 4,6 GB tiene un límite de unos 21 tokens por segundo, uno de 6 GB de unos 16 y uno de 14 GB de unos 7. En las mediciones publicadas para un Llama 7B, el M3 alcanza 21,34 tokens por segundo en Q4_0, lo que equivale a aproximadamente un 80 % del límite teórico. Se trata de límites teóricos, no de garantías.

Límite teórico con un ancho de banda de 100 GB/s según el tamaño de los pesos
Modelo (Q4)Tamaño del modeloLímite (100 ÷ peso)Puntos clave
Qwen 3.5 4B2,3 GBaproximadamente 43 t/sMuy fluido, respuestas cortas y rápidas
Granite 4.2 8B4,6 GBaproximadamente 21 t/sBuen equilibrio para el chat y los resúmenes
Qwen 3.5 9B6 GBaproximadamente 16 t/sLa opción de 16 GB para la calidad
Gemma 4 12B7 GBaproximadamente 14 t/sCorrecto con 16 GB, con contexto moderado
Mistral Small 3.2 24B14 GBaproximadamente 7 t/sLegible, pero ya no es un uso interactivo
Qwen 3.5 27B16 GBaproximadamente 6 t/sReservar para tareas largas en equipos con 24 GB

Si el resultado es demasiado lento, la solución no está en un ajuste, sino en el tamaño del modelo: pasar de 9B a 4B duplica aproximadamente la tasa de generación. Para programar, un modelo especializado de 7 a 9B resulta más útil que un 24B demasiado lento para usarlo de forma interactiva. La tabla de velocidades del sitio (/benchmarks) recoge las mediciones publicadas según el hardware.

#Sin ventilador: la temperatura limita las generaciones largas

El MacBook Air no tiene ventilador. Para una pregunta breve, no lo notarás. Para un resumen de varias decenas de páginas o una generación de varios minutos, el chip se calienta y acaba reduciendo su frecuencia y, por tanto, su velocidad de generación. El fenómeno depende de la habitación, de la carga y del entorno; no tenemos ninguna medición que citar, y es mejor comprobarlo en tu máquina con una generación larga.

Colocar la máquina sobre un soporte ventilado
Un soporte de aluminio o una superficie dura ayuda al chasis a evacuar el calor; un sofá o una cama lo impide.
Planificar pausas
En tareas largas, divide el trabajo en lotes en lugar de una sola generación de varios minutos.
Usar un modelo más pequeño
Un modelo de 4B o de 8B genera mucho menos calor que uno que satura el ancho de banda de forma continua.
Conectar a la red eléctrica
Cuando funciona con batería, macOS puede limitar el rendimiento para ahorrar energía.

#Instalar Ollama y lanzar un primer modelo

Ollama requiere macOS Sonoma (14) o una versión posterior. La forma más sencilla es descargar la aplicación desde el sitio oficial; la guía de instalación detalla la variante con Homebrew. Una vez iniciada, la aplicación escucha en el puerto 11434 de la máquina, y los modelos se descargan con un solo comando.

  1. 01
    Instalar Ollama
    Descarga la aplicación o sigue la guía de instalación en macOS, luego iníciala por primera vez.
  2. 02
    Elegir un modelo según la memoria
    8 GB: un modelo de 3 a 4 mil millones de parámetros. 16 GB: un 8B (5,2 GB en la biblioteca Ollama). 24 GB: un 14B (9,3 GB) o más.
  3. 03
    Iniciar la generación
    Ejecuta ollama run seguido del nombre del modelo: la descarga se realiza en la primera invocación.
  4. 04
    Verificar la memoria durante el uso
    Abre el Monitor de actividad, pestaña Memoria: la presión debe mantenerse en verde. Si pasa a amarillo o rojo, el modelo es demasiado grande o el contexto demasiado largo.
Primer modelo en 16 GB
ollama run qwen3:8b

La biblioteca de Ollama indica 5,2 GB para qwen3:8b y 9,3 GB para qwen3:14b. El segundo es adecuado para un MacBook Air de 24 GB, pero no para uno de 16 GB, donde deja demasiado poco margen. Si quieres probar MLX en lugar de Ollama, la guía específica explica la diferencia y las limitaciones de cada herramienta.

#Dos ajustes de Ollama que importan con 16 GB

El primero es el tamaño del contexto. Las preguntas frecuentes oficiales de Ollama indican una ventana predeterminada de 4.096 tokens, que se puede modificar; ampliarla consume memoria para el caché. Para documentos largos, auméntala progresivamente en lugar de fijar un valor máximo. El segundo es la cuantización del caché KV: según esas mismas preguntas frecuentes, Ollama acepta la variable OLLAMA_KV_CACHE_TYPE con el valor q8_0, que utiliza aproximadamente la mitad de la memoria del formato f16 predeterminado, siempre que Flash Attention esté activado.

Reducir la caché de contexto a la mitad
launchctl setenv OLLAMA_FLASH_ATTENTION 1
launchctl setenv OLLAMA_KV_CACHE_TYPE q8_0
# puis quitter et relancer l'application Ollama

En Mac, la FAQ especifica que, cuando Ollama se ejecuta como aplicación, las variables se definen con launchctl y después hay que reiniciar la aplicación. La guía de optimización de los Mac con Apple Silicon complementa estos ajustes en macOS.

#MLX o Ollama en MacBook Air M3

MLX es el marco de aprendizaje automático de Apple para sus chips. Es adecuado para desarrolladores que quieran controlar el modelo desde Python o realizar un ajuste fino con LoRA en local. Ollama, por su parte, se encarga de la descarga, la carga y la API; es el punto de entrada más sencillo. Las diferencias de velocidad entre ambos dependen del modelo y de la versión: en lugar de prometer un porcentaje, consulta la comparación detallada del sitio.

#¿Se debe pasar a un MacBook Air M4 o superior?

El M4 aumenta el ancho de banda a 120 GB/s según la tabla de llama.cpp, un 20 % más que el M3: en esta tabla, un Llama 7B en Q4_0 pasa de 21,34 a 24,11 tokens por segundo. La mejora se nota en los modelos de 8B o más, pero no supone un cambio radical. La verdadera limitación del M3 sigue siendo la memoria, no la velocidad.

Cuándo conservar tu Air M3 y cuándo cambiar
Tu situaciónRecomendación
Air M3 de 16 GB, uso para chat y síntesis con modelos de 8-9BConsérvalo: la mejora de un M4 es de aproximadamente un 20 % en velocidad de generación.
Air M3 de 8 GB, con ganas de usar modelos de 8B o másCambia a 16 GB o más: la memoria es el límite
Necesitas ejecutar con comodidad un modelo de 24 a 32BUn Mac con más ancho de banda y memoria (MacBook Pro, Mac mini M4 Pro)
Generaciones largas continuasUn Mac con ventilador, para evitar la bajada de frecuencia

#Preguntas frecuentes

FAQ
¿Puede el MacBook Air M3 ejecutar un LLM de 70B?+
No, no de forma utilizable. Un modelo de 70B en Q4 pesa aproximadamente 40 GB, mucho más que los 24 GB máximos del MacBook Air M3. Incluso con una cuantización muy agresiva, no cabría. El límite razonable en esta máquina es un modelo de 24 a 27B con 24 GB, aunque lento, y uno de 8-9B con 16 GB para un uso fluido.
¿Qué velocidad se puede esperar en un MacBook Air M3?+
Con un Llama 7B en Q4_0, la tabla de mediciones de llama.cpp indica 21,34 tokens por segundo para un M3 con 10 núcleos de GPU. Un modelo más grande será más lento; uno de 4B será aproximadamente el doble de rápido. Son mediciones realizadas por usuarios con un modelo antiguo y deben interpretarse como un orden de magnitud.
¿MacBook Air M3 con 8 GB o MacBook Air M2 con 16 GB para la IA local?+
El M2 de 16 GB, sin dudarlo. Los dos chips tienen el mismo ancho de banda de 100 GB/s, por lo que el M3 no genera más rápido, mientras que 16 GB permiten cargar un modelo de 8-9B que no cabe cómodamente en 8 GB. La memoria es el criterio determinante.
¿Se puede usar el Neural Engine para ejecutar LLM?+
No con las herramientas habituales. Ollama, llama.cpp y LM Studio ejecutan el modelo en la GPU a través de Metal. El Neural Engine de 16 núcleos se utiliza principalmente para tareas de Core ML, como la visión o el reconocimiento de voz, y no es la vía para acelerar un LLM de conversación en este Mac.
¿El MacBook Air M3 se calienta demasiado para la IA local?+
No tiene ventilador, por lo que acaba reduciendo su frecuencia durante las generaciones largas. Para preguntas cortas, no lo notarás. Para tareas largas, colócalo sobre un soporte que disipe el calor, enchúfalo y elige un modelo más pequeño. Una máquina con ventilador es preferible para un uso continuo.
¿Qué modelo usar para programar en un MacBook Air M3 de 16 GB?+
Un modelo de código de 7 a 9 mil millones de parámetros en Q4, de unos 5 a 6 GB, deja espacio para el contexto de tus archivos. Un 14B en Q4 (unos 9 GB) es una opción viable si aceptas una menor velocidad de generación. Por encima de ese tamaño, un contexto largo consume el margen restante y la velocidad resulta demasiado baja para la escritura asistida.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.