Intermedio 12 minQwen

Qwen3 32B en Mac M1/M2: memoria y ajustes MLX

Respuesta directa

Qwen3 32B cabe en 18,4 GB de RAM en la versión oficial MLX de 4 bits, más la memoria necesaria para el contexto utilizado: calcula al menos entre 24 y 32 GB de memoria unificada para un uso cómodo sin swap. Un Mac M1 o M2 básico (8 o 16 GB) no basta; se necesita un chip Pro, Max o Ultra.

Qwen3 32B es un modelo denso de 32,8 mil millones de parámetros, con un contexto nativo de 32.768 tokens extensible a 131.072 mediante YaRN. En Mac, la pregunta no es solo «¿se puede cargar?», sino «¿con cuánta memoria realmente libre, qué cuantización y qué contexto?». Esta guía detalla las cifras verificables para un Mac M1 o M2, sin asumir una compatibilidad que no existe en las configuraciones más modestas.

Por Mohamed Meguedmi·Actualización 2026-09-28·Probado en Windows, macOS y Linux

#Memoria unificada realmente necesaria

El punto de partida es el peso del modelo cuantizado, no el número de parámetros. La versión MLX 4-bit publicada por la comunidad mlx-community pesa 18,4 GB en disco y en memoria al cargar. En un Mac, la memoria unificada se comparte entre el sistema, las aplicaciones abiertas y el modelo: reservar únicamente 18,4 GB de RAM total no deja margen para el sistema ni para el contexto de conversación.

La ficha oficial de Qwen detalla la arquitectura que hay detrás de estos pesos: 64 capas y atención por grupos (GQA) con 64 cabezas para las consultas, pero solo 8 para las claves y los valores. En concreto, menos cabezas KV significa una caché KV más compacta por token de contexto que con una atención multicabeza clásica con igual número de cabezas para consultas, claves y valores. Esta es una de las razones por las que un modelo denso de 32,8 mil millones de parámetros sigue siendo viable con la memoria unificada de un Mac, siempre que los pesos del propio modelo ya quepan en la RAM disponible.

Memoria unificada que debes prever para Qwen3 32B
ConfiguraciónViabilidadNota
16 GB de RAM unificadaNo realistaEl modelo solo (18,4 GB en 4-bit) ya supera la RAM total.
24 GB de RAM unificadaPosible, contexto cortoMargen reducido para el sistema y la caché KV; reservar para un uso puntual.
32 GB de RAM unificadaCómodoMargen suficiente para un contexto medio sin recurrir al swap con frecuencia.
64 GB o másCon solturaPermite usar un contexto largo y mantener otras aplicaciones abiertas.

#¿Qué chip M1/M2 para 32B?

El kit Mac

La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Un MacBook Air o Pro con un M1 o M2 «básico» se vende con 8 o 16 GB de memoria unificada: insuficientes para Qwen3 32B, incluso en 4 bits. Hay que optar por un chip M1 Pro/Max/Ultra o M2 Pro/Max/Ultra, configurado con al menos 32 GB de memoria unificada, para disponer de un margen razonable una vez que se tienen en cuenta el sistema y el contexto. No es una cuestión de potencia de cálculo de la GPU: es una cuestión de la cantidad de memoria físicamente presente en la máquina, que no se puede ampliar después de la compra.

!
Objeción: «mi máquina muestra 16 GB, debería funcionar usando swap»
Técnicamente, macOS puede usar el SSD como memoria auxiliar (swap), pero las velocidades de transferencia de un SSD no son comparables con las de la memoria unificada: un modelo que recurre masivamente al swap se vuelve inutilizable en la práctica, con tiempos de respuesta que se cuentan en minutos en lugar de segundos. No es una opción viable para un uso habitual.

#¿MLX o llama.cpp/Ollama?

MLX es el framework desarrollado para aprovechar la arquitectura de memoria unificada de Apple Silicon; llama.cpp (y Ollama, que se basa en él) sigue siendo una alternativa sólida, con un ecosistema de cuantizaciones GGUF más amplio y un manejo inicial más sencillo para quienes ya conocen Ollama en otras máquinas. Para Qwen3 32B en particular, la versión oficial MLX de 4 bits de la comunidad mlx-community es directamente comparable en tamaño (18,4 GB) a las cuantizaciones GGUF equivalentes: la elección depende principalmente de la herramienta que ya domines, no de una diferencia de viabilidad.

Elegir MLX
Si ya estás en el ecosistema Python/Hugging Face y quieres la conversión más cercana a la arquitectura Apple Silicon.
Elegir Ollama/llama.cpp
Si quieres un único comando, un servidor local estándar y compatibilidad con las mismas herramientas que en PC/Linux.

#Instalar con MLX, paso a paso

  1. 01
    Verificar la memoria disponible
    En el Monitor de Actividad (pestaña Memoria), anotar la memoria realmente libre antes de iniciar cualquier cosa, no solo la RAM total anunciada por la máquina.
  2. 02
    Instalar mlx-lm
    Instalar el paquete Python mlx-lm en un entorno dedicado, en lugar de globalmente, para evitar conflictos de versiones.
  3. 03
    Descargar la versión de 4 bits
    Descargar mlx-community/Qwen3-32B-4bit en lugar de una versión no cuantizada, para limitar el uso de memoria al cargar el modelo.
  4. 04
    Iniciar primero con un contexto reducido
    Empezar con un contexto corto (4 000 a 8 000 tokens) para verificar que el modelo se cargue y responda, antes de aumentarlo progresivamente según la memoria restante observada.

#Configuración de memoria GPU para macOS (no oficial)

En Apple Silicon, macOS reserva por defecto una parte de la memoria unificada fuera del alcance de la GPU: Metal expone un tamaño de trabajo recomendado de aproximadamente el 75 % de la RAM total. Un ajuste del sistema, iogpu.wired_limit_mb, permite técnicamente elevar ese límite. Sin embargo, no es un ajuste documentado oficialmente por Apple: es una práctica conocida en la comunidad técnica, sin soporte oficial, que podría cambiar o dejar de funcionar con una próxima actualización de macOS.

Aumentar el límite de memoria de la GPU (no oficial, bajo tu responsabilidad)
sudo sysctl iogpu.wired_limit_mb=26624

El valor está en megabytes y debe ser inferior a la memoria física: calcula la RAM total menos entre 6 y 8 GB para macOS. El ejemplo anterior está pensado para un Mac de 32 GB (26 624 MB, es decir, 26 GB para la GPU); en un Mac de 64 GB, un valor de 57 344 MB deja el mismo margen. Las notas que circulan con 122 880 MB están pensadas para una máquina de 128 GB: si se copiara ese valor tal cual en un M1 o un M2 de 32 GB, superaría la memoria instalada.

i
A tener en cuenta
Este ajuste vuelve al valor predeterminado tras reiniciar, salvo que se configure manualmente para que persista, y Apple no garantiza la estabilidad de esta configuración. Debe reservarse a usuarios dispuestos a supervisar la presión de memoria del sistema y a deshacer el cambio en caso de inestabilidad.

#Modo reflexión: un costo de memoria indirecto

Qwen3-32B ofrece un mecanismo para alternar entre un modo de reflexión, que genera un razonamiento interno antes de la respuesta final, y un modo directo. La elección se hace mediante el parámetro enable_thinking o las etiquetas /think y /no_think, según la herramienta utilizada. En una máquina al límite de su memoria, el modo de reflexión tiene un efecto indirecto pero real: cada token de razonamiento generado antes de la respuesta final se añade al contexto de la conversación en curso y, por tanto, a la caché KV, que crece con ella. En un Mac con 24-32 GB, desactivar el modo de reflexión para las preguntas sencillas limita el crecimiento del contexto y reduce el riesgo de saturación de memoria en sesiones largas.

→
Objección: «el modo reflexión mejora la calidad, ¿por qué desactivarlo?»
No se trata de desactivarlo sistemáticamente, sino de activarlo cuando la tarea lo requiera (razonamiento en múltiples pasos, cálculos, código complejo) y de mantener el modo directo para intercambios cortos, donde el beneficio en calidad es marginal frente al costo en tokens y en memoria.

#Errores de swap y signos de saturación

El síntoma más claro de una memoria insuficiente no es un mensaje de error explícito, sino una ralentización brusca: todo el sistema se vuelve lento, no solo el modelo, porque macOS empieza a escribir en el espacio de intercambio del SSD. En el Monitor de Actividad, el indicador de presión de memoria que cambia a naranja o rojo durante la carga del modelo es la señal que debes vigilar incluso antes de esperar la primera respuesta.

Presión de memoria naranja/roja al cargar
Reducir el tamaño del contexto solicitado, o pasar a una cuantización más ligera si está disponible.
El modelo se carga pero la primera respuesta tarda varios minutos
Señal de swap activo: cerrar las aplicaciones que consumen mucha memoria antes de volver a ejecutar el modelo.
Fallo inmediato de carga
La memoria unificada total de la máquina probablemente sea insuficiente para un modelo de este tamaño, incluso teniendo en cuenta la cuantización.

En la línea de comandos, vm_stat (número de páginas enviadas al espacio de intercambio, « Pageouts ») o memory_pressure -Q ofrecen un diagnóstico más preciso que el indicador visual del Monitor de Actividad por sí solo, útil para confirmar que una ralentización se debe realmente a una saturación de memoria y no a otro cuello de botella (disco lleno, reducción de la velocidad por temperatura durante un uso prolongado). Un número de pageouts que aumenta mientras el modelo genera es la señal más fiable de que la memoria unificada es insuficiente para la configuración actual, incluido el contexto.

#Contexto largo: el verdadero costo de memoria

El contexto nativo de 32.768 tokens de Qwen3-32B, ampliable a 131.072 mediante YaRN, tiene un costo en memoria: cada token de contexto realmente utilizado alimenta una caché (caché KV) que crece con la conversación. En una máquina al límite (24 a 32 GB), priorizar un contexto moderado (8.000 a 16.000 tokens) deja un margen de seguridad; reservar la ampliación a 131.072 tokens para las máquinas con 64 GB o más de memoria unificada, donde el margen tras cargar el modelo sigue siendo holgado.

#Ajustes recomendados según el modo

La elección de los parámetros de muestreo tiene consecuencias en una máquina con memoria limitada: un ajuste inadecuado puede alargar innecesariamente las respuestas y, por tanto, el contexto y la caché KV. Qwen publica ajustes distintos según el modo activo, que debes especificar explícitamente en tu cliente MLX o en los parámetros de generación de Ollama en lugar de mantener los valores predeterminados genéricos de otro modelo.

Ajustes de generación recomendados por Qwen según el modo
ParámetroModo reflexión (enable_thinking=True)Modo directo (enable_thinking=False)
Temperature0,60,7
Top P0,950,8
Top K2020
Min P00

Qwen también recomienda prever una longitud de salida de hasta 32 768 tokens para la mayoría de las consultas complejas y ajustar presence_penalty entre 0 y 2 para limitar las repeticiones si aparecen, teniendo en cuenta que un valor demasiado alto puede provocar una mezcla de idiomas en la respuesta. En un Mac con poca memoria disponible, una longitud de salida máxima tan alta debe quedar en el plano teórico: en la práctica, detener la generación en cuanto la respuesta resuelva la pregunta evita que la caché KV crezca innecesariamente.

Preguntas frecuentes
¿Puede un Mac M1 con 8 GB ejecutar Qwen3 32B?+
No. La versión de 4 bits del modelo ya ocupa 18,4 GB, más que la memoria total de un Mac de 8 o 16 GB, incluso antes de contar el sistema y el contexto. Se necesita como mínimo una configuración con 24-32 GB de memoria unificada, idealmente con un chip Pro, Max o Ultra y 32 GB o más para un uso cómodo.
¿Hay que elegir MLX u Ollama para Qwen3 32B en Mac?+
Ambos funcionan con tamaños de archivo comparables (alrededor de 18-20 GB en 4 bits). MLX está diseñado nativamente para la arquitectura de memoria unificada de Apple Silicon; Ollama/llama.cpp ofrece una mayor facilidad de uso si ya lo utilizas en otras máquinas. La elección no cambia la memoria mínima necesaria, solo el entorno de herramientas alrededor del modelo.
¿Es seguro el ajuste iogpu.wired_limit_mb?+
No es un ajuste documentado oficialmente por Apple: funciona en la práctica y está descrito por la comunidad técnica, pero sigue sin contar con soporte oficial, vuelve a su valor predeterminado tras reiniciar y puede cambiar con una futura actualización de macOS. Utilizarlo vigilando el indicador de presión de memoria del Monitor de Actividad y estando preparado para revertir el cambio.
¿Qué contexto usar en una máquina de 32 GB?+
Un contexto moderado, entre 8.000 y 16.000 tokens, deja un margen de seguridad suficiente tras cargar el modelo de 4 bits (18,4 GB) y tener en cuenta la memoria que ocupa el sistema. Reservar el contexto ampliado a 131.072 tokens mediante YaRN para máquinas con 64 GB o más, donde la caché KV dispone de suficiente margen para crecer sin saturarse.
¿Qué ajustes de generación usar para Qwen3-32B?+
Qwen recomienda temperature=0.6, top_p=0.95, top_k=20 en modo reflexión, y temperature=0.7, top_p=0.8, top_k=20 en modo directo, con min_p=0 en ambos casos. Estos valores equilibran la calidad y la longitud de la respuesta; en un Mac con memoria limitada, también evitan una generación innecesariamente larga que haría crecer la caché KV.
¿Por qué el modo de reflexión consume más memoria?+
El modo de reflexión genera un razonamiento interno antes de la respuesta final, y cada token de este razonamiento se añade al contexto de la conversación actual y, por tanto, a la caché KV, que crece con ella. En un Mac de 24-32 GB, desactivarlo para preguntas simples limita este crecimiento y reduce el riesgo de saturación en sesiones largas.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.