Intermedio 14 minApple

MacBook Pro M5 Max 128 GB: las verdaderas mediciones en IA local (benchmark 2026)

Un MacBook Pro M5 Max con 40 núcleos de GPU y 128 GB de memoria unificada, un protocolo escrito de antemano, seis modelos y un documento de 16 689 tokens: estas son las primeras mediciones públicas en francés sobre el portátil más potente de Apple para IA local. Las mediciones las realizó Joël Ramat, consultor en ciberseguridad y GRC, en su propia máquina, a petición nuestra y siguiendo nuestro protocolo. Todas las cifras son los datos brutos de salida de Ollama, sin retoques.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-16·Probado en macOS 14+
Hardware recomendado

El MacBook Pro M5 Max disponible hoy: MacBook Pro M5 Max — 36 GB / 2 TB.

¿Por qué esta elección? Nuestra ficha completa sobre MacBook Pro M5 Max — 36 GB / 2 TB →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

MacBook Pro abierto en un escritorio oscuro, terminal mostrando una generación de texto en curso
Ilustración. La máquina probada es un MacBook Pro M5 Max 128 GB de serie, sin ningún ajuste de sistema modificado.
i
Por qué existe esta guía
El M5 Max 128 GB es la única configuración de alto nivel en nuestro configurador en la que no pudimos obtener ningún dato de primera mano. Joël Ramat, lector del kit Mac y propietario de la máquina, propuso realizar las mediciones. Elaboramos el protocolo, lo ejecutó el 16 de septiembre de 2026, y publicamos aquí los resultados acreditándolo como autor de las mediciones.

#La máquina y el protocolo

Hoja de especificaciones de la máquina: procesador M5 Max, 40 núcleos GPU, 18 núcleos CPU, 614 GB/s, 128 GB de memoria unificada, macOS 27.0, Ollama 0.34.1
La configuración exacta, registrada por script antes de la primera medición. El número de núcleos de GPU es el punto decisivo: solo la variante de 40 núcleos alcanza 614 GB/s.

El equipo es un MacBook Pro de 16 pulgadas con el chip M5 Max completo: 18 núcleos de CPU, 40 núcleos de GPU y 128 GB de memoria unificada con un ancho de banda anunciado de 614 GB/s. Ejecuta macOS 27.0 con Ollama 0.34.1. No se ha modificado ningún parámetro del sistema: el límite de memoria de la GPU es el predeterminado, un dato importante para comparar con tu propio Mac.

El protocolo consta de cuatro reglas, y no son decorativas. Mac conectado a la red eléctrica, porque macOS limita el rendimiento del chip cuando funciona con batería. Aplicaciones pesadas cerradas. Solo un modelo cargado a la vez. Y, sobre todo, el mismo prompt para todas las series, el que hace que las cifras sean comparables entre modelos y, mañana, entre máquinas.

Prompt común a todas las series
Explique en 300 mots la différence entre la mémoire unifiée d'un Mac et la VRAM d'un GPU dédié, pour un lecteur non technique.
Serie A, los dos puntos de referencia
Gemma 4 12B y Qwen 3.8 27B en GGUF, dos modelos que también funcionan en Macs mucho más modestos. Colocan la máquina en una escala conocida.
Serie B, MLX contra GGUF
El mismo Qwen 3.8 27B, mismo peso, servido por el motor MLX de Ollama en lugar de llama.cpp. Solo cambia el motor.
Serie C, lo que realmente importa al pasar a 128 GB
gpt-oss 120B, 65 GB, un modelo que simplemente no cabe en un PC portátil.
Serie D, el prefill en carga real
Un documento de 16 689 tokens enviado en un solo bloque a gpt-oss 120B, con una instrucción de síntesis. Es el único registro de prelleno significativo de la campaña.
Dos extras fuera del protocolo
Joël ya tenía Qwen 3.6 35B-A3B en MLX y gpt-oss 20B en su máquina. Los midió bajo las mismas condiciones.
→
Lo que medimos y lo que no debemos confundir
Ollama muestra dos velocidades. El prefill (prompt eval rate) es la velocidad a la que el modelo lee tu prompt antes de responder: determina la espera hasta la primera palabra. La generación (eval rate) es la producción de la respuesta, token a token: determina la sensación de fluidez. Un modelo puede ser rápido en una y lento en la otra.

#Todos los números en una tabla

El kit Mac

La IA local en tu Mac, a fondo: memoria unificada, MLX vs GGUF, el modelo adecuado para tu chip, Ollama y LM Studio configurados para Apple Silicon.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Aquí están las salidas sin procesar del comando ollama run --verbose, tal como Joël las copió después de cada medición. Cada modelo produjo una respuesta completa al prompt de 300 palabras, en modo de razonamiento cuando el modelo dispone de él, lo que explica los 1.400 a 3.200 tokens generados para 300 palabras de texto final.

M5 Max 40 GPU · 128 GB · Ollama 0.34.1 · conectado a la corriente · dos ejecuciones por modelo, se conserva la segunda · 16/09/2026
ModeloMotorTamaño del modeloGeneraciónTokens generadosDuración total
Gemma 4 12BGGUF Q47,6 GB58,1 tok/s1 39024 s
Qwen 3.8 27BGGUF Q417 GB36,6 tok/s2 51769 s
Qwen 3.8 27BMLX18 GB68,0 tok/s2 10331 s
Qwen 3.6 35B-A3B (bonus)MLX23 GB167,2 tok/s3 20519 s
gpt-oss 20B (bonus)MXFP413 GB113,4 tok/s2 19919 s
gpt-oss 120BMXFP465 GB79,1 tok/s6698,5 s
gpt-oss 120B, repetición 1MXFP465 GB77,5 tok/s73212,5 s
gpt-oss 120B, reinicia 2MXFP465 GB75,5 tok/s1 70722,7 s
gpt-oss 120B, serie DMXFP465 GB67,6 tok/s2 58450 s
Prefill: solo la medición de la serie D es significativa (ver la sección Limitaciones)
SerieTokens de promptPrefillTiempo hasta la primera palabra
A, B, C (prompt corto)43 à 9831 a 346 tok/s0,1 a 0,9 s: latencia de inicio, no una tasa de generación
D, documento de 16 689 tokens16 6891 388 tok/s12,0 s
!
Por qué no se comentan los prefills de los prompts cortos
Cada modelo se ha medido dos veces y solo se conserva la segunda pasada, conforme al protocolo: por tanto, la carga del modelo y la compilación de los shaders Metal quedan fuera de la medición. Pero con un prompt de 43 a 98 tokens, el prefill se completa en menos de un segundo: la cifra refleja una latencia fija de arranque, no una tasa de procesamiento de los tokens de entrada. Se necesitan miles de tokens para que esa tasa pase a ser el factor dominante, y ese es precisamente el objeto de la serie D.

#Generación: seis modelos, una lectura

Gráfico en barras de la velocidad de generación: Qwen 3.6 35B-A3B 167 tokens por segundo, gpt-oss 20B 113, gpt-oss 120B 79, Qwen 3.8 27B MLX 68, Gemma 4 12B 58, Qwen 3.8 27B GGUF 37
Generación en tokens por segundo. En naranja los modelos MoE, que activan solo entre 3 y 5 mil millones de parámetros por token; en azul los modelos densos.

Si se interpreta de forma ingenua, esta clasificación es absurda: un modelo de 120 mil millones de parámetros a 79 tokens por segundo, dos veces más rápido que un 27B en GGUF. La explicación se reduce a tres letras. gpt-oss 120B, gpt-oss 20B y Qwen 3.6 35B-A3B son modelos de mezcla de expertos, MoE. Para cada token, solo una fracción de los parámetros se activa: aproximadamente 5 mil millones para gpt-oss 120B, 3,6 mil millones para gpt-oss 20B y 3 mil millones para el Qwen. La velocidad de generación depende de lo que se mueve en memoria en cada token, no de lo que está en reposo.

Los modelos densos, Gemma 4 12B y Qwen 3.8 27B, utilizan todos sus parámetros en cada token. Su velocidad viene determinada, por tanto, por el ancho de banda de la memoria dividido por el tamaño del modelo: es la regla de los Mac desde el M1, y el M5 Max tampoco escapa a ella. En esta máquina, un modelo denso de 27B en GGUF funciona a 37 tokens por segundo, y uno de 12B, a 58.

167 tok/s en Qwen 3.6 35B-A3B con MLX
La cifra más alta de la campaña, obtenida con el modelo que combina los dos aceleradores: arquitectura MoE y motor MLX. Es la velocidad de un pequeño 8B, con los conocimientos de un 35B.
113 tok/s con gpt-oss 20B
La mejor relación entre velocidad, calidad y peso para un uso diario de tipo asistente: 13 GB, una respuesta de 2.200 tokens en 19 segundos.
79 tok/s en gpt-oss 120B
El modelo más capaz de la lista, al doble de la velocidad de lectura humana. Este es el resultado que justifica el nivel de 128 GB; volveremos sobre él más abajo.
58 y 37 tok/s en modelos densos
Gemma 4 12B y Qwen 3.8 27B en GGUF: funcionan con holgura, pero sin sorpresas. Las cifras son del mismo orden de magnitud que en un M4 Max, ya que el ancho de banda ha cambiado poco entre las dos generaciones.
i
Por qué el 27B denso es más lento que el 120B MoE
Qwen 3.8 27B debe mover 17 GB de pesos por token generado. gpt-oss 120B mueve unos 3 GB, correspondientes a los expertos activados, aunque los 65 GB deben caber en memoria. A 614 GB/s, el primero queda limitado por esa velocidad a unos 36 tokens por segundo, y eso es exactamente lo que mide Joël. El segundo tiene margen.

#MLX frente a GGUF, en igualdad de condiciones

Comparación de dos barras: Qwen 3.8 27B a 36,6 tokens por segundo en GGUF y 68 tokens por segundo en MLX, lo que representa un aumento del 86 por ciento
Mismo modelo, mismo peso con un margen de un gigabyte; solo cambia el motor. La diferencia medida es del 86 %.

Todos dicen que MLX, la biblioteca de Apple optimizada para Apple Silicon, es más rápida que llama.cpp. Muy pocos lo comprueban mediante mediciones en condiciones estrictamente iguales, con el mismo modelo, el mismo día y en la misma máquina. Eso es lo que hace la serie B: Qwen 3.8 27B en GGUF Q4 a 36,6 tokens por segundo, luego Qwen 3.8 27B en MLX a 68,0 tokens por segundo. Un 86 % más.

Nuestra guía sobre MLX y el Mac M5 anunciaba una mejora del 30 al 40 % en generación. En el M5 Max y con este modelo, la realidad es más del doble. Parte de la diferencia se debe probablemente a las optimizaciones de MLX específicas de la generación M5 y a los aceleradores neuronales integrados en la GPU; aún no podemos aislar su contribución. Lo que sí podemos decir es que, en un Mac reciente, ejecutar un modelo denso en GGUF cuando existe su versión MLX equivale a dejar la mitad de la máquina en el garaje.

Cambiar un modelo al motor MLX
ollama pull qwen3.8:27b-mlx
ollama run qwen3.8:27b-mlx --verbose
→
El hábito que conviene adquirir
Antes de descargar un modelo, verifica si existe una etiqueta -mlx en la biblioteca de Ollama. Para un modelo denso de 20 GB o más, la diferencia se ve a simple vista. La guía sobre MLX y llama.cpp explica cómo se elige el motor y qué hacer cuando falta una etiqueta MLX.

#Lo que realmente te ofrecen 128 GB

Esquema: a la izquierda, la memoria unificada, un mismo espacio de 128 GB compartido entre CPU y GPU donde cabe el modelo de IA de 65 GB; a la derecha, la memoria dedicada, donde los 65 GB no caben en 16 GB de VRAM
Esquema general. La memoria unificada pone todo el pool de 128 GB a disposición del GPU. En un portátil, una tarjeta gráfica de 16 GB no puede cargar un modelo de 65 GB, independientemente de la RAM del sistema.

Lo que realmente importa en el nivel de 128 GB no es la velocidad, sino qué modelos caben. gpt-oss 120B ocupa 65 GB en MXFP4. Ningún PC portátil lo ejecuta en GPU: las tarjetas gráficas para portátiles tienen un límite de 16 o 24 GB de VRAM. En el M5 Max de 128 GB, se carga, responde a una velocidad de entre 75 y 79 tokens por segundo en tres ejecuciones y aún queda espacio.

Barra apilada de los 128 GB: 35 GB para macOS y las aplicaciones abiertas, 65 GB para gpt-oss 120B, 28 GB libres
Distribución de la memoria durante la serie C, a grandes rasgos. Joël no cerró nada: Obsidian, Terminal y el resto de su sesión estaban abiertos.

La medición de memoria realizada antes de la campaña es reveladora: 35 GB ocupados por macOS y las aplicaciones de la sesión de trabajo, 93 GB disponibles para la IA. El 120B cabe con un margen de unos treinta gigabytes, suficiente para mantener un contexto largo y un segundo modelo ligero en paralelo, por ejemplo un 8B para el autocompletado de código. En un M5 Max de 64 GB, el mismo modelo no se carga en absoluto; con 96 GB cabe, pero sin margen para el resto.

8,5 a 22,7 segundos
Duración total de la respuesta de gpt-oss 120B al prompt de 300 palabras, en tres ejecuciones: 669, 732 y luego 1.707 tokens generados. La velocidad no cambia (79,1; 77,5 y 75,5 tokens por segundo); lo que varía de una ejecución a otra es la longitud del razonamiento, según si el modelo decide contar sus palabras una por una o no.
50 segundos
Duración de la serie D: lectura de un documento de 16.689 tokens y posterior redacción de una síntesis de 2.584 tokens en diez viñetas.
Presión térmica « Nominal »
Registro tras cada serie. No se oyó ningún ventilador durante toda la campaña de pruebas, incluido el modelo de 120B.
i
Lo que no pudimos medir en este nivel
No había instalado en la máquina ningún modelo denso de 70B en Q4, una configuración para la que nuestra ficha del MacBook Pro M5 Max estima entre 15 y 25 tokens por segundo en MLX. Esa cifra sigue siendo una estimación hasta la próxima campaña de mediciones.

#El prefill, el número que nadie publica

Cronología de una solicitud de 50 segundos: 12 segundos de lectura de un documento de 16 689 tokens a 1 388 tokens por segundo, seguidos de 38 segundos de respuesta
Serie D. El documento enviado es el informe de benchmark en sí, exportado en texto, seguido de una instrucción de síntesis.

Un prompt de veinte palabras no dice nada sobre el prefill. Para medirlo, Joël envió a gpt-oss 120B un texto de 11.280 palabras en un solo bloque, equivalente a 16.689 tokens y unas 45 páginas, con una instrucción para resumirlo. Resultado: 1.388 tokens por segundo en lectura, es decir, doce segundos antes de que apareciera la primera palabra de la respuesta, y después 2.584 tokens de síntesis a 67,6 tokens por segundo.

Es la cifra relevante para los usos profesionales exigentes. Analizar un contrato, resumir un informe de auditoría, consultar una base documental mediante RAG: en todos estos casos, el modelo pasa la mayor parte de su tiempo leyendo, no escribiendo. Doce segundos para 45 páginas, en un portátil, sin que un solo byte salga de la máquina: eso es lo que hace que la IA local sea utilizable para un consultor sujeto al secreto profesional o una empresa con obligaciones de confidencialidad.

→
Orden de magnitud para tus documentos
A 1 388 tokens por segundo, un contrato de 30 páginas se lee en 8 segundos, un informe de 100 páginas en 27 segundos. Estos tiempos se suman a la generación de la respuesta; por tanto, prevé aproximadamente un minuto para una síntesis completa de un documento largo en esta máquina.

#Calor y ventiladores

Joël anotó el estado térmico después de cada serie con el comando de presión térmica de macOS. Veredicto constante: «Nominal», sin ventiladores audibles, incluso durante la serie D, que pone la GPU a plena carga durante cincuenta segundos. Es coherente con lo que observamos en los M4 Max, con una salvedad: nuestras mediciones son ráfagas de menos de un minuto. La prueba de throttling prevista en el protocolo —diez minutos de carga continua y después una nueva medición de la serie A— no se ha realizado. La solicitaremos en la próxima campaña.

Verificar la presión térmica durante una generación
sudo powermetrics --samplers thermal -i 1000 -n 1 | grep -i pressure

#Lo que estas medidas no dicen

Un benchmark honesto lista lo que no demuestra. A continuación, las reservas en orden de importancia.

Procesamiento inicial de prompts cortos (prefill)
Dos ejecuciones por modelo; se conserva la segunda. Pero los prompts de 43 a 98 tokens solo permiten medir la latencia de inicio: únicamente la serie D, con 16 689 tokens, proporciona una tasa de lectura real.
Ningún modelo denso de 70 mil millones
El nivel de 128 GB también se justifica con los 70B en Q4 con un contexto largo. No medido aquí.
Sin prueba de throttling
Ráfagas de menos de un minuto. El comportamiento durante una hora de RAG intensivo aún queda por documentar.
Sin mediciones con batería
El protocolo exige conectar el equipo a la corriente. Con batería, espera cifras sensiblemente inferiores, ya que macOS limita el rendimiento del chip.
Un documento de la serie D específico de cada evaluador
El texto largo enviado en la serie D no viene fijado por el protocolo: dos evaluadores no leen el mismo documento, lo que limita la comparación del prefill entre máquinas. A sugerencia de Joël, el protocolo proporciona ahora un único texto de referencia de 11 292 palabras, que se puede descargar en la siguiente sección: las próximas mediciones serán comparables entre sí. La medición de esta página se realizó antes, con otro documento de tamaño equivalente.
Una sola máquina, un solo operador
No se ha medido la varianza. Si tienes la misma configuración, tus mediciones son bienvenidas; consulta la sección siguiente.
Modelos en modo razonamiento
Los modelos que piensan antes de responder generan muchos más tokens que las 300 palabras solicitadas, y esta longitud varía de una ejecución a otra para el mismo modelo (669 a 1.707 tokens en gpt-oss 120B). Por tanto, los tiempos totales no son comparables, solo las velocidades lo son.
Caché de prompts al volver a ejecutarlos
Cuando se vuelve a ejecutar el mismo prompt, Ollama reutiliza los tokens ya leídos (« prompt eval cached »). Por tanto, el prefill de una ejecución idéntica no sirve como medición; para medir el prefill, hace falta un prompt largo y nuevo, como en la serie D.

#Reproducir el benchmark en tu propio entorno

Portátil visto desde arriba sobre un escritorio blanco, cronómetro mecánico, cargador conectado, cuaderno y bolígrafo
Ilustración. Equipo conectado a la corriente, aplicaciones cerradas, un modelo a la vez: tres condiciones sin las cuales una medición no vale nada.

El protocolo está diseñado para reproducirse tal cual en cualquier Mac con Apple Silicon, desde el MacBook Air hasta el Mac Studio. Si sigues las mismas series con el mismo prompt, tus cifras son directamente comparables con las de esta página.

  1. 01
    Preparar la máquina
    Conecta el equipo a la corriente, cierra el navegador, Docker y las máquinas virtuales. Anota el modelo de tu chip, el número de núcleos GPU y la versión de Ollama.
  2. 02
    Registrar el estado del sistema
    Anota el chip, el número de núcleos de GPU, las versiones de macOS y de Ollama, la alimentación eléctrica, la memoria disponible y las aplicaciones abiertas. Joël ha escrito un script zsh que genera este informe con un solo comando; se añadirá al capítulo de benchmarks del kit Mac tras su verificación, con su autorización.
  3. 03
    Serie A
    Descarga gemma4:12b y qwen3.8:27b, ejecuta cada uno con --verbose, pega el prompt común, deja que la respuesta termine y sal con /bye. Haz dos pasadas y conserva la segunda.
  4. 04
    Serie B
    Haz lo mismo con qwen3.8:27b-mlx. Compara la línea eval rate con la de la serie A.
  5. 05
    Serie C
    Si tienes 96 GB o más: gpt-oss:120b. De lo contrario, elige el modelo más grande que quepa en tu memoria unificada dejando 10 GB libres.
  6. 06
    Serie D
    Descarga el texto de referencia de QuelLLM, de 11 292 palabras, el mismo para todos, y pásalo a ollama run seguido de la instrucción « Resume este texto en 10 viñetas ». Anota el número de tokens del prompt que se muestra: depende del modelo, no del texto.
Los comandos del protocolo
# Série A — les deux repères
ollama pull gemma4:12b && ollama pull qwen3.8:27b
ollama run gemma4:12b --verbose
ollama run qwen3.8:27b --verbose

# Série B — même modèle, moteur MLX
ollama pull qwen3.8:27b-mlx
ollama run qwen3.8:27b-mlx --verbose

# Série C — le palier 128 Go (65 Go à télécharger)
ollama pull gpt-oss:120b
ollama run gpt-oss:120b --verbose

# Série D — préfill sur le texte de référence commun (11 292 mots)
curl -sO https://quelllm.fr/img/protocole/texte-reference-quelllm-v1.txt
ollama run gpt-oss:120b --verbose "$(cat texte-reference-quelllm-v1.txt) Résume ce texte en 10 puces."
→
Envíanos tus registros
Pega el bloque de estadísticas sin procesar de cada medición en un correo electrónico a [email protected], con tu chip, tus núcleos GPU y tu versión de Ollama. Publicamos las mediciones verificadas con tu nombre o de forma anónima si lo prefieres. Las configuraciones que más nos faltan: M5 Max 64 GB, M5 Pro, Mac Studio M5 Ultra.

#Para quién, y a qué precio

El M5 Max de 128 GB se justifica por un único uso: ejecutar localmente modelos que no caben en ningún otro portátil, con margen para el contexto y un segundo modelo. Con gpt-oss 120B a 79 tokens por segundo y un documento de 45 páginas leído en doce segundos, sin ventilador, es una estación de trabajo de IA que cabe en una bolsa.

Lectura de los resultados por perfil de uso
Tú eresLo que te dice este benchmarkNivel recomendado
Consultor, abogado o experto contable sujeto al secreto profesionalUn 120B lee y sintetiza tus documentos en local, a una velocidad que permite trabajar con él, sin enviar nada al exteriorM5 Max 128 GB
Desarrollador que quiere un copiloto local seriogpt-oss 20B o Qwen 3.6 35B-A3B son más que suficientes y caben en 48 GB. Nuestros 113 y 167 tok/s corresponden al chip con 40 núcleos de GPU: la memoria es suficiente, pero la velocidad será inferior en una variante con menor ancho de bandaM5 Max 48 o 64 GB
Usuario que utiliza a diario un asistente de redacciónUn 12B denso o un MoE 20B cubren este uso; la configuración de 128 GB es un lujo. La memoria es suficiente, pero la del M5 Pro es más lenta: prevé velocidades inferiores a nuestros 58 y 113 tok/s.M5 Pro 48 GB
Equipo que quiere un servidor compartidoEl Mac Studio M5 Max o Ultra ofrece el mismo motor con más memoria y una refrigeración propia de un equipo de sobremesaMac Studio
!
Estas velocidades corresponden a este chip
Todas las cifras de esta página se han medido en un M5 Max con 40 núcleos GPU y 614 GB/s de ancho de banda de memoria. La generación de un LLM está limitada por este ancho de banda: en un M5 Max con 32 núcleos GPU o en un M5 Pro, cuya memoria es más lenta, los mismos modelos cabrán en memoria, pero funcionarán más despacio. La tabla anterior indica qué cabe, no la velocidad que obtendrás en otra gama.

Si tus necesidades se limitan a modelos de hasta 30 mil millones de parámetros, basta con la mitad de la memoria y la diferencia de precio permite comprar una pantalla muy buena. Si tus necesidades empiezan en los modelos de 100 mil millones, no existe una alternativa portátil, y esta guía te da las cifras para justificarlo ante quien firma la orden de compra.

#Créditos y fuentes

Consultor trabajando de noche en un portátil que muestra un terminal, con una lámpara de escritorio y un cuaderno
Ilustración. Una sesión de trabajo habitual, aplicaciones abiertas: es en estas condiciones donde se realizaron las mediciones, en la máquina de trabajo de su autor.

Las mediciones de esta página fueron realizadas por Joël Ramat, consultor en ciberseguridad y GRC, experto en ISO 27001, que realiza consultoría y auditoría potenciadas por IA on-premise, cofundador y presidente de Sywédgia SAS. Ejecutó el protocolo QuelLLM en su propia máquina el 16 de septiembre de 2026 y revisó este artículo antes de su publicación. Los registros siguen siendo suyos y él es libre de publicarlos por su cuenta.

Método: salidas sin procesar de ollama run --verbose copiadas después de cada medición, sin modificaciones; estado del sistema registrado mediante un script antes de la campaña de mediciones; presión térmica registrada después de cada serie. El informe completo, con las respuestas íntegras de los modelos, se conserva y puede facilitarse previa solicitud. Redacción y formato: Mohamed Meguedmi, QuelLLM.fr.


#FAQ

¿El M5 Max de 128 GB es más rápido que el M4 Max de 128 GB en IA local?+
No de forma espectacular en los modelos densos en GGUF: el ancho de banda de la memoria ha cambiado poco y Qwen 3.8 27B funciona a 37 tokens por segundo, un orden de magnitud comparable al M4 Max. La diferencia se amplía con MLX, donde el M5 Max registra 68 tokens por segundo con el mismo modelo. No tenemos mediciones del M4 Max en MLX bajo las mismas condiciones para calcular la diferencia exacta.
¿Por qué gpt-oss 120B es más rápido que Qwen 3.8 27B?+
Porque gpt-oss 120B es un modelo MoE que activa solo alrededor de 5 mil millones de parámetros por token, mientras que Qwen 3.8 27B, denso, mueve 27 mil millones por cada token. La velocidad depende de los parámetros activos, no de los totales. En cambio, los 65 GB del 120B deben caber en memoria, lo que solo permite el nivel de 96 o 128 GB.
¿Se necesitan 128 GB para ejecutar gpt-oss 120B?+
Se necesitan al menos 96 GB de memoria unificada para cargarlo con un contexto razonable. Los 128 GB proporcionan margen para un contexto largo, un segundo modelo ligero y una sesión de trabajo normal abierta al mismo tiempo. Joël ejecutaba el 120B con 35 GB ya ocupados por sus aplicaciones.
¿Estas cifras también se mantienen cuando funciona con batería?+
No. El protocolo exige conectar el equipo a la red eléctrica porque macOS limita el rendimiento del chip cuando funciona con batería. Espera velocidades claramente inferiores cuando lo uses fuera de casa y, sobre todo, mediciones no reproducibles.
¿Por qué no se publican los prefills de las series A, B y C?+
Se midieron en prompts de 43 a 98 tokens. Con este tamaño, el prefill dura menos de un segundo y refleja una latencia de inicio, no una tasa de lectura; la cifra no dice nada sobre la velocidad con la que el modelo lee un documento real. El único prefill útil es el de la serie D, con 16 689 tokens: 1 388 tokens por segundo.
¿Puedo enviar mis propias mediciones?+
Sí. Sigue las series A a D con el prompt común, dos pasadas por medida, y envía los bloques de estadísticas brutas a [email protected] con tu configuración. Publicamos las mediciones verificadas dándote crédito.
¿Dónde encontrar el script de preparación utilizado para este benchmark?+
El script zsh escrito por Joël Ramat, que genera un informe completo del estado del Mac antes de la medición, se añadirá al capítulo de benchmarks del kit Mac una vez verificado en otras máquinas, con su autorización y el reconocimiento de su autoría. Mientras tanto, la sección «Reproducir el benchmark» enumera los datos que hay que anotar a mano.

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.