Benchmark de LLM locales: MMLU, HumanEval, AIME 2026

Un benchmark de LLM locales interpretado al margen de su metodología equivale a comparar dos tiempos de maratón sin el perfil altimétrico del recorrido. Dos modelos anunciados con 88 puntos en MMLU pueden diferir en 16 puntos en MMLU-Pro y en 30 puntos en AIME 2026 según la presencia de un entrenamiento chain-of-thought, el formato de cuantización, el protocolo de decodificación (cons@64 vs pass@1 estricto) y la versión exacta del conjunto de datos cargado. Esta página no es una guía de compra: es una matriz de auditoría de las tres suites históricas (MMLU/MMLU-Pro, HumanEval/HumanEval+, AIME 2024/2025/2026), con puntuaciones publicadas, condiciones de reproducibilidad, consumo de VRAM en Q4 medido, tasas de tokens por segundo en configuraciones reales e inventario de los sesgos que los comunicados de los proveedores omiten. El objetivo es proporcionar herramientas para reproducir una cifra por ti mismo con una semilla fija, no decidir entre modelos propietarios y modelos de pesos abiertos.

¿Por qué el marco de análisis de 2026 invalida los benchmarks anteriores a 2024?

El ecosistema ha cambiado en dos años. MMLU con 4 opciones ya alcanzaba la saturación con Llama 3.1 405B a 88,6, y las arquitecturas con activación de expertos (DeepSeek V3, Qwen 3, GLM-5.1) ya rozan el techo; interpretar una puntuación MMLU con una precisión de medio punto ha dejado de aportar información. Tres cambios estructurales han reconfigurado la matriz:

  1. Modelos de razonamiento entrenados con RL (DeepSeek R1, Ring-1T, gpt-oss 120B con el modo de razonamiento activable) que convierten AIME y MATH-500 en pruebas de primer nivel para diferenciar modelos. En AIME 2024, la diferencia entre Llama 3.1 405B (~23 pass@1) y DeepSeek R1 671B (~79 pass@1) alcanza 55 puntos — una diferencia imposible de observar en MMLU.
  2. Conteo de parámetros totales vs parámetros activos. Qwen 3 235B-A22B activa solo 22B parámetros por token, MiniMax-M2.7 sigue la misma lógica MoE. El benchmark debe interpretarse con un coste de inferencia equivalente (tokens/segundo × VRAM), no según el número total de parámetros mostrados.
  3. Baterías de pruebas anticontaminación. LiveBench renueva sus ítems cada mes, LiveCodeBench asigna marcas de tiempo a los problemas de Codeforces para aislar los posteriores a la fecha de corte del preentrenamiento, y SimpleBench mide la robustez del sentido común allí donde MMLU alcanza su techo. La HuggingFace Open LLM Leaderboard v2 ha migrado explícitamente a MMLU-Pro, GPQA, MUSR e IFEval por esta razón.

Leer un resultado aislado ya no aporta información: solo la matriz {MMLU-Pro, HumanEval+, AIME 2026, SWE-bench Verified, RULER 128k, GPQA Diamond} aporta señal. La guía /guide/matrice-benchmarks-2026 explica la ponderación recomendada.

Metodología: lo que mide realmente cada suite

Le MMLU LLM (Massive Multitask Language Understanding, Hendrycks et al. 2021) cubre 57 disciplinas (medicina, derecho, ética, matemáticas elementales) mediante preguntas de opción múltiple con 4 opciones, con el protocolo 5-shot estándar. Repositorio de referencia: GitHub Hendrycks, artículo arXiv:2009.03300. Por encima del 85 %, ha sido sustituido por MMLU-Pro (10 opciones, razonamiento en múltiples etapas, 12 032 elementos) en HuggingFace TIGER-Lab, con una caída típica de 15 a 25 puntos respecto al MMLU clásico. Variante emergente: MMLU-Redux (documento arXiv:2406.04127) corrige aproximadamente un 6,5 % de los elementos del conjunto original identificados como erróneos o ambiguos — un punto que rara vez se destaca y que explica por qué dos ejecuciones idénticas pueden diferir entre 1 y 2 puntos según la versión cargada. Para los filtros y el procedimiento de evaluación, ver /guide/mmlu-pro-protocole-strict.

HumanEval, publicado por OpenAI (arXiv:2107.03374), evalúa 164 problemas de Python con firmas de funciones y pruebas unitarias. La métrica estándar es pass@1 mais pass@10 et pass@100 requieren respectivamente 10 y 100 muestras por problema, multiplicando el coste de evaluación por esos mismos factores. Su sucesor HumanEval+ (evalplus) añade aproximadamente 80 veces más casos de prueba generados por mutación; los modelos sobreentrenados suelen perder entre 5 y 10 puntos entre las dos versiones, lo que revela directamente el grado de sobreajuste a las pruebas originales. Para profundizar en el código real, SWE-bench Verified mide la resolución de incidencias reales de GitHub (500 tickets validados por personas) y LiveCodeBench mantiene un flujo de problemas de Codeforces con marcas de tiempo y filtrables por fecha. El procedimiento completo de extracción en HumanEval+ se describe en /guide/humaneval-plus-protocole.

AIME 2024 LLM corresponde a los 15 problemas anuales del American Invitational Mathematics Examination (dos sesiones, AIME I y II), con respuestas enteras entre 0 y 999. Se ha vuelto fundamental con los modelos de razonamiento y permite distinguir claramente entre arquitecturas con o sin cadena de pensamiento entrenada mediante RL. El conjunto de 2024 está referenciado en la ficha del modelo DeepSeek R1. AIME 2025 (marzo de 2025) y después AIME 2026 (febrero de 2026) sirven ahora como pruebas recientes porque los enunciados de 2024 se han indexado masivamente. Los informes técnicos de finales de 2025 suelen usar cons@64 (votación por mayoría sobre 64 muestras, temperatura 0.6, top-p 0.95), lo que puede inflar la puntuación bruta entre 10 y 15 puntos respecto a un pass@1 estricto a temperatura 0.

Además de estos tres pilares, la matriz de evaluación de 2026 añade GPQA Diamond (198 preguntas de nivel doctoral validadas por expertos), MATH-500 (problemas de olimpiadas), MuSR (razonamiento narrativo multietapa), RULER (recuperación de información en contextos largos de hasta 1M tokens), IFEval (seguimiento de instrucciones estrictas), BFCL v3 (Berkeley Function Calling Leaderboard) para la llamada estructurada a herramientas. Los informes técnicos serios publican ahora esta matriz completa en lugar de una puntuación MMLU aislada.

Puntuaciones publicadas: interpretación comparativa con hardware equivalente

Las cifras que aparecen a continuación proceden de las fichas técnicas oficiales o de los informes de HuggingFace. Aún falta reproducirlas mediante lm-evaluation-harness de EleutherAI, único protocolo independiente con autoridad en la comunidad open-source.

Nivel S — modelos de razonamiento de vanguardia (> 600B de parámetros) :

Nivel A — ejecutable en 1 a 4 GPUs de gama alta (100B a 400B) :

Nivel B — una sola estación de trabajo (40 a 80 GB de VRAM) :

Comparativos ajustados disponibles en /compare/deepseek-r1-distill-llama-70b-vs-llama33-70b et /compare/qwen3-235b-a22b-vs-llama-3-1-405b.

Costo de hardware detallado: VRAM, cuantizaciones, tasas de generación medidas

Una puntuación bruta no tiene valor sin el costo de inferencia asociado. Los valores a continuación corresponden al formato Q4_K_M de llama.cpp. Las conversiones a Q5_K_M, Q8_0 o FP16 multiplican la VRAM aproximadamente por 1,25, 2 y 4. La calculadora quelllm.fr/configurateur filtra por presupuesto de GPU.

Modelo VRAM Q4 Configuración objetivo Velocidad indicativa Q4
DeepSeek V4 Pro 1.6T ~960 GB 8×H200 141 GB, pod TPU v5p 15-20 tok/s tensor-parallel
MiMo V2.5 Pro 1020B ~595 GB 8×H100 80 GB tensor-parallel 20-30 tok/s
Mistral Large 3 675B ~405 GB 6×H100 80 GB o 4×H200 25-35 tok/s
Llama 3.1 405B ~240 GB 4×A100 80 GB o 3×H100 20-30 tok/s
Qwen 3 235B-A22B ~142 GB 2×H100 o 1×H200 141 GB 40-60 tok/s (MoE)
Hunyuan Large 2.0 ~245 GB 3×H100 80 GB 25-30 tok/s
gpt-oss 120B ~70 GB 1×H100, Mac Studio M3 Ultra 192 GB 35-50 tok/s
Mistral Small 4 119B ~72 GB 1×H100, A100 80 GB 30-45 tok/s
Llama 3.3 70B ~40 GB RTX A6000 48 GB, 2×RTX 4090 15-25 tok/s en 2×4090
DBRX Instruct 132B ~76 GB 1×H100, 2×A100 40 GB 30-40 tok/s

Las cifras son órdenes de magnitud con un único lote; los despliegues para múltiples clientes con vLLM o SGLang logran hasta 5 veces más rendimiento agregado mediante procesamiento continuo por lotes y caché de prefijos. En el Mac Studio M3 Ultra (ancho de banda de memoria de 800 GB/s), Llama 3.3 70B en Q4_K_M alcanza 8 a 12 tok/s en single-stream según la longitud efectiva del contexto. Las arquitecturas MoE (Mixtral 8x22B, Qwen 3, DeepSeek V3) se benefician especialmente de SGLang gracias al enrutamiento de expertos compartido en el procesamiento por lotes. La guía /guide/quantization-q4-q5-q8 detalla los compromisos entre calidad y VRAM, y /guide/inference-vllm-vs-llamacpp compara los motores en profundidad. Para evaluar el rendimiento de tu propia configuración, ver /guide/bench-tokens-par-seconde.

Tres sesgos que distorsionan la interpretación de los rankings

  1. Contaminación de los conjuntos de datos. MMLU y HumanEval circulan desde 2021; algunos modelos han visto las preguntas en el preentrenamiento, lo que infla artificialmente los puntajes. El trabajo LiveCodeBench propone un seguimiento temporal de los problemas de HumanEval para aislar los posteriores a la fecha de corte del preentrenamiento. La detección de contaminación mediante solapamiento de n-gramas (método arXiv:2311.04850) muestra que hasta un 12 % de los ítems MMLU aparecen textualmente en los corpus web indexados.
  2. Varianza de la decodificación. Una puntuación AIME pass@1 calculada con temperatura 0.6 y 64 muestras (cons@64, votación por mayoría) puede diferir en 10 puntos de un pass@1 estricto a temperatura 0. En GSM8K, la diferencia de self-consistency alcanza 5 a 8 puntos según el número de muestras. Siempre verificar temperature, top_p, max_tokens, número de muestras y regla de agregación en la ficha del modelo o en el informe técnico.
  3. Prompts específicos. Los informes de DeepSeek, Qwen y Mistral suelen usar prompts de sistema optimizados, a veces con ejemplos few-shot seleccionados manualmente. Reproducir las cifras en zero-shot sin ajustes suele dar entre 3 y 8 puntos menos, a veces más en las baterías de pruebas de razonamiento. Para AIME, añadir el prefijo "Let's think step by step" puede modificar la puntuación entre 4 y 6 puntos en modelos sin entrenamiento específico de razonamiento.

Los benchmarks orientados a tareas del usuario — LMArena (anteriormente Chatbot Arena), LiveBench, SWE-bench Verified — aportan un complemento menos susceptible de manipulación. SWE-bench sigue siendo la referencia para evaluar un modelo agéntico con código real: DeepSeek V3.2 et Qwen3-Coder-Next 80B-A3B obtienen allí puntuaciones superiores al 40 %, valores pendientes de confirmar en la clasificación actualizada. BFCL v3 añade la dimensión de las llamadas estructuradas a herramientas, útil para los despliegues de agentes.

Reproducir un benchmark de punta a punta: procedimiento típico

Para obtener una puntuación AIME 2026 defendible con, por ejemplo, DeepSeek R1 Distill Llama 70B :

  1. Descargar los pesos en HuggingFace (# HuggingFace : deepseek-ai/DeepSeek-R1-Distill-Llama-70B) y luego convertir a GGUF Q4_K_M mediante llama.cpp/convert_hf_to_gguf.py si tu objetivo es CPU/Apple, o seguir en safetensors para vLLM.
  2. Fijar los hiperparámetros : temperatura 0.6, top-p 0.95, max_tokens 32768 (el modelo debe razonar durante mucho tiempo), semilla guardada para reproductibilidad.
  3. Cargar el conjunto AIME 2026 desde un dataset actualizado de HuggingFace. Comprobar que el editor no haya incluido la solución en el prompt por error — defecto frecuente en los forks recientes.
  4. Generar 64 continuaciones por problema para cons@64, y 1 completación a temperatura 0 para pass@1 estricto.
  5. Extraer la respuesta final mediante una expresión regular aplicada a la etiqueta \boxed{} o la última secuencia de 1 a 3 dígitos. Manejar el caso en el que el modelo emita varias etiquetas <thinking> anidadas.
  6. Comparar con las soluciones oficiales AIME (entero 0-999), publicar script y semilla.

Prever aproximadamente entre 6 y 10 horas en 2×H100 para un modelo de 70B en cons@64 con los 15 problemas de AIME 2026. La guía /guide/reproduire-benchmark-aime detalla las dificultades de la extracción de respuestas, especialmente la gestión de las etiquetas <thinking> en los modelos de razonamiento y la normalización de las fracciones de salida.

Casos de estudio cuantificados: tres escenarios concretos

Escenario A — laboratorio universitario con 4×A100 80 GB para la evaluación del razonamiento matemático. Objetivo: producir una curva AIME 2024/2025/2026 reproducible. Una buena opción: DeepSeek R1 Distill Llama 70B en Q8_0 (140 GB, dos GPUs), en comparación con Llama 3.3 70B sin razonamiento en las dos GPU restantes para medir el aporte puro de la cadena de pensamiento. Coste de un ciclo completo cons@64 para los 45 problemas (AIME 2024 + 2025 + 2026): aproximadamente 30 horas de GPU. Ver /compare/deepseek-r1-distill-llama-70b-vs-llama33-70b.

Escenario B — startup con 1×H100 80 GB para evaluar el rendimiento de un asistente de código. Tres candidatos frente a frente: Qwen3-Coder-Next 80B-A3B, gpt-oss 120B et Mistral Small 4 119B. Protocolo: HumanEval+ pass@1, MBPP+ pass@1, LiveCodeBench filtrado para incluir problemas posteriores a octubre de 2024, SWE-bench Verified Lite (50 incidencias). La velocidad de generación de la arquitectura MoE de Qwen3-Coder-Next (3B activos) permite normalmente 3× más candidatos por hora que los modelos densos con una VRAM comparable, lo que reduce el interés de la cuantización agresiva.

Escenario C — equipo de datos con Mac Studio M3 Ultra de 192 GB. El ancho de banda de memoria de 800 GB/s sigue siendo el factor limitante. Llama 3.3 70B Q5_K_M cabe holgadamente y ofrece entre 6 y 10 tok/s. Qwen 3 235B-A22B en Q4 cabe por muy poco con 142 GB, a 4-6 tok/s, pero con una calidad superior. gpt-oss 120B en Q4 ocupa 70 GB y deja margen para la caché KV con contextos largos. Ver /guide/llm-mac-studio-m3-ultra.

Escenario D — evaluar mediante benchmarks una regresión entre dos checkpoints ajustados. Caso industrial típico: un fine-tuning LoRA con 10 000 ejemplos del ámbito profesional sobre Llama 3.3 70B. El riesgo es una regresión catastrófica en las capacidades generales. Protocolo mínimo: MMLU (5-shot), IFEval, GSM8K, HumanEval+ antes y después del fine-tuning, con la misma semilla. Una caída superior a 2 puntos en 2 de las 4 suites indica sobreaprendizaje. Ver /guide/fine-tuning-sans-regression.

Licencias y condiciones exactas de uso comercial

Le benchmark de LLM locales no sirve de nada si la licencia prohíbe el despliegue deseado. Cuatro familias dominan el ecosistema de pesos abiertos de 2026:

Para un comparativo detallado por licencia, ver /guide/licences-llm-open-source.

Elegir un modelo según el perfil de benchmark objetivo

FAQ

P: ¿Cuál es la diferencia entre MMLU y MMLU-Pro?

MMLU incluye 4 opciones por pregunta y alcanza un techo de alrededor del 88-90 % para los mejores modelos con pesos abiertos, lo que lo hace poco discriminante. MMLU-Pro pasa a 10 opciones, elimina las preguntas ambiguas y añade ítems que requieren razonamiento en varios pasos. Los puntajes suelen bajar entre 15 y 25 puntos, lo que restaura su poder discriminante. Para comparar modelos modernos como DeepSeek V3.2 o Qwen 3 235B-A22B, MMLU-Pro es ahora más relevante que el MMLU clásico.

P: ¿Cómo reproducir un puntaje HumanEval localmente?

Instalar evalplus, cargar el modelo mediante vLLM o llama.cpp, generar entre 1 y 200 respuestas por problema según la métrica objetivo y luego ejecutar las pruebas de Python. Prever un día de GPU para un modelo de 70B en pass@1 sobre los 164 problemas, y más para pass@100. Una puntuación a temperatura 0 difiere de una puntuación promediada sobre varias muestras: documentar siempre los hiperparámetros y publicar el script para permitir la comparación cruzada.

P: ¿Se debe preferir Q4, Q5 o Q8 para un benchmark fiable?

Q4_K_M suele perder entre 1 y 3 puntos en MMLU respecto a FP16, a veces más en AIME, donde el razonamiento prolongado es sensible a los errores acumulados. Q5_K_M y Q6_K reducen la diferencia a menos de un punto. Q8_0 es prácticamente indistinguible de FP16 en la mayoría de las baterías de pruebas. Para realizar benchmarks de forma honesta, indicar siempre la cuantización utilizada. La guía /guide/quantization-q4-q5-q8 detalla las caídas medidas para cada formato.

P: ¿Están contaminadas las puntuaciones de AIME 2024?

Los enunciados de AIME 2024 se publicaron en febrero de 2024 y fueron indexados por los crawlers poco después. Los modelos con una fecha de corte de datos posterior a mediados de 2024 pueden haber visto las soluciones. Por esta razón, se priorizan AIME 2025 y AIME 2026 en las evaluaciones recientes, siempre que los modelos no hayan estado expuestos a ellas. Verificar siempre la fecha de corte del preentrenamiento anunciada por el proveedor en la model card y contrastar con LiveBench para confirmar.

P: ¿Qué modelo para un ordenador con 24 GB de VRAM?

24 GB excluyen los modelos 70B+ en Q4 que requieren al menos 40 GB. Las opciones viables son modelos de 30B a 40B en Q4, o modelos de 70B con cuantizaciones agresivas como IQ2_XXS, a costa de una pérdida significativa de calidad (5 a 10 puntos en MMLU). Para mantenerse en un nivel de calidad aceptable, optar por modelos de 14B a 32B. Ver el configurador en /configurateur para filtrar por VRAM.

P: ¿Por qué los puntajes difieren entre HuggingFace y los informes del proveedor?

Los proveedores optimizan los prompts, utilizan métodos de decodificación específicos (cons@64, majority voting) y a veces seleccionan las mejores ejecuciones entre varias semillas. Las clasificaciones independientes como HuggingFace Open LLM Leaderboard imponen un protocolo uniforme (zero-shot o few-shot fijo, prompts estandarizados). Se espera una diferencia de 3 a 10 puntos entre las dos fuentes. En producción, lo que cuenta es el protocolo reproducible, no la cifra máxima.

Conclusión

Un benchmark de LLM locales leído sin contexto de licencia, cuantización y protocolo de decodificación induce a error. El método sólido consiste en contrastar como mínimo MMLU-Pro, HumanEval+, AIME 2025/2026 y un benchmark de agentes del tipo SWE-bench Verified, comprobando la VRAM objetivo y la licencia antes de asumir cualquier compromiso. El alcance se limita deliberadamente aquí a la medición: lo que importa en esta página es la capacidad de reproducir una cifra publicada, comprender su margen de error y comprobar que el modelo cabe en tu hardware. Para filtrar los modelos indexados según tu presupuesto de GPU y tu caso de uso, inicia el configurador quelllm.fr o explora el catálogo completo.

Artículo publicado y actualizado el por Mohamed Meguedmi · Fuente de datos: /api/models.json · Licencia del contenido: CC BY 4.0.

¿Tienes algún error o alguna actualización que comunicar? Colaborar.