MMLU-Pro: el benchmark de conocimientos para LLM locales
Le benchmark MMLU-Pro se ha convertido en la referencia para evaluar la profundidad de los conocimientos y la capacidad de razonamiento de los modelos con pesos abiertos ejecutados localmente. Publicado en 2024 por TIGER-Lab, este benchmark MMLU-Pro corrige las debilidades del MMLU original (saturación, preguntas ambiguas, opciones de respuesta demasiado fáciles de adivinar) introduciendo 12.032 preguntas con 10 opciones repartidas entre 14 disciplinas. Este artículo detalla el protocolo, las puntuaciones observadas en los modelos del catálogo quelllm.fr, el impacto de la cuantización en los resultados y el método para reproducir el benchmark en casa con una GPU de consumo o en una estación de trabajo.
¿Por qué MMLU-Pro reemplazó a MMLU en evaluaciones serias?
El MMLU clásico (Hendrycks et al., 2020) tiene un techo de alrededor del 88-90 % para los mejores modelos, lo que hace casi imposible distinguir entre los modelos de vanguardia. El documento arXiv 2406.01574 introduce tres correcciones importantes:
- 10 opciones por pregunta en lugar de 4 : la probabilidad de acertar al azar pasa del 25 % al 10 %, lo que amplía el rango de las puntuaciones.
- Filtrado manual de preguntas ambiguas : aproximadamente 5.000 preguntas del MMLU original han sido eliminadas o reformuladas por expertos.
- Incorporación de preguntas que requieren un alto nivel de razonamiento : integración de problemas de STEM (TheoremQA, SciBench) que requieren un cálculo en varias etapas en lugar de una simple recuperación de información memorizada.
Resultado: la puntuación media baja entre 15 y 25 puntos respecto a MMLU. Un modelo que obtiene un 86 % en MMLU suele bajar a alrededor del 66 % en MMLU-Pro. Este desplazamiento de las puntuaciones hacia abajo devuelve utilidad a la medición para comparar modelos modernos de pesos abiertos.
El conjunto de datos completo está alojado en HuggingFace TIGER-Lab/MMLU-Pro y la evaluación de referencia se realiza a través del repositorio oficial de GitHub.
Puntuaciones MMLU-Pro observadas en el catálogo quelllm.fr
Las puntuaciones que aparecen a continuación proceden de la clasificación oficial de TIGER-Lab y de informes técnicos de los desarrolladores. Los valores marcados como "estimado" proceden de mediciones parciales de la comunidad pendientes de confirmación.
- DeepSeek V3 671B : 75,9 % — mejor puntuación registrada para un modelo generalista de pesos abiertos a finales de 2024. Ficha completa en /modele/deepseek-v3-671b.
- DeepSeek R1 671B : 84,0 % (razonamiento activado) — ganancia de ~8 puntos gracias al chain-of-thought interno. Detalles sobre /modele/deepseek-r1-671b.
- Qwen 3 235B-A22B : 72,1 % estimado — arquitectura MoE, ver /modele/qwen3-235b-a22b.
- Llama 3.1 405B Instruct : 73,3 % — referencia Meta, ficha /modele/llama-3-1-405b.
- Llama 3.3 70B Instruct : 68,9 % — mejor relación rendimiento/VRAM para equipos de 40 GB, ficha /modele/llama33-70b.
- Mistral Large 3 675B : 71,5 % estimado — ver /modele/mistral-large-3.
- gpt-oss 120B : 70,2 % estimado — variante destilada de OpenAI, ficha /modele/gpt-oss-120b.
- Qwen 2.5 72B Instruct : 65,4 % — base sólida multilingüe, ficha /modele/qwen25-72b.
- Mixtral 8x22B Instruct : 56,2 % — histórico, pero aún pertinente para comparar, ficha /modele/mixtral-8x22b.
Las diferencias entre categorías (derecho, medicina, ingeniería) pueden alcanzar 20 puntos para el mismo modelo: una puntuación media oculta a menudo una debilidad disciplinar.
Impacto de la cuantización en la puntuación MMLU del LLM
La cuantización reduce el uso de VRAM, pero empeora las puntuaciones. Las mediciones empíricas de los modelos del catálogo arrojan estos órdenes de magnitud (fuentes: incidencias de llama.cpp, informes de Unsloth):
- FP16 → Q8_0 : pérdida < 0,5 punto en MMLU-Pro, generalmente no significativa.
- Q8 → Q5_K_M : pérdida de 1 a 2 puntos según la disciplina (más afectadas las matemáticas).
- Q5 → Q4_K_M : pérdida de 2 a 4 puntos, más marcada en preguntas de razonamiento multietapa.
- Q4 → Q3 : posible caída drástica (> 5 puntos), evitar para usos exigentes.
Pour Llama 3.3 70B Instruct, por ejemplo, se observa una caída de ~68 % en FP16 a ~64 % en Q4_K_M en el subconjunto "law". En Qwen 2.5 72B Instruct, la diferencia es menor (1,5 puntos). La regla práctica: Q5_K_M sigue siendo el mejor equilibrio para las evaluaciones serias, mientras que Q4 es adecuado para el uso diario.
Ver el guía de cuantización GGUF para los detalles de los formatos.
VRAM y costo de hardware para ejecutar el benchmark de conocimiento
Reproducir MMLU-Pro localmente requiere cargar el modelo en memoria y generar aproximadamente 12 032 respuestas (con CoT, eso representa entre 5 y 10 millones de tokens de salida). Coste de hardware por tramo:
- 24 GB de VRAM (RTX 4090) : limitado a modelos de ~30B en Q4; sin acceso a los grandes modelos open-weights.
- 48 GB VRAM (2× RTX 4090 o RTX 6000 Ada) : permite Llama 3.3 70B Instruct en Q4 (~40 GB), Qwen 2.5 72B Instruct (~42 GB), Qwen3-Coder-Next 80B-A3B (~48 GB).
- 96 GB VRAM (2× RTX 6000 Ada) : permite ejecutar Mixtral 8x22B Instruct (~82 GB), gpt-oss 120B (~70 GB), Mistral Small 4 (~72 GB).
- 160-200 GB de VRAM (4-5× RTX 6000 Ada o H100) : Llama 3.1 405B Instruct en Q4 (~240 GB con offloading CPU), Qwen 3 235B-A22B (~142 GB).
- 400+ GB de VRAM (clúster H100/H200) : DeepSeek V3 671B, DeepSeek R1 671B, Kimi K2.5 y más allá.
Un benchmark completo en un 70B en Q4 tarda entre 4 y 8 horas en RTX 6000 Ada según el rendimiento (~25-35 tokens/segundo). Para calibrar tu configuración, la herramienta /configurateur ofrece el hardware adaptado a un presupuesto de VRAM objetivo.
Método para reproducir el benchmark localmente
El protocolo estándar utiliza vllm o llama.cpp en backend, con el script Python oficial del repositorio TIGER-AI-Lab.
Pasos principales:
- Descarga del conjunto de datos depuis HuggingFace (aproximadamente 12 MB).
- Configuración del modelo en modo chat completion con temperatura 0 y top-p 1. El prompt del sistema debe incluir 5 ejemplos few-shot por categoría (CoT activado).
- Inicio de la evaluación disciplina por disciplina (14 categorías: biology, business, chemistry, computer_science, economics, engineering, health, history, law, math, other, philosophy, physics, psychology).
- Análisis sintáctico de las respuestas : extracción de la letra final (A a J) mediante regex en la última línea.
- Cálculo del puntaje ponderado por categoría o promedio global.
Detalles completos en el README GitHub. Para comparar dos modelos lado a lado, ver /compare/llama33-70b-vs-qwen25-72b o consultar el ranking general en /meilleur-llm/raisonnement.
Límites del MMLU-Pro y benchmarks complementarios
Ningún benchmark es suficiente por sí solo. MMLU-Pro mide conocimientos académicos y razonamiento estructurado, pero no cubre:
- El código : usar HumanEval, MBPP o LiveCodeBench. El modelo Qwen3-Coder-Next 80B-A3B está diseñado para esta categoría (fiche).
- Matemáticas avanzadas : AIME, MATH, GSM8K siguen siendo indispensables. DeepSeek R1 671B brilla particularmente aquí.
- Multilingüe : MGSM, Multilingual MMLU, Belebele para el francés. Mistral Large 3 675B et Rakuten AI 3.0 se evalúan mejor en estos aspectos.
- Contexto largo : RULER, LongBench. Llama 4 Scout 109B (10M tokens de contexto) o MiMo V2.5 Pro (1M tokens) son las referencias aquí.
- L'agentique : SWE-bench, BFCL, AgentBench.
Un conjunto robusto de pruebas combina como mínimo MMLU-Pro + HumanEval + GSM8K + un benchmark de agentes.
FAQ
P: ¿Cuál es la diferencia práctica entre MMLU y MMLU-Pro?
MMLU tiene 4 opciones por pregunta y se satura por encima del 88 %. MMLU-Pro pasa a 10 opciones, filtra las preguntas ambiguas e incorpora razonamiento en varios pasos. Resultado: las puntuaciones bajan entre 15 y 25 puntos, lo que permite volver a distinguir mejor el rendimiento de los modelos. Para usos a partir de 2025, MMLU-Pro es ahora la referencia en los informes técnicos de los desarrolladores.
P: ¿Se debe activar el chain-of-thought para evaluar un modelo?
Sí para los benchmarks comparativos, ya que el protocolo oficial MMLU-Pro lo utiliza. Sin CoT, las puntuaciones bajan entre 5 y 15 puntos según el modelo. En DeepSeek R1 671B, el modo de razonamiento gana ~8 puntos respecto a una llamada directa. Para medir la pertinencia en producción sin CoT, ejecuta la evaluación en modo "answer only" por separado.
P: ¿Puedo ejecutar el benchmark de conocimiento en un Mac M4?
Sí, a través de llama.cpp o MLX. Un Mac Studio M4 Max de 128 GB ejecuta Llama 3.3 70B Instruct en Q4 (~40 GB) a 8-12 tokens/s, es decir, de 6 a 10 horas para el benchmark completo. Los modelos de más de 100B requieren un M4 Ultra de 192 GB o un offloading al SSD muy lento. Ver el guía de Mac con Apple Silicon para las configuraciones recomendadas.
P: ¿Es fiable la puntuación MMLU-Pro para elegir un modelo para un ámbito profesional?
Parcialmente. MMLU-Pro refleja bien la capacidad generalista, pero una puntuación global del 70 % puede ocultar un 55 % en derecho y un 82 % en física. Si tu caso de uso se centra en una disciplina específica, consulta la puntuación por categoría publicada en la clasificación. Para un uso de programación o jurídico en francés, complementa la evaluación con HumanEval-FR y una prueba interna con tus propios datos.
P: ¿Qué licencia tienen los modelos mejor clasificados en el benchmark?
Las mejores puntuaciones entre los modelos de pesos abiertos provienen de modelos con licencias permisivas: DeepSeek V3 671B (DeepSeek License), DeepSeek R1 671B (MIT), Qwen 3 235B-A22B (Apache 2.0), Mistral Large 3 675B (Apache 2.0). Cabe señalar: Llama 3.1 405B Instruct está bajo la licencia Llama 3.1 Community (restricciones por encima de 700M MAU). Revisa cada licencia antes de un despliegue comercial.
P: ¿Cuánto cuesta una evaluación completa con una GPU alquilada?
A 2 €/h por una H100 de 80 GB en una nube bare-metal, un benchmark MMLU-Pro completo con un modelo de 70B en Q4 cuesta entre 8 y 16 € según la velocidad de procesamiento. Para un modelo de 405B en Q4 que requiere 4 H100, calcula entre 80 y 160 €. Es mucho más barato que comprar el hardware, pero la inferencia local sigue siendo pertinente para evaluaciones repetidas o datos sensibles.
Conclusión
Le benchmark MMLU-Pro ofrece hoy la medida más discriminante de conocimientos y razonamiento para los LLM de pesos abiertos. Combinado con benchmarks especializados (HumanEval, AIME, LongBench), permite orientar objetivamente la elección de un modelo. Para identificar la configuración de hardware que te permita ejecutar los mejores modelos del ranking, pasa por el configurador quelllm.fr o explora los 249 modelos indexados en el catálogo completo.