MMLU-Pro: el benchmark de conocimientos para LLM locales

Le benchmark MMLU-Pro se ha convertido en la referencia para evaluar la profundidad de los conocimientos y la capacidad de razonamiento de los modelos con pesos abiertos ejecutados localmente. Publicado en 2024 por TIGER-Lab, este benchmark MMLU-Pro corrige las debilidades del MMLU original (saturación, preguntas ambiguas, opciones de respuesta demasiado fáciles de adivinar) introduciendo 12.032 preguntas con 10 opciones repartidas entre 14 disciplinas. Este artículo detalla el protocolo, las puntuaciones observadas en los modelos del catálogo quelllm.fr, el impacto de la cuantización en los resultados y el método para reproducir el benchmark en casa con una GPU de consumo o en una estación de trabajo.

¿Por qué MMLU-Pro reemplazó a MMLU en evaluaciones serias?

El MMLU clásico (Hendrycks et al., 2020) tiene un techo de alrededor del 88-90 % para los mejores modelos, lo que hace casi imposible distinguir entre los modelos de vanguardia. El documento arXiv 2406.01574 introduce tres correcciones importantes:

Resultado: la puntuación media baja entre 15 y 25 puntos respecto a MMLU. Un modelo que obtiene un 86 % en MMLU suele bajar a alrededor del 66 % en MMLU-Pro. Este desplazamiento de las puntuaciones hacia abajo devuelve utilidad a la medición para comparar modelos modernos de pesos abiertos.

El conjunto de datos completo está alojado en HuggingFace TIGER-Lab/MMLU-Pro y la evaluación de referencia se realiza a través del repositorio oficial de GitHub.

Puntuaciones MMLU-Pro observadas en el catálogo quelllm.fr

Las puntuaciones que aparecen a continuación proceden de la clasificación oficial de TIGER-Lab y de informes técnicos de los desarrolladores. Los valores marcados como "estimado" proceden de mediciones parciales de la comunidad pendientes de confirmación.

Las diferencias entre categorías (derecho, medicina, ingeniería) pueden alcanzar 20 puntos para el mismo modelo: una puntuación media oculta a menudo una debilidad disciplinar.

Impacto de la cuantización en la puntuación MMLU del LLM

La cuantización reduce el uso de VRAM, pero empeora las puntuaciones. Las mediciones empíricas de los modelos del catálogo arrojan estos órdenes de magnitud (fuentes: incidencias de llama.cpp, informes de Unsloth):

Pour Llama 3.3 70B Instruct, por ejemplo, se observa una caída de ~68 % en FP16 a ~64 % en Q4_K_M en el subconjunto "law". En Qwen 2.5 72B Instruct, la diferencia es menor (1,5 puntos). La regla práctica: Q5_K_M sigue siendo el mejor equilibrio para las evaluaciones serias, mientras que Q4 es adecuado para el uso diario.

Ver el guía de cuantización GGUF para los detalles de los formatos.

VRAM y costo de hardware para ejecutar el benchmark de conocimiento

Reproducir MMLU-Pro localmente requiere cargar el modelo en memoria y generar aproximadamente 12 032 respuestas (con CoT, eso representa entre 5 y 10 millones de tokens de salida). Coste de hardware por tramo:

Un benchmark completo en un 70B en Q4 tarda entre 4 y 8 horas en RTX 6000 Ada según el rendimiento (~25-35 tokens/segundo). Para calibrar tu configuración, la herramienta /configurateur ofrece el hardware adaptado a un presupuesto de VRAM objetivo.

Método para reproducir el benchmark localmente

El protocolo estándar utiliza vllm o llama.cpp en backend, con el script Python oficial del repositorio TIGER-AI-Lab.

Pasos principales:

  1. Descarga del conjunto de datos depuis HuggingFace (aproximadamente 12 MB).
  2. Configuración del modelo en modo chat completion con temperatura 0 y top-p 1. El prompt del sistema debe incluir 5 ejemplos few-shot por categoría (CoT activado).
  3. Inicio de la evaluación disciplina por disciplina (14 categorías: biology, business, chemistry, computer_science, economics, engineering, health, history, law, math, other, philosophy, physics, psychology).
  4. Análisis sintáctico de las respuestas : extracción de la letra final (A a J) mediante regex en la última línea.
  5. Cálculo del puntaje ponderado por categoría o promedio global.

Detalles completos en el README GitHub. Para comparar dos modelos lado a lado, ver /compare/llama33-70b-vs-qwen25-72b o consultar el ranking general en /meilleur-llm/raisonnement.

Límites del MMLU-Pro y benchmarks complementarios

Ningún benchmark es suficiente por sí solo. MMLU-Pro mide conocimientos académicos y razonamiento estructurado, pero no cubre:

Un conjunto robusto de pruebas combina como mínimo MMLU-Pro + HumanEval + GSM8K + un benchmark de agentes.

FAQ

P: ¿Cuál es la diferencia práctica entre MMLU y MMLU-Pro?

MMLU tiene 4 opciones por pregunta y se satura por encima del 88 %. MMLU-Pro pasa a 10 opciones, filtra las preguntas ambiguas e incorpora razonamiento en varios pasos. Resultado: las puntuaciones bajan entre 15 y 25 puntos, lo que permite volver a distinguir mejor el rendimiento de los modelos. Para usos a partir de 2025, MMLU-Pro es ahora la referencia en los informes técnicos de los desarrolladores.

P: ¿Se debe activar el chain-of-thought para evaluar un modelo?

Sí para los benchmarks comparativos, ya que el protocolo oficial MMLU-Pro lo utiliza. Sin CoT, las puntuaciones bajan entre 5 y 15 puntos según el modelo. En DeepSeek R1 671B, el modo de razonamiento gana ~8 puntos respecto a una llamada directa. Para medir la pertinencia en producción sin CoT, ejecuta la evaluación en modo "answer only" por separado.

P: ¿Puedo ejecutar el benchmark de conocimiento en un Mac M4?

Sí, a través de llama.cpp o MLX. Un Mac Studio M4 Max de 128 GB ejecuta Llama 3.3 70B Instruct en Q4 (~40 GB) a 8-12 tokens/s, es decir, de 6 a 10 horas para el benchmark completo. Los modelos de más de 100B requieren un M4 Ultra de 192 GB o un offloading al SSD muy lento. Ver el guía de Mac con Apple Silicon para las configuraciones recomendadas.

P: ¿Es fiable la puntuación MMLU-Pro para elegir un modelo para un ámbito profesional?

Parcialmente. MMLU-Pro refleja bien la capacidad generalista, pero una puntuación global del 70 % puede ocultar un 55 % en derecho y un 82 % en física. Si tu caso de uso se centra en una disciplina específica, consulta la puntuación por categoría publicada en la clasificación. Para un uso de programación o jurídico en francés, complementa la evaluación con HumanEval-FR y una prueba interna con tus propios datos.

P: ¿Qué licencia tienen los modelos mejor clasificados en el benchmark?

Las mejores puntuaciones entre los modelos de pesos abiertos provienen de modelos con licencias permisivas: DeepSeek V3 671B (DeepSeek License), DeepSeek R1 671B (MIT), Qwen 3 235B-A22B (Apache 2.0), Mistral Large 3 675B (Apache 2.0). Cabe señalar: Llama 3.1 405B Instruct está bajo la licencia Llama 3.1 Community (restricciones por encima de 700M MAU). Revisa cada licencia antes de un despliegue comercial.

P: ¿Cuánto cuesta una evaluación completa con una GPU alquilada?

A 2 €/h por una H100 de 80 GB en una nube bare-metal, un benchmark MMLU-Pro completo con un modelo de 70B en Q4 cuesta entre 8 y 16 € según la velocidad de procesamiento. Para un modelo de 405B en Q4 que requiere 4 H100, calcula entre 80 y 160 €. Es mucho más barato que comprar el hardware, pero la inferencia local sigue siendo pertinente para evaluaciones repetidas o datos sensibles.

Conclusión

Le benchmark MMLU-Pro ofrece hoy la medida más discriminante de conocimientos y razonamiento para los LLM de pesos abiertos. Combinado con benchmarks especializados (HumanEval, AIME, LongBench), permite orientar objetivamente la elección de un modelo. Para identificar la configuración de hardware que te permita ejecutar los mejores modelos del ranking, pasa por el configurador quelllm.fr o explora los 249 modelos indexados en el catálogo completo.

Artículo publicado el por Mohamed Meguedmi · Fuente de datos: /api/models.json · Licencia del contenido: CC BY 4.0.

¿Tienes algún error o alguna actualización que comunicar? Colaborar.