ARC-AGI 2: probar el razonamiento de LLM open-source

Le Benchmark ARC-AGI 2 se convirtió en 2025 en la referencia para medir la generalización y el razonamiento abstracto de los LLM de pesos abiertos, mucho más allá de los clásicos cuestionarios de opción múltiple como MMLU. Diseñado por François Chollet y la fundación Arc Prize, el Benchmark ARC-AGI 2 somete a los modelos a acertijos visuales inéditos en los que la memorización y la fuerza bruta ya no bastan. Este artículo repasa el protocolo de evaluación, los modelos open-source mejor posicionados del catálogo quelllm.fr, sus costes de hardware en términos de VRAM y las buenas prácticas para reproducir estas pruebas en local.

¿Qué es ARC-AGI 2 y por qué cambia las cosas?

ARC-AGI 2 es la segunda iteración del Abstraction and Reasoning Corpus, publicada en el marco delArc Prize 2025 con una dotación de un millón de dólares en premios. El conjunto contiene aproximadamente 1.000 tareas públicas de entrenamiento, 400 tareas de evaluación pública y 100 tareas privadas de prueba final. Cada tarea consta de una cuadrícula de entrada coloreada y una cuadrícula de salida, acompañadas de 2 a 5 ejemplos. El modelo debe deducir la regla de transformación y luego aplicarla a un nuevo caso.

A diferencia de MMLU o HumanEval, ARC-AGI 2 no recompensa ni la cultura general ni el reconocimiento de patrones sintácticos. Se centra en el razonamiento de los LLM en sentido estricto: composición de reglas, manipulación de objetos, simetría, conteo. Según el documento fundacional de Chollet (arXiv:1911.01547), un humano no entrenado supera el 80 % de éxito; los mejores LLM de código abierto alcanzaban un máximo del 5-15 % al principio de 2025.

Para entender el lugar de este benchmark en el ecosistema, consultar nuestra guía de benchmarks de LLM 2025.

Protocolo de evaluación: qué mide realmente ARC-AGI 2

El protocolo oficial impone dos restricciones que diferencian a ARC-AGI 2 de los benchmarks habituales:

La puntuación oficial corresponde al porcentaje de tareas resueltas con dos intentos permitidos (pass@2). El formato de entrada recomendado es una cuadrícula ASCII o JSON con una codificación de colores de 0 a 9. El repositorio oficial de GitHub arc-prize/ARC-AGI-2 proporciona los scripts de evaluación, los entornos de evaluación en Python y los resultados de referencia.

Tres familias de enfoques dominan las propuestas de código abierto:

El entrenamiento en tiempo de prueba da hoy los mejores resultados, pero consume 2 a 10 veces más tokens por tarea. El enfoque de síntesis de programas se popularizó gracias al equipo MindsAI en su entrega de 2024 documentada en el blog Arc Prize.

Modelos candidatos de código abierto: VRAM y licencias

Aquí tienes los modelos del catálogo quelllm.fr más pertinentes para aspirar a una puntuación respetable en el Benchmark ARC-AGI 2, clasificados por perfil de hardware.

Gama muy alta (≥ 400 GB de VRAM en Q4) :

Gama media al alcance de las estaciones de trabajo (60-250 GB Q4) :

Perfil para el público general (≤ 50 GB Q4) :

Los valores de VRAM Q4 son estimaciones basadas en GGUF Q4_K_M; en Q8 hay que considerar ×1,9, en FP16 ×3,8. Estos valores aún deben confirmarse según el entorno de ejecución (llama.cpp, vLLM, SGLang).

Rendimiento esperado y tokens/segundo

Aún no se ha consolidado ninguna puntuación oficial pública para estos modelos en la versión 2 del benchmark: las clasificaciones evolucionan cada mes. Como referencia, los comentarios de la comunidad sobreArc Prize Leaderboard 2025 sitúan a los modelos de razonamiento explícito (R1, Ring-1T) entre el 8 % y el 18 % en pass@2 sin TTT, y hasta un 25-35 % con entrenamiento agresivo durante la inferencia. Estas cifras aún deben confirmarse para las versiones cuantizadas Q4.

En cuanto a la velocidad de generación, en una configuración de 2× RTX 6000 Ada (96 GB de VRAM total) con llama.cpp:

Para comparaciones detalladas de razonamiento, consulta DeepSeek R1 vs Llama 3.3 et los mejores modelos de razonamiento.

Puesta en práctica: reproducir ARC-AGI 2 localmente

Para evaluar un modelo del catálogo en el Benchmark ARC-AGI 2, el flujo de trabajo típico:

  1. Clonar el repositorio oficial arc-prize/ARC-AGI-2 y instalar las dependencias de Python.
  2. Cargar el modelo mediante vLLM o llama.cpp en modo servidor compatible con OpenAI. La documentación vLLM incluye modelos MoE como Qwen 3 235B-A22B.
  3. Codificar cada cuadrícula como una cadena ASCII y luego construir un prompt con ejemplos few-shot.
  4. Para el entrenamiento en tiempo de inferencia, aislar una LoRA de rango 16-32 entrenada con las 2-5 demostraciones de cada tarea (sobrecarga de 30-90 segundos por tarea). La biblioteca PEFT de HuggingFace cubre este caso de uso.
  5. Evaluar con el script scoring.py proporcionado, que calcula pass@1 y pass@2.

Los modelos con contexto largo como MiMo V2.5 Pro (1 M de tokens) o Llama 4 Maverick 400B (1 M tokens) permiten introducir muchos ejemplos sin truncamiento, lo que ayuda en tareas con reglas compuestas.

Para dimensionar tu hardware, el configurador quelllm.fr calcula la VRAM necesaria según la cuantización objetivo.

Errores típicos en ARC-AGI 2 y enfoques para abordarlos

El análisis de las soluciones fallidas presentadas en el repositorio arc-prize/ARC-AGI-2 revela tres familias de bugs recurrentes en los LLM de código abierto:

Para enfoques alternativos, el trabajo del equipo Greenblatt (muestreo seguido de filtrado con Claude Sonnet, ver arXiv:2406.07394) muestra que un modelo más pequeño con generación masiva (más de 1000 programas Python sample-and-test) puede superar a un modelo más grande en single-shot. Esta lógica se aplica bien a Qwen3-Coder-Next 80B-A3B, que excela en síntesis de programación.

Comparación rápida con ARC-AGI 1

ARC-AGI 1 (2019) estaba saturado a finales de 2024 por soluciones híbridas con resultados superiores al 55 %. ARC-AGI 2 vuelve a aumentar deliberadamente la dificultad con cuatro cambios:

El resultado: las mejores soluciones presentadas alcanzan un máximo de ~30 % en 2025, mientras que superaban el 60 % en v1. Para profundizar en el tema, ver también el guía sobre razonamiento frente a matemáticas en los LLM y la ficha DeepSeek R1 vs Ring-1T.

FAQ

P: ¿Qué modelo open-source obtiene la mejor puntuación en ARC-AGI 2 al final de 2025?

En el momento de la redacción, ninguna clasificación oficial establece un podio definitivo de modelos de código abierto. Los resultados enviados por la comunidad sitúan DeepSeek R1 671B et Ring-1T en cabeza gracias a su cadena de pensamiento nativa. Las cifras exactas siguen pendientes de confirmación porque el equipo de Arc Prize actualiza la clasificación mensualmente.

P: ¿Se necesita un modelo de razonamiento o un modelo generalista?

Los modelos con razonamiento explícito (R1, Ring-1T, gpt-oss 120B) superan sistemáticamente a los modelos generalistas con un número equivalente de parámetros. En ARC-AGI 2, el costo adicional en tokens de reflexión (a menudo ×3 a ×10) queda ampliamente compensado por la mejora en pass@2. Un Llama 3.3 70B estándar sigue siendo limitado frente a un DeepSeek R1 Distill Llama 70B.

P: ¿Cuánta VRAM se necesita como mínimo para intentar realizar el benchmark de forma rigurosa?

Con 40 GB de VRAM (RTX 6000 Ada o A6000), puedes ejecutar DeepSeek R1 Distill Llama 70B en Q4 y aspirar a una puntuación respetable. Para alcanzar la frontera del código abierto, necesitas disponer de 250+ GB en total (con varias GPU o una descarga intensiva a la CPU) para modelos como Qwen 3 235B-A22B.

P: ¿El entrenamiento en tiempo de prueba aporta un beneficio real?

Sin TTT, el razonamiento de los LLM se basa únicamente en la inferencia en contexto. Con una LoRA rápida entrenada con las demostraciones de cada tarea, se observan mejoras de entre 8 y 15 puntos porcentuales. La contrapartida es un coste de cómputo multiplicado por un factor de entre 5 y 10 y una mayor complejidad de implementación. Para una primera prueba, utiliza prompting directo.

P: ¿Qué licencia para uso comercial?

Prefiere licencias permisivas. Qwen 3 235B-A22B, gpt-oss 120B, Ring-1T et DeepSeek R1 671B están bajo Apache 2.0 o MIT, sin restricciones de uso comercial. Evita Command R+ 104B bajo licencia CC-BY-NC 4.0 para un producto de pago.

P: ¿Dónde encontrar los conjuntos de datos y scripts oficiales?

Todo está centralizado en el repositorio de GitHub arc-prize/ARC-AGI-2 y en HuggingFace datasets/arc-prize. El formato JSON está documentado y se mantiene estable desde la primera iteración de 2019.

Conclusión

Le Benchmark ARC-AGI 2 seguirá siendo en 2026 una de las pocas pruebas resistentes a la contaminación y a la memorización, lo que la convierte en una herramienta valiosa para quienes quieren comparar objetivamente el razonamiento de los LLM de código abierto. Antes de iniciar una evaluación, dimensiona con precisión tus GPU con el configurador quelllm.fr o explora el catálogo completo para identificar el modelo más adecuado para tu presupuesto de VRAM y la licencia que buscas.

Artículo publicado el por Mohamed Meguedmi · Fuente de datos: /api/models.json · Licencia del contenido: CC BY 4.0.

¿Tienes algún error o alguna actualización que comunicar? Colaborar.