ARC-AGI 2: probar el razonamiento de LLM open-source
Le Benchmark ARC-AGI 2 se convirtió en 2025 en la referencia para medir la generalización y el razonamiento abstracto de los LLM de pesos abiertos, mucho más allá de los clásicos cuestionarios de opción múltiple como MMLU. Diseñado por François Chollet y la fundación Arc Prize, el Benchmark ARC-AGI 2 somete a los modelos a acertijos visuales inéditos en los que la memorización y la fuerza bruta ya no bastan. Este artículo repasa el protocolo de evaluación, los modelos open-source mejor posicionados del catálogo quelllm.fr, sus costes de hardware en términos de VRAM y las buenas prácticas para reproducir estas pruebas en local.
¿Qué es ARC-AGI 2 y por qué cambia las cosas?
ARC-AGI 2 es la segunda iteración del Abstraction and Reasoning Corpus, publicada en el marco delArc Prize 2025 con una dotación de un millón de dólares en premios. El conjunto contiene aproximadamente 1.000 tareas públicas de entrenamiento, 400 tareas de evaluación pública y 100 tareas privadas de prueba final. Cada tarea consta de una cuadrícula de entrada coloreada y una cuadrícula de salida, acompañadas de 2 a 5 ejemplos. El modelo debe deducir la regla de transformación y luego aplicarla a un nuevo caso.
A diferencia de MMLU o HumanEval, ARC-AGI 2 no recompensa ni la cultura general ni el reconocimiento de patrones sintácticos. Se centra en el razonamiento de los LLM en sentido estricto: composición de reglas, manipulación de objetos, simetría, conteo. Según el documento fundacional de Chollet (arXiv:1911.01547), un humano no entrenado supera el 80 % de éxito; los mejores LLM de código abierto alcanzaban un máximo del 5-15 % al principio de 2025.
Para entender el lugar de este benchmark en el ecosistema, consultar nuestra guía de benchmarks de LLM 2025.
Protocolo de evaluación: qué mide realmente ARC-AGI 2
El protocolo oficial impone dos restricciones que diferencian a ARC-AGI 2 de los benchmarks habituales:
- Ninguna contaminación de datos : las 100 tareas privadas nunca se publican en internet, lo que evita cualquier entrenamiento previo sesgado.
- Presupuesto de cómputo limitado : los recursos de cálculo de cada envío están limitados para desincentivar los costosos métodos de fuerza bruta.
La puntuación oficial corresponde al porcentaje de tareas resueltas con dos intentos permitidos (pass@2). El formato de entrada recomendado es una cuadrícula ASCII o JSON con una codificación de colores de 0 a 9. El repositorio oficial de GitHub arc-prize/ARC-AGI-2 proporciona los scripts de evaluación, los entornos de evaluación en Python y los resultados de referencia.
Tres familias de enfoques dominan las propuestas de código abierto:
- Prompting directo con una cadena de pensamiento estructurada
- Entrenamiento en tiempo de prueba (TTT): fine-tuning rápido con 2-5 ejemplos antes de la inferencia
- Síntesis de programas : generación de código Python que el modelo ejecuta para producir la cuadrícula
El entrenamiento en tiempo de prueba da hoy los mejores resultados, pero consume 2 a 10 veces más tokens por tarea. El enfoque de síntesis de programas se popularizó gracias al equipo MindsAI en su entrega de 2024 documentada en el blog Arc Prize.
Modelos candidatos de código abierto: VRAM y licencias
Aquí tienes los modelos del catálogo quelllm.fr más pertinentes para aspirar a una puntuación respetable en el Benchmark ARC-AGI 2, clasificados por perfil de hardware.
Gama muy alta (≥ 400 GB de VRAM en Q4) :
- DeepSeek V4 Pro 1.6T — 1600B parámetros, licencia MIT, ~960 GB de VRAM en Q4, contexto de 1 000 000 tokens. Arquitectura MoE adaptada al razonamiento en varias etapas.
- Kimi K2.6 — 1000B, Modified MIT, ~600 GB Q4. Buenos resultados anunciados en tareas de planificación.
- Ring-1T — 1000B, MIT, ~600 GB Q4, contexto de 131 072 tokens, diseñado para el razonamiento prolongado.
- DeepSeek R1 671B — 671B, MIT, ~400 GB Q4. Modelo de razonamiento con cadena de pensamiento nativa.
- MiMo V2.5 Pro — 1020B, MIT, ~595 GB Q4, contexto 1 M tokens. Interesante para prompts de few-shot masivos.
Gama media al alcance de las estaciones de trabajo (60-250 GB Q4) :
- Qwen 3 235B-A22B — 235B, Apache 2.0, ~142 GB Q4, contexto 131 072.
- gpt-oss 120B — 117B, Apache 2.0, ~70 GB Q4. Buena relación entre costo y capacidad de razonamiento.
- Nemotron 3 Super 120B — 120B, NVIDIA Open Model License, ~72 GB Q4.
- Llama 4 Scout 109B — 109B, Llama 4 Community, ~65 GB Q4, contexto ampliado hasta 10 M tokens.
- Mistral Small 4 — 119B, Apache 2.0, ~72 GB Q4, contexto 256 000 tokens.
Perfil para el público general (≤ 50 GB Q4) :
- Qwen3-Coder-Next 80B-A3B — 80B, Apache 2.0, ~48 GB Q4. Útil para el enfoque de síntesis de programas.
- DeepSeek R1 Distill Llama 70B — 70B, ~40 GB Q4. Versión distilada del razonamiento R1.
- Llama 3.3 70B Instruct — 70B, ~40 GB Q4.
Los valores de VRAM Q4 son estimaciones basadas en GGUF Q4_K_M; en Q8 hay que considerar ×1,9, en FP16 ×3,8. Estos valores aún deben confirmarse según el entorno de ejecución (llama.cpp, vLLM, SGLang).
Rendimiento esperado y tokens/segundo
Aún no se ha consolidado ninguna puntuación oficial pública para estos modelos en la versión 2 del benchmark: las clasificaciones evolucionan cada mes. Como referencia, los comentarios de la comunidad sobreArc Prize Leaderboard 2025 sitúan a los modelos de razonamiento explícito (R1, Ring-1T) entre el 8 % y el 18 % en pass@2 sin TTT, y hasta un 25-35 % con entrenamiento agresivo durante la inferencia. Estas cifras aún deben confirmarse para las versiones cuantizadas Q4.
En cuanto a la velocidad de generación, en una configuración de 2× RTX 6000 Ada (96 GB de VRAM total) con llama.cpp:
- Llama 3.3 70B Q4 : 18-22 tokens/seg (estimado)
- gpt-oss 120B Q4 : 12-16 tokens/seg (estimado)
- Qwen 3 235B-A22B Q4 : 8-12 tokens/seg con offload parcial a la CPU
Para comparaciones detalladas de razonamiento, consulta DeepSeek R1 vs Llama 3.3 et los mejores modelos de razonamiento.
Puesta en práctica: reproducir ARC-AGI 2 localmente
Para evaluar un modelo del catálogo en el Benchmark ARC-AGI 2, el flujo de trabajo típico:
- Clonar el repositorio oficial
arc-prize/ARC-AGI-2y instalar las dependencias de Python. - Cargar el modelo mediante vLLM o llama.cpp en modo servidor compatible con OpenAI. La documentación vLLM incluye modelos MoE como Qwen 3 235B-A22B.
- Codificar cada cuadrícula como una cadena ASCII y luego construir un prompt con ejemplos few-shot.
- Para el entrenamiento en tiempo de inferencia, aislar una LoRA de rango 16-32 entrenada con las 2-5 demostraciones de cada tarea (sobrecarga de 30-90 segundos por tarea). La biblioteca PEFT de HuggingFace cubre este caso de uso.
- Evaluar con el script
scoring.pyproporcionado, que calcula pass@1 y pass@2.
Los modelos con contexto largo como MiMo V2.5 Pro (1 M de tokens) o Llama 4 Maverick 400B (1 M tokens) permiten introducir muchos ejemplos sin truncamiento, lo que ayuda en tareas con reglas compuestas.
Para dimensionar tu hardware, el configurador quelllm.fr calcula la VRAM necesaria según la cuantización objetivo.
Errores típicos en ARC-AGI 2 y enfoques para abordarlos
El análisis de las soluciones fallidas presentadas en el repositorio arc-prize/ARC-AGI-2 revela tres familias de bugs recurrentes en los LLM de código abierto:
- Alucinación de color : el modelo inventa un color ausente de la paleta 0-9. Mitigación: restringir la salida mediante una gramática JSON tipada (procesador de logits en vLLM).
- Inversión de filas/columnas : confusión entre dimensiones en cuadrículas no cuadradas. Medida de mitigación: anotar
H × Len el prompt. - Sobregeneralización : aplicación de una regla que es correcta para los ejemplos, pero no capta el matiz del caso de prueba. Mitigación: forzar un paso
<verification>después de la cadena de pensamiento.
Para enfoques alternativos, el trabajo del equipo Greenblatt (muestreo seguido de filtrado con Claude Sonnet, ver arXiv:2406.07394) muestra que un modelo más pequeño con generación masiva (más de 1000 programas Python sample-and-test) puede superar a un modelo más grande en single-shot. Esta lógica se aplica bien a Qwen3-Coder-Next 80B-A3B, que excela en síntesis de programación.
Comparación rápida con ARC-AGI 1
ARC-AGI 1 (2019) estaba saturado a finales de 2024 por soluciones híbridas con resultados superiores al 55 %. ARC-AGI 2 vuelve a aumentar deliberadamente la dificultad con cuatro cambios:
- Tareas compuestas que combinan entre 2 y 4 transformaciones primitivas en lugar de una sola.
- Grillas más grandes (hasta 30×30 en lugar de 15×15 en v1).
- Eliminación de los sesgos estadísticos que permitían los ataques de fuerza bruta por enumeración.
- Tareas privadas renovadas para 2025-2026, incluyendo 50 diseñadas por expertos humanos en razonamiento visual.
El resultado: las mejores soluciones presentadas alcanzan un máximo de ~30 % en 2025, mientras que superaban el 60 % en v1. Para profundizar en el tema, ver también el guía sobre razonamiento frente a matemáticas en los LLM y la ficha DeepSeek R1 vs Ring-1T.
FAQ
P: ¿Qué modelo open-source obtiene la mejor puntuación en ARC-AGI 2 al final de 2025?
En el momento de la redacción, ninguna clasificación oficial establece un podio definitivo de modelos de código abierto. Los resultados enviados por la comunidad sitúan DeepSeek R1 671B et Ring-1T en cabeza gracias a su cadena de pensamiento nativa. Las cifras exactas siguen pendientes de confirmación porque el equipo de Arc Prize actualiza la clasificación mensualmente.
P: ¿Se necesita un modelo de razonamiento o un modelo generalista?
Los modelos con razonamiento explícito (R1, Ring-1T, gpt-oss 120B) superan sistemáticamente a los modelos generalistas con un número equivalente de parámetros. En ARC-AGI 2, el costo adicional en tokens de reflexión (a menudo ×3 a ×10) queda ampliamente compensado por la mejora en pass@2. Un Llama 3.3 70B estándar sigue siendo limitado frente a un DeepSeek R1 Distill Llama 70B.
P: ¿Cuánta VRAM se necesita como mínimo para intentar realizar el benchmark de forma rigurosa?
Con 40 GB de VRAM (RTX 6000 Ada o A6000), puedes ejecutar DeepSeek R1 Distill Llama 70B en Q4 y aspirar a una puntuación respetable. Para alcanzar la frontera del código abierto, necesitas disponer de 250+ GB en total (con varias GPU o una descarga intensiva a la CPU) para modelos como Qwen 3 235B-A22B.
P: ¿El entrenamiento en tiempo de prueba aporta un beneficio real?
Sin TTT, el razonamiento de los LLM se basa únicamente en la inferencia en contexto. Con una LoRA rápida entrenada con las demostraciones de cada tarea, se observan mejoras de entre 8 y 15 puntos porcentuales. La contrapartida es un coste de cómputo multiplicado por un factor de entre 5 y 10 y una mayor complejidad de implementación. Para una primera prueba, utiliza prompting directo.
P: ¿Qué licencia para uso comercial?
Prefiere licencias permisivas. Qwen 3 235B-A22B, gpt-oss 120B, Ring-1T et DeepSeek R1 671B están bajo Apache 2.0 o MIT, sin restricciones de uso comercial. Evita Command R+ 104B bajo licencia CC-BY-NC 4.0 para un producto de pago.
P: ¿Dónde encontrar los conjuntos de datos y scripts oficiales?
Todo está centralizado en el repositorio de GitHub arc-prize/ARC-AGI-2 y en HuggingFace datasets/arc-prize. El formato JSON está documentado y se mantiene estable desde la primera iteración de 2019.
Conclusión
Le Benchmark ARC-AGI 2 seguirá siendo en 2026 una de las pocas pruebas resistentes a la contaminación y a la memorización, lo que la convierte en una herramienta valiosa para quienes quieren comparar objetivamente el razonamiento de los LLM de código abierto. Antes de iniciar una evaluación, dimensiona con precisión tus GPU con el configurador quelllm.fr o explora el catálogo completo para identificar el modelo más adecuado para tu presupuesto de VRAM y la licencia que buscas.