Volver al Blog
Modelos de IA 30 de marzo de 2026 5 min read

ARC-AGI-3 Ofrece 2 Millones a Cualquier IA que Piense como un Humano — Todos los Modelos Punteros Quedan por Debajo del 1%

La ARC Prize Foundation acaba de publicar su benchmark más difícil: un test de razonamiento interactivo donde GPT-5.4, Claude Opus 4.6 y Gemini 3.1 Pro obtienen menos del 1%, mientras humanos sin entrenamiento alcanzan el 100%. El premio de 2 millones de dólares sigue sin reclamarse.

ARC-AGI-3 Ofrece 2 Millones a Cualquier IA que Piense como un Humano — Todos los Modelos Punteros Quedan por Debajo del 1%

La ARC Prize Foundation publicó ARC-AGI-3 el 25 de marzo y los resultados desinflan de golpe la narrativa sobre la AGI. Todos los modelos evaluados — GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro, Grok-4.20 — obtuvieron menos del 1%. Los humanos, sin ningún entrenamiento previo, alcanzan el 100%. El premio supera los dos millones de dólares. Nadie lo ha reclamado.

No se trata de un fallo de medición. Es una medición del fracaso.

ARC-AGI-3 rompe radicalmente con sus versiones anteriores. El benchmark original usaba puzzles de cuadrícula estáticos para evaluar el reconocimiento abstracto de patrones. La versión 3 abandona por completo las cuadrículas y sitúa a los agentes en entornos interactivos similares a videojuegos. No hay instrucciones. El agente debe observar su entorno, deducir las reglas, definir sus propios objetivos y resolver problemas que nunca ha visto. François Chollet, creador de ARC y director de la fundación, lo define como una prueba de inteligencia fluida: la capacidad de adaptar el razonamiento a situaciones genuinamente nuevas.

Los resultados concretos: Gemini 3.1 Pro Preview alcanzó el 0,37%; GPT-5.4 llegó al 0,26%; Claude Opus 4.6 consiguió un 0,25%; y Grok-4.20 obtuvo exactamente el 0,00%. Son modelos que superan el 90% en exámenes de barra, benchmarks de código y problemas científicos de nivel de posgrado. En ARC-AGI-3, son prácticamente indistinguibles del ruido estadístico.

Lo que vuelve este resultado especialmente revelador es que redes neuronales convolucionales simples y algoritmos de búsqueda en grafos alcanzan el 12,58% en el mismo benchmark. Sistemas con muchos menos parámetros y diseñados para tareas mucho más estrechas superan a los modelos de lenguaje más capaces del mundo en esta tarea específica. No es margen de error: es una señal estructural sobre lo que realmente aprenden las arquitecturas transformer al escalar.

La estructura del premio: 700.000 dólares para el primer agente que alcance el 100% en el conjunto de evaluación completo; tracks adicionales para los mejores resultados parciales y para las soluciones más eficientes. No se ha fijado límite de tiempo. Al ritmo actual, podría pasar un tiempo.

El diseño del benchmark resiste deliberadamente las prácticas de sobreoptimización que han corrompido evaluaciones anteriores. Como los entornos se generan de forma procedural y son interactivos, no existe un conjunto de entrenamiento que memorizar. Un agente que puntúa bien aquí no puede haber aprendido las respuestas de memoria. Tiene que razonar de verdad — o producir algo que funcione como razonamiento.

La industria de la IA tiene costumbre de mover los postes de la portería. Cuando se resolvió ARC-AGI-1, la respuesta fue que los benchmarks no miden lo que importa. ARC-AGI-3 hace ese argumento más difícil de sostener. Humanos sin preparación, sin pistas, sin fine-tuning, sin prompts de cadena de pensamiento, resuelven todos los entornos. Los sistemas de IA más potentes jamás construidos no superan el 1%.

Esa brecha es la frontera real. Todo lo demás es extrapolación.

ARC-AGI benchmarks AGI razonamiento