En varios tipos de pregunta, sí. Este reto reúne 10 puntos ciegos clásicos de la IA: contar letras, supuestos escondidos, trampas matemáticas y un acertijo de patrón visual.
Los modelos de lenguaje como ChatGPT (GPT-4o) están entrenados para predecir el siguiente token de una secuencia, no para razonar desde cero. Eso los vuelve sorprendentemente malos en tareas que a una persona le parecen simples:
ARC-AGI (Abstraction and Reasoning Corpus for Artificial General Intelligence) lo diseñó François Chollet, pionero del aprendizaje profundo, como un benchmark de inteligencia general y no de conocimiento memorizado. Cada acertijo muestra unos pocos ejemplos de cuadrícula de entrada y salida, y tú tienes que deducir la regla para completar un caso nuevo.
Cuando salió ARC-AGI-2 en marzo de 2025, todos los modelos de frontera (GPT-4o, Claude 3.7, Gemini 2.0 Flash) sacaron entre 0 % y 1,3 %. El promedio humano es del 60 %. Solo con un andamiaje carísimo de múltiples intentos, que costaba entre 30 y 77 dólares por pregunta, los sistemas de IA se acercaron al nivel humano. El conjunto de datos de ARC-AGI se publica bajo licencia Apache 2.0 por la ARC Prize Foundation.
GPT-4o, sin razonamiento extendido, saca alrededor de 1/10 en las preguntas de este reto, según investigación publicada y casos de fallo ampliamente reportados entre 2024 y 2025. La única que acierta de forma fiable, la de los meses con 28 días, ya es tan conocida que aparece en sus datos de entrenamiento. En variantes nuevas del resto, la tasa de fallo va del 40 % al 100 %.
La mayoría de las personas que se toman su tiempo sacan entre 6 y 8 de 10. Lo más duro es el acertijo ARC y la adivinanza del retrato: hacen tropezar por igual a humanos y a máquinas, aunque por razones distintas.
Si quieres seguir, prueba el test de razonamiento abstracto, mira todas las herramientas gratis o vuelve a la página principal en español.
5 acertijos originales estilo ARC-AGI, el benchmark que deja clavada a la IA de frontera. Los humanos promedian 60 %. La IA base, ~0 %. Gratis.