Skip to content
Respuestas

¿Qué es ARC-AGI-3?

ARC-AGI-3 es un test de la ARC Prize Foundation que comprueba si un agente de IA puede aprender una tarea que nunca ha visto: se le coloca en un pequeño juego por turnos, sin instrucciones y sin objetivo declarado, y se le puntúa por la eficiencia con la que descubre el juego en comparación con una persona. En el lanzamiento, en marzo de 2026, los humanos puntuaron 100 % y los modelos punteros, 0,51 %.

Qué pide el test en realidad

Los dos primeros tests ARC eran rompecabezas estáticos: unos ejemplos de una transformación de cuadrícula y luego una cuadrícula nueva que completar. Los modelos aprendieron a resolverlos. ARC-AGI-3, lanzado el 25 de marzo de 2026, cambia la forma de la pregunta. Al agente se le mete en uno de cientos de entornos por turnos, hechos a mano, y no se le dice nada — ni las reglas, ni qué cuenta como ganar, ni cuáles de sus acciones importan. Tiene que explorar, notar qué cambia cuando actúa, formar una teoría, planificar varios movimientos por delante y corregirse cuando la teoría falla.

La puntuación no es «¿terminó?», sino «¿con qué eficiencia aprendió?», medida frente a personas a las que se les dieron los mismos juegos sin preparación. Por eso la fundación escribe 100 % para los humanos y, en el lanzamiento, 0,51 % para los modelos punteros: modelos que aprueban exámenes de abogacía y escriben código que funciona no supieron descifrar un juego que un niño resuelve en unos minutos. La frase de la propia fundación: mientras exista esa brecha, no hay AGI — y hay dos millones de dólares en premios para quien la cierre.

La lección de los ajustes: cómo OpenAI triplicó su puntuación sin entrenar

En agosto de 2026 OpenAI informó de que había triplicado su puntuación en ARC-AGI-3 cambiando dos ajustes de inferencia — cómo se permite al modelo razonar sobre un problema — sin reentrenar y sin un modelo nuevo. La base era baja y el texto no afirma que el efecto se traslade a otras tareas; no es una historia sobre que ARC-AGI-3 esté resuelto.

Es una historia sobre los valores por defecto. La capacidad ya estaba dentro de un modelo por el que la gente pagaba, apagada por una configuración que nadie había revisado. Lo mismo pasa en despliegues corrientes: un bot de triaje de soporte o un asistente de borradores se juzga «insuficiente» con ajustes pensados para coste y velocidad, y nadie prueba las alternativas con trabajo real antes de decidir rehacer o abandonar.

Qué dice una puntuación a quien compra, y qué no

ARC-AGI-3 mide bien una cosa estrecha: aprender desde cero una tarea abstracta. No dice nada sobre si un modelo lee tus contratos con precisión, sigue un procedimiento de devoluciones de catorce pasos o sigue siendo educado en el ticket cuatrocientos del día. Son habilidades distintas, y modelos cercanos en ARC pueden estar muy lejos entre sí en ellas.

Así que lee las noticias sobre tests como leerías el informe de laboratorio de un coche: interesante, a veces decisivo, nunca un sustituto de la prueba de conducción. La única puntuación que importa para una compra es la medida en tus propias tareas, con tus propios datos, antes y después de un cambio. Es la prueba que hacemos en un diagnóstico — y la que la mayoría de los proveedores preferiría que no hicieras.

Preguntas relacionadas

¿En qué se diferencia ARC-AGI-3 de ARC-AGI-1 y ARC-AGI-2?
Los dos primeros son estáticos: un puñado de ejemplos y luego un rompecabezas que completar en una sola respuesta. ARC-AGI-3 es interactivo — el agente actúa dentro de un juego durante muchos turnos, descubre las reglas por sí mismo y se le puntúa por la eficiencia con la que aprende, no solo por si termina.
¿Quién dirige ARC-AGI-3?
La ARC Prize Foundation, una organización sin ánimo de lucro cofundada por François Chollet, creador del ARC original en 2019, y Mike Knoop, cofundador de Zapier. Publica el test, las referencias humanas y la competición con premios.
¿Una puntuación más alta en ARC-AGI-3 hace que un modelo sea mejor para mi empresa?
Por sí sola, no. El test mide aprendizaje abstracto en juegos desconocidos; una tarea de negocio es sobre todo trabajo conocido hecho con fiabilidad y en volumen. Prueba los modelos candidatos con una muestra de tus casos reales y compara los resultados — ese número se traslada; la puntuación del test, no.
¿Superar ARC-AGI-3 es lo mismo que la AGI?
La fundación dice con cuidado lo contrario: un 100 % significa que un agente iguala la eficiencia de aprendizaje humana en estos juegos, lo que trata como condición necesaria, no como prueba de inteligencia general.
Siguiente paso

Diagnóstico gratuito

El diagnóstico gratuito hace la prueba que se traslada: tus casos, tus datos, un número antes y después para cada modelo candidato.

Hacer el diagnóstico gratuito

Empieza al momento, en el navegador.

Precio
Gratis
Duración
15 minutos

La lista ordenada de candidatos se queda contigo en cualquier caso.