O que é o ARC-AGI-3?
O ARC-AGI-3 é um teste da ARC Prize Foundation que verifica se um agente de IA consegue aprender uma tarefa que nunca viu: ele é colocado num pequeno jogo por turnos, sem instruções e sem objetivo declarado, e pontuado pela eficiência com que descobre o jogo em comparação com uma pessoa. No lançamento, em março de 2026, humanos marcaram 100 % e os modelos de ponta, 0,51 %.
O que o teste pede de fato
Os dois primeiros testes ARC eram quebra-cabeças estáticos: alguns exemplos de uma transformação de grade e, depois, uma grade nova para completar. Os modelos aprenderam a resolvê-los. O ARC-AGI-3, lançado em 25 de março de 2026, muda a forma da pergunta. O agente é colocado num de centenas de ambientes por turnos, feitos à mão, e não recebe nada — nem as regras, nem o que conta como vitória, nem quais de suas ações importam. Ele precisa explorar, perceber o que muda quando age, formar uma teoria, planejar vários lances à frente e corrigir-se quando a teoria falha.
A pontuação não é «terminou?», mas «com que eficiência aprendeu?», medida contra pessoas que receberam os mesmos jogos sem preparo. Por isso a fundação escreve 100 % para humanos e, no lançamento, 0,51 % para os modelos de ponta: modelos que passam em exames da ordem dos advogados e escrevem código funcional não conseguiram entender um jogo que uma criança resolve em poucos minutos. A frase da própria fundação: enquanto existir essa lacuna, não há AGI — e há dois milhões de dólares em prêmios para quem a fechar.
A lição das configurações: como a OpenAI triplicou sua pontuação sem treinar
Em agosto de 2026 a OpenAI relatou ter triplicado sua pontuação no ARC-AGI-3 mudando duas configurações de inferência — como o modelo é autorizado a raciocinar sobre um problema — sem retreinamento e sem modelo novo. A base era baixa, e o texto não afirma que o efeito se transfere a outras tarefas; não é uma história sobre o ARC-AGI-3 ter sido resolvido.
É uma história sobre padrões de fábrica. A capacidade já estava dentro de um modelo pelo qual as pessoas pagavam, desligada por uma configuração que ninguém tinha revisto. O mesmo acontece em implantações comuns: um robô de triagem de suporte ou um assistente de rascunhos é julgado «insuficiente» com configurações ajustadas para custo e velocidade, e ninguém testa as alternativas no trabalho real antes de decidir refazer ou desistir.
O que uma pontuação diz a quem compra, e o que não diz
O ARC-AGI-3 mede bem uma coisa estreita: aprender do zero uma tarefa abstrata. Não diz nada sobre se um modelo lê seus contratos com precisão, segue um procedimento de devolução em catorze passos ou continua educado no quadringentésimo chamado do dia. São habilidades diferentes, e modelos próximos no ARC podem estar longe uns dos outros nelas.
Leia as notícias de testes como leria o laudo de laboratório de um carro: interessante, às vezes decisivo, nunca um substituto do test-drive. A única pontuação que importa para uma compra é a medida nas suas próprias tarefas, com os seus próprios dados, antes e depois de uma mudança. É o teste que fazemos num diagnóstico — e o que a maioria dos fornecedores preferiria que você não fizesse.
Perguntas relacionadas
- Qual a diferença entre o ARC-AGI-3 e o ARC-AGI-1 e o ARC-AGI-2?
- Os dois primeiros são estáticos: um punhado de exemplos e, depois, um quebra-cabeça para completar numa única resposta. O ARC-AGI-3 é interativo — o agente age dentro de um jogo por muitos turnos, descobre as regras sozinho e é pontuado pela eficiência com que aprende, não só por terminar.
- Quem conduz o ARC-AGI-3?
- A ARC Prize Foundation, uma organização sem fins lucrativos cofundada por François Chollet, criador do ARC original em 2019, e Mike Knoop, cofundador da Zapier. Ela publica o teste, as referências humanas e a competição com prêmios.
- Uma pontuação maior no ARC-AGI-3 torna um modelo melhor para a minha empresa?
- Por si só, não. O teste mede aprendizado abstrato em jogos desconhecidos; uma tarefa de negócio é sobretudo trabalho conhecido feito com confiabilidade e em volume. Teste os modelos candidatos numa amostra dos seus casos reais e compare os resultados — esse número se transfere; a pontuação do teste, não.
- Passar no ARC-AGI-3 é o mesmo que AGI?
- A fundação diz com cuidado o contrário: 100 % significa que um agente iguala a eficiência de aprendizado humana nesses jogos, o que ela trata como condição necessária, não como prova de inteligência geral.
Relacionado
Diagnóstico gratuito
O diagnóstico gratuito faz o teste que se transfere: seus casos, seus dados, um número antes e depois para cada modelo candidato.
Fazer o diagnóstico gratuitoComeça na hora, no navegador.
- Preço
- Grátis
- Duração
- 15 minutos
A lista ordenada de candidatos fica com você de qualquer jeito.