ARC-AGI-3 abandona puzzles e LLMs de fronteira não passam de 1%
Novo benchmark interativo exige que agentes descubram regras sem instrução; CNNs simples alcançam 12,58% enquanto humanos mantêm 100%.
Pontos principais
- ARC-AGI-3 lançado em 25 de março com ambientes interativos em vez de puzzles estáticos
- GPT-5, Claude e Gemini marcaram menos de 1% no novo benchmark
- CNNs simples e busca em grafos alcançaram 12,58%; humanos mantêm 100%
- Mais de $2 milhões em prêmios, com $700 mil para quem atingir 100%
- Benchmark contém mais de 1.000 níveis em 150+ ambientes feitos à mão
O ARC-AGI-3, lançado em 25 de março, representa a transformação mais radical do benchmark desde sua criação por François Chollet em 2019. Em vez de puzzles estáticos em grade, agentes entram em ambientes interativos de 64x64 pixels com 16 cores e precisam descobrir regras, definir objetivos e resolver problemas sem instrução alguma.
Os resultados iniciais expõem uma lacuna brutal: LLMs de fronteira como GPT-5 e Claude ficaram abaixo de 1%, enquanto abordagens simples com CNNs e busca em grafos chegaram a 12,58%. Humanos mantêm 100%. O benchmark mede inteligência ao longo do tempo — horizontes de planejamento, compressão de memória e capacidade de atualizar crenças diante de novas evidências.
Comentários
Carregando comentários...
