Claude Opus 5 atinge 96,2% no benchmark ARC-AGI-3
Desenvolvedor utiliza Claude Code para elevar a performance do modelo no teste de raciocínio lógico, superando a marca oficial de 30,2%.
Pontos principais
- O modelo Claude Opus 5 alcançou 96,2% de acurácia no benchmark ARC-AGI-3 utilizando a ferramenta Claude Code.
- O desempenho superou significativamente o recorde oficial de 30,2% registrado em julho de 2026, quando o modelo operava sem execução de código.
- O teste, conduzido pelo desenvolvedor Jeremy Berman, utilizou um ambiente sandbox offline com logs de arquivos e um comando de ação.
- O sistema escreveu autonomamente 269 programas e cerca de 12.700 linhas de código para resolver os 25 ambientes do desafio.
- A execução do teste teve um custo total de US$ 540 e o código-fonte foi disponibilizado publicamente em agosto de 2026.
- O ARC-AGI-3 avalia a capacidade de modelos de IA em resolver tarefas inéditas que exigem raciocínio lógico e adaptação a novas regras.
O modelo Claude Opus 5 demonstrou um avanço expressivo em testes de raciocínio lógico ao atingir 96,2% de acurácia no benchmark ARC-AGI-3, superando a marca oficial de 30,2% divulgada anteriormente pela Anthropic e pelo ARC Prize. O resultado foi alcançado pelo desenvolvedor Jeremy Berman, que utilizou o ambiente Claude Code para permitir que a IA escrevesse e executasse seus próprios programas para resolver os desafios propostos, sem o uso de ferramentas específicas para o benchmark.
Durante o processo, o modelo gerou autonomamente mais de 12 mil linhas de código, incluindo simuladores e parsers, para interpretar e solucionar os 25 ambientes do teste. O experimento, realizado em um ambiente sandbox offline, reforça o debate sobre a capacidade de modelos de linguagem em realizar raciocínio autônomo e planejamento complexo quando integrados a ferramentas de execução, em contraste com avaliações que limitam a interação do modelo ao processamento de texto puro.
Comentários
Carregando comentários...
