Daily Journal
Daily Journal

Claude Opus 5 atinge 96,2% no benchmark ARC-AGI-3

Desenvolvedor utiliza Claude Code para elevar a performance do modelo no teste de raciocínio lógico, superando a marca oficial de 30,2%.

Daily Journal
Foto: x.com
||
14/08 às 01:46

Pontos principais

  • O modelo Claude Opus 5 alcançou 96,2% de acurácia no benchmark ARC-AGI-3 utilizando a ferramenta Claude Code.
  • O desempenho superou significativamente o recorde oficial de 30,2% registrado em julho de 2026, quando o modelo operava sem execução de código.
  • O teste, conduzido pelo desenvolvedor Jeremy Berman, utilizou um ambiente sandbox offline com logs de arquivos e um comando de ação.
  • O sistema escreveu autonomamente 269 programas e cerca de 12.700 linhas de código para resolver os 25 ambientes do desafio.
  • A execução do teste teve um custo total de US$ 540 e o código-fonte foi disponibilizado publicamente em agosto de 2026.
  • O ARC-AGI-3 avalia a capacidade de modelos de IA em resolver tarefas inéditas que exigem raciocínio lógico e adaptação a novas regras.

O modelo Claude Opus 5 demonstrou um avanço expressivo em testes de raciocínio lógico ao atingir 96,2% de acurácia no benchmark ARC-AGI-3, superando a marca oficial de 30,2% divulgada anteriormente pela Anthropic e pelo ARC Prize. O resultado foi alcançado pelo desenvolvedor Jeremy Berman, que utilizou o ambiente Claude Code para permitir que a IA escrevesse e executasse seus próprios programas para resolver os desafios propostos, sem o uso de ferramentas específicas para o benchmark.

Durante o processo, o modelo gerou autonomamente mais de 12 mil linhas de código, incluindo simuladores e parsers, para interpretar e solucionar os 25 ambientes do teste. O experimento, realizado em um ambiente sandbox offline, reforça o debate sobre a capacidade de modelos de linguagem em realizar raciocínio autônomo e planejamento complexo quando integrados a ferramentas de execução, em contraste com avaliações que limitam a interação do modelo ao processamento de texto puro.

Comentários

Carregando comentários...