---
title: "Claude Opus 5 atinge 96,2% no benchmark ARC-AGI-3"
url: https://dailyjournal.news/news/2026-08-14/claude-opus-5-atinge-962-no-benchmark-arc-agi-3
published: 2026-08-14T04:46:46.313605+00:00
updated: 2026-08-14T04:46:46.313605+00:00
categories: ["technology"]
source_count: 1
outlet_count: 0
language: pt-BR
publisher: "Daily Journal"
---

# Claude Opus 5 atinge 96,2% no benchmark ARC-AGI-3

Desenvolvedor utiliza Claude Code para elevar a performance do modelo no teste de raciocínio lógico, superando a marca oficial de 30,2%.

## Pontos principais

- O modelo Claude Opus 5 alcançou 96,2% de acurácia no benchmark ARC-AGI-3 utilizando a ferramenta Claude Code.
- O desempenho superou significativamente o recorde oficial de 30,2% registrado em julho de 2026, quando o modelo operava sem execução de código.
- O teste, conduzido pelo desenvolvedor Jeremy Berman, utilizou um ambiente sandbox offline com logs de arquivos e um comando de ação.
- O sistema escreveu autonomamente 269 programas e cerca de 12.700 linhas de código para resolver os 25 ambientes do desafio.
- A execução do teste teve um custo total de US$ 540 e o código-fonte foi disponibilizado publicamente em agosto de 2026.
- O ARC-AGI-3 avalia a capacidade de modelos de IA em resolver tarefas inéditas que exigem raciocínio lógico e adaptação a novas regras.

O modelo Claude Opus 5 demonstrou um avanço expressivo em testes de raciocínio lógico ao atingir 96,2% de acurácia no benchmark ARC-AGI-3, superando a marca oficial de 30,2% divulgada anteriormente pela Anthropic e pelo ARC Prize. O resultado foi alcançado pelo desenvolvedor Jeremy Berman, que utilizou o ambiente Claude Code para permitir que a IA escrevesse e executasse seus próprios programas para resolver os desafios propostos, sem o uso de ferramentas específicas para o benchmark.

Durante o processo, o modelo gerou autonomamente mais de 12 mil linhas de código, incluindo simuladores e parsers, para interpretar e solucionar os 25 ambientes do teste. O experimento, realizado em um ambiente sandbox offline, reforça o debate sobre a capacidade de modelos de linguagem em realizar raciocínio autônomo e planejamento complexo quando integrados a ferramentas de execução, em contraste com avaliações que limitam a interação do modelo ao processamento de texto puro.

## Fontes

- [Claude Opus 5 atinge 96,2% no benchmark ARC-AGI-3](https://x.com/jeremyberman/status/2087633198822117446) (2026-08-14)

---

Publicado por Daily Journal. Versão HTML: https://dailyjournal.news/news/2026-08-14/claude-opus-5-atinge-962-no-benchmark-arc-agi-3
