Claude Opus 5 marca 30,2% no ARC-AGI-3 e quase quadruplica o recorde
Modelo da Anthropic custa US$5 e US$25 por milhão de tokens, metade do preço do Fable 5, e zerou cinco ambientes nunca antes vencidos.
Pontos principais
- A Anthropic lançou o Claude Opus 5 em 24 de julho de 2026, a US$5 por milhão de tokens de entrada e US$25 de saída.
- O preço é o mesmo do Opus 4.8 e metade do preço do Fable 5; o modelo virou o padrão do Claude Max.
- A ARC Prize, que aplicou o teste de forma independente, reportou 30,2% no ARC-AGI-3, contra o recorde anterior de 7,8% do GPT-5.6 Sol.
- O modelo marcou 100% em cinco ambientes que nenhum modelo havia vencido antes e igualou ou superou a eficiência humana em quatro deles.
- No ARC-AGI-1, marcou 97,5% a US$0,70 por tarefa; no ARC-AGI-2, 90,4% a US$2,06 por tarefa.
- A ARC Prize afirma ser a primeira equação de reflexão explícita já analisada em um modelo: "4_center = 2×axis − 5_center", na ação 23.
Dianne Penn, líder de produto da Anthropic, disse à Reuters que o modelo serve a tarefas diárias de escritório e programação. Nos testes internos, o Opus 5 mostrou-se menos capaz que o Fable 5 na exploração de vulnerabilidades cibernéticas, e por isso suas salvaguardas são menos restritivas; também se mostrou menos suscetível a ser induzido a usos indevidos que os outros modelos atuais da empresa.
A ARC Prize acrescentou uma ressalva ao resultado: o Opus 5 foi desenvolvido depois que o ARC-AGI-3 e seu formato se tornaram públicos, o que pode ter permitido à Anthropic mirar as habilidades e formatos do benchmark — embora não haja evidência de que a empresa tenha treinado nas tarefas exatas. Na análise da corrida, até a ação 248 o modelo havia generalizado a equação de reflexão para duas dimensões.
Comentários
Carregando comentários...
