Daily Journal
Daily Journal

Claude Opus 5 marca 30,2% no ARC-AGI-3 e quase quadruplica o recorde

Modelo da Anthropic custa US$5 e US$25 por milhão de tokens, metade do preço do Fable 5, e zerou cinco ambientes nunca antes vencidos.

Daily Journal
Foto: x.com
||
27/07 às 09:00

Pontos principais

  • A Anthropic lançou o Claude Opus 5 em 24 de julho de 2026, a US$5 por milhão de tokens de entrada e US$25 de saída.
  • O preço é o mesmo do Opus 4.8 e metade do preço do Fable 5; o modelo virou o padrão do Claude Max.
  • A ARC Prize, que aplicou o teste de forma independente, reportou 30,2% no ARC-AGI-3, contra o recorde anterior de 7,8% do GPT-5.6 Sol.
  • O modelo marcou 100% em cinco ambientes que nenhum modelo havia vencido antes e igualou ou superou a eficiência humana em quatro deles.
  • No ARC-AGI-1, marcou 97,5% a US$0,70 por tarefa; no ARC-AGI-2, 90,4% a US$2,06 por tarefa.
  • A ARC Prize afirma ser a primeira equação de reflexão explícita já analisada em um modelo: "4_center = 2×axis − 5_center", na ação 23.

Dianne Penn, líder de produto da Anthropic, disse à Reuters que o modelo serve a tarefas diárias de escritório e programação. Nos testes internos, o Opus 5 mostrou-se menos capaz que o Fable 5 na exploração de vulnerabilidades cibernéticas, e por isso suas salvaguardas são menos restritivas; também se mostrou menos suscetível a ser induzido a usos indevidos que os outros modelos atuais da empresa.

A ARC Prize acrescentou uma ressalva ao resultado: o Opus 5 foi desenvolvido depois que o ARC-AGI-3 e seu formato se tornaram públicos, o que pode ter permitido à Anthropic mirar as habilidades e formatos do benchmark — embora não haja evidência de que a empresa tenha treinado nas tarefas exatas. Na análise da corrida, até a ação 248 o modelo havia generalizado a equação de reflexão para duas dimensões.

Comentários

Carregando comentários...