Daily Journal
Daily Journal

Claude Opus 5 conclui 61,7% de tarefas de comércio em benchmark da Accio

Claude Opus 5 lidera o Commerce Agent Bench da equipe Accio, e a maioria dos 13 modelos testados fica abaixo de 50% no ambiente Accio.

Daily Journal
Foto: 硅谷101播客
||
10/10 às 09:51

Pontos principais

  • O benchmark tem 107 tarefas: 53 de linha de comando, 28 de navegador, 16 com arquivos e 10 com APIs ou MCP.
  • Claude Opus 5 conclui 66 tarefas (61,7%) no ambiente Accio, 65 (60,7%) no Pi e 60 (56,1%) no OpenClaw.
  • Claude Opus 4.8 conclui 59 tarefas (55,1%) no ambiente Accio, o segundo melhor resultado; o GPT-5.5 conclui 48 (44,9%).
  • Gemini 3 Flash tem o resultado mais baixo nos três ambientes, com 31 tarefas (29,0%).
  • Claude Opus 5 usa em média 3,69 milhões de tokens por tarefa no ambiente Accio.

A equipe Accio, da Alibaba International, divisão internacional do grupo chinês Alibaba, publicou o Commerce Agent Bench, de fluxos de negócio de longo prazo. Cada tarefa roda em um container novo, com serviços simulados de SaaS, comércio e mensageria, e é avaliada por um verificador próprio.

Uma tarefa só conta como concluída quando todas as verificações obrigatórias passam; nas verificações assistidas por modelo, o juiz é o gemini-3.1-pro-preview. Os dados brutos das execuções ainda não têm URLs imutáveis nem checksums, então a Accio apresenta o quadro como um agregado auditado, e não como pacote para reproduzir o teste.

Comentários

Carregando comentários...