Claude Opus 5 conclui 61,7% de tarefas de comércio em benchmark da Accio
Claude Opus 5 lidera o Commerce Agent Bench da equipe Accio, e a maioria dos 13 modelos testados fica abaixo de 50% no ambiente Accio.
Pontos principais
- O benchmark tem 107 tarefas: 53 de linha de comando, 28 de navegador, 16 com arquivos e 10 com APIs ou MCP.
- Claude Opus 5 conclui 66 tarefas (61,7%) no ambiente Accio, 65 (60,7%) no Pi e 60 (56,1%) no OpenClaw.
- Claude Opus 4.8 conclui 59 tarefas (55,1%) no ambiente Accio, o segundo melhor resultado; o GPT-5.5 conclui 48 (44,9%).
- Gemini 3 Flash tem o resultado mais baixo nos três ambientes, com 31 tarefas (29,0%).
- Claude Opus 5 usa em média 3,69 milhões de tokens por tarefa no ambiente Accio.
A equipe Accio, da Alibaba International, divisão internacional do grupo chinês Alibaba, publicou o Commerce Agent Bench, de fluxos de negócio de longo prazo. Cada tarefa roda em um container novo, com serviços simulados de SaaS, comércio e mensageria, e é avaliada por um verificador próprio.
Uma tarefa só conta como concluída quando todas as verificações obrigatórias passam; nas verificações assistidas por modelo, o juiz é o gemini-3.1-pro-preview. Os dados brutos das execuções ainda não têm URLs imutáveis nem checksums, então a Accio apresenta o quadro como um agregado auditado, e não como pacote para reproduzir o teste.
Cobertura da mídia
Comentários
Carregando comentários...
