---
title: "Claude Opus 5 conclui 61,7% de tarefas de comércio em benchmark da Accio"
url: https://dailyjournal.news/news/2026-10-10/alibabacom-cria-benchmark-para-medir-eficacia-de-ia-no-e-commerce
published: 2026-10-10T12:51:00.28606+00:00
updated: 2026-10-10T12:51:06.388+00:00
categories: ["technology"]
source_count: 2
outlet_count: 0
language: pt-BR
publisher: "Daily Journal"
---

# Claude Opus 5 conclui 61,7% de tarefas de comércio em benchmark da Accio

Claude Opus 5 lidera o Commerce Agent Bench da equipe Accio, e a maioria dos 13 modelos testados fica abaixo de 50% no ambiente Accio.

## Pontos principais

- O benchmark tem 107 tarefas: 53 de linha de comando, 28 de navegador, 16 com arquivos e 10 com APIs ou MCP.
- Claude Opus 5 conclui 66 tarefas (61,7%) no ambiente Accio, 65 (60,7%) no Pi e 60 (56,1%) no OpenClaw.
- Claude Opus 4.8 conclui 59 tarefas (55,1%) no ambiente Accio, o segundo melhor resultado; o GPT-5.5 conclui 48 (44,9%).
- Gemini 3 Flash tem o resultado mais baixo nos três ambientes, com 31 tarefas (29,0%).
- Claude Opus 5 usa em média 3,69 milhões de tokens por tarefa no ambiente Accio.

A equipe Accio, da Alibaba International, divisão internacional do grupo chinês Alibaba, publicou o Commerce Agent Bench, de fluxos de negócio de longo prazo. Cada tarefa roda em um container novo, com serviços simulados de SaaS, comércio e mensageria, e é avaliada por um verificador próprio.

Uma tarefa só conta como concluída quando todas as verificações obrigatórias passam; nas verificações assistidas por modelo, o juiz é o gemini-3.1-pro-preview. Os dados brutos das execuções ainda não têm URLs imutáveis nem checksums, então a Accio apresenta o quadro como um agregado auditado, e não como pacote para reproduzir o teste.

## Fontes

- [张阔 em 硅谷101播客: E255｜模型越来越强，为什么用户没感觉？再访阿里国际站总裁张阔](https://www.youtube.com/watch?v=Fhx_qNS2P8g&t=264s&q=d82db22f) (2026-10-09)
- [张阔 em 硅谷101播客: E255｜模型越来越强，为什么用户没感觉？再访阿里国际站总裁张阔](https://www.youtube.com/watch?v=Fhx_qNS2P8g&t=1310s&q=8065a497) (2026-10-09)

---

Publicado por Daily Journal. Versão HTML: https://dailyjournal.news/news/2026-10-10/alibabacom-cria-benchmark-para-medir-eficacia-de-ia-no-e-commerce
