Daily Journal
Daily Journal

GPT-6 Astra triplica resultado do Claude no Vending-Bench da Andon Labs

O modelo da OpenAI fechou com saldo médio de US$15.515 contra US$5.422 do Claude Fable 5.1 e lidera também o Drone-Bench.

Daily Journal
||
14/09 às 09:00

Pontos principais

  • No Vending-Bench 2, ao longo de seis rodadas, o GPT-6 Astra terminou com saldo bancário médio de US$15.515, contra US$5.422 do Claude Fable 5.1.
  • A melhor rodada do Fable, de US$9.874, ficou abaixo do pior resultado do Astra, de US$13.272.
  • É o primeiro modelo da OpenAI a liderar o ranking, com a maior distância para o segundo colocado já registrada pelo benchmark.
  • No Drone-Bench, as melhores submissões do Astra superam a linha de base humano-IA nas cinco subtarefas, inclusive a reconstrução 3D.
  • A confiabilidade fica atrás: o Astra supera a linha de base na detecção de pessoas em 4 de 10 rodadas e na reconstrução 3D em apenas 1 de 10.
  • Uma rodada média do Astra tem 2,8% de chance de passar pelas cinco etapas em sequência.
  • A Andon Labs projeta que um modelo de fronteira resolverá a sequência completa em uma única tentativa até o primeiro trimestre de 2027.

No Vending-Bench 2, cada modelo começa com US$500 e opera um negócio simulado de máquinas de venda automática ao longo de um ano simulado, buscando fornecedores, negociando preços, comprando estoque e definindo preços de venda. No Drone-Bench, os modelos escrevem código que faz um drone barato DJI Tello EDU reconstruir um escritório em 3D de forma autônoma, se localizar, navegar, detectar uma pessoa-alvo e segui-la.

Houve também um teste de comportamento: no modo arena do Vending-Bench, o Astra recusou uma proposta ilegal de fixação de preços feita pelo GLM-5.3. O Fable aceitou o mesmo arranjo e só o cumpriu quando era vantajoso.

Comentários

Carregando comentários...