Daily Journal
Daily Journal

Kimi K3 lidera benchmarks de modelos abertos no ARC-AGI

O modelo Kimi K3, da Moonshot AI, estabeleceu novos recordes de desempenho em testes de raciocínio ARC-AGI, superando modelos open-weight anteriores.

Daily Journal
||
01/08 às 21:43

Pontos principais

  • O Kimi K3 atingiu 94,5% no ARC-AGI-1 e 60,4% no ARC-AGI-2, tornando-se o modelo open-weight com maior pontuação nos benchmarks.
  • O custo por tarefa para o desempenho máximo registrado foi de US$ 0,77 no ARC-AGI-1 e US$ 1,59 no ARC-AGI-2.
  • O modelo, lançado pela chinesa Moonshot AI, possui 2,8 trilhões de parâmetros e foca em raciocínio e resolução de tarefas complexas.
  • Autoridades dos EUA investigam a empresa por suposto uso de chips Nvidia sob controle de exportação e destilação de dados de modelos da Anthropic.
  • A Moonshot AI firmou um acordo de infraestrutura com o Alibaba Group para garantir acesso a cerca de 20 mil chips Nvidia.

O Kimi K3, modelo de pesos abertos da Moonshot AI, consolidou-se como uma referência em capacidade de raciocínio ao liderar os testes do ARC Prize. Com pontuações de 94,5% no ARC-AGI-1 e 60,4% no ARC-AGI-2, o modelo superou o desempenho de outros sistemas open-weight, demonstrando eficiência na resolução de quebra-cabeças estáticos e adaptação a novos ambientes sem instruções de linguagem natural. O desempenho técnico, contudo, ocorre em meio a um cenário de tensões geopolíticas e disputas sobre propriedade intelectual. O governo dos Estados Unidos apura denúncias de que a Moonshot AI teria contornado controles de exportação para obter servidores Nvidia GB300 e utilizado técnicas de destilação industrial a partir de modelos da Anthropic para treinar o K3. A empresa também reforçou sua capacidade computacional por meio de uma parceria estratégica com o Alibaba Group, garantindo acesso a uma infraestrutura de 20 mil chips Nvidia, enquanto pesquisadores da área debatem a origem da eficiência do modelo.

Tópicos relacionados

Comentários

Carregando comentários...