GPT-6 Astra lidera benchmarks de IA com alta performance no ARC-AGI-3
O modelo GPT-6 Astra superou concorrentes no benchmark ARC-AGI-3, atingindo até 99,9% de precisão com novos métodos de adaptação.
Pontos principais
- O GPT-6 Astra registrou 62,7% de desempenho no ARC-AGI-3 com o harness padrão.
- Com um novo harness de adaptador de provedor, o modelo alcançou 99,9% de pontuação.
- O modelo superou significativamente o Claude Opus 5, que pontuou 30,2%, e o GPT-5.6 Sol, com 7,8%.
- Em testes no benchmark WANDR, o GPT-6 Astra obteve a pontuação de 0,682 com custo de US$ 11,98 por tarefa.
O modelo de linguagem GPT-6 Astra demonstrou um salto expressivo de desempenho em avaliações técnicas recentes, consolidando sua posição no mercado de inteligência artificial. No benchmark ARC-AGI-3, o modelo atingiu 62,7% de precisão utilizando o harness padrão e elevou sua performance para 99,9% ao operar com um novo harness de adaptador de provedor. Esses resultados superam amplamente os índices obtidos pelo Claude Opus 5, que registrou 30,2%, e pelo GPT-5.6 Sol, que marcou 7,8%.
Além do sucesso no ARC-AGI-3, o GPT-6 Astra também liderou o benchmark WANDR com uma pontuação de 0,682, mantendo um custo operacional de US$ 11,98 por tarefa. A capacidade do modelo em equilibrar eficiência de processamento e custo reforça o avanço tecnológico na arquitetura de LLMs, superando concorrentes diretos em métricas de eficiência e precisão lógica.
Comentários
Carregando comentários...
