Daily Journal
Daily Journal

MathArena atualiza benchmarks de IA após saturação pelo GPT-6 Astra

Com o GPT-6 Astra atingindo quase 100% de precisão, a MathArena reformulou seus testes de matemática para elevar o nível de dificuldade dos modelos.

Daily Journal
||
17/09 às 13:41

Pontos principais

  • O GPT-6 Astra saturou as versões anteriores dos benchmarks ArXivMath e BrokenArXiv com taxas de 94% e 96%, respectivamente.
  • Os novos testes de agosto de 2026 focam em conjecturas científicas refutadas ou resolvidas recentemente.
  • Modelos agora são avaliados em seus harnesses nativos, como Codex e Claude Code, com acesso a ferramentas como Python e SageMath.
  • O GPT-6 Astra mantém a liderança com 88% no ArXivMath e 81% no BrokenArXiv.
  • O modelo Fable 5.1 ocupa a segunda posição, mas apresenta custos operacionais significativamente mais elevados.
  • A avaliação do ArXivMath passou a utilizar um LLM-judge para verificar equivalência de respostas, substituindo scripts manuais.
  • O BrokenArXiv adotou um sistema de pontuação de três níveis, exigindo que o modelo identifique explicitamente quando uma afirmação é falsa.

A MathArena anunciou uma atualização significativa em seus benchmarks de inteligência artificial, ArXivMath e BrokenArXiv, após o desempenho do GPT-6 Astra tornar as métricas anteriores obsoletas. Para manter a eficácia na avaliação de modelos de próxima geração, a organização implementou filtros de dificuldade mais rigorosos, priorizando problemas baseados em conjecturas científicas refutadas em artigos recentes publicados no arXiv.

Além da mudança no conteúdo, a metodologia de execução foi ajustada para refletir o uso real da tecnologia. Os modelos agora operam em ambientes Docker isolados, utilizando seus próprios harnesses nativos e ferramentas de computação como Python e SageMath. A MathArena também introduziu limites de custo e tempo para otimizar a análise, especialmente para modelos como o Fable 5.1, que demonstrou consumo excessivo de tokens durante o processamento.

O sistema de correção também foi modernizado para garantir maior precisão. No ArXivMath, um LLM-judge substituiu scripts de verificação baseados em SymPy, enquanto o BrokenArXiv passou a exigir que a IA identifique corretamente a falsidade de uma premissa para obter a pontuação máxima. Essas mudanças visam garantir que os benchmarks continuem servindo como um sinal confiável para o desenvolvimento de modelos de linguagem de grande escala.

Comentários

Carregando comentários...