---
title: "MathArena atualiza benchmarks de IA após saturação pelo GPT-6 Astra"
url: https://dailyjournal.news/news/2026-09-17/matharena-atualiza-benchmarks-de-ia-apos-saturacao-pelo-gpt-6-astra
published: 2026-09-17T16:41:57.98689+00:00
updated: 2026-09-17T16:41:57.98689+00:00
categories: ["technology"]
source_count: 1
outlet_count: 0
language: pt-BR
publisher: "Daily Journal"
---

# MathArena atualiza benchmarks de IA após saturação pelo GPT-6 Astra

Com o GPT-6 Astra atingindo quase 100% de precisão, a MathArena reformulou seus testes de matemática para elevar o nível de dificuldade dos modelos.

## Pontos principais

- O GPT-6 Astra saturou as versões anteriores dos benchmarks ArXivMath e BrokenArXiv com taxas de 94% e 96%, respectivamente.
- Os novos testes de agosto de 2026 focam em conjecturas científicas refutadas ou resolvidas recentemente.
- Modelos agora são avaliados em seus harnesses nativos, como Codex e Claude Code, com acesso a ferramentas como Python e SageMath.
- O GPT-6 Astra mantém a liderança com 88% no ArXivMath e 81% no BrokenArXiv.
- O modelo Fable 5.1 ocupa a segunda posição, mas apresenta custos operacionais significativamente mais elevados.
- A avaliação do ArXivMath passou a utilizar um LLM-judge para verificar equivalência de respostas, substituindo scripts manuais.
- O BrokenArXiv adotou um sistema de pontuação de três níveis, exigindo que o modelo identifique explicitamente quando uma afirmação é falsa.

A MathArena anunciou uma atualização significativa em seus benchmarks de inteligência artificial, ArXivMath e BrokenArXiv, após o desempenho do GPT-6 Astra tornar as métricas anteriores obsoletas. Para manter a eficácia na avaliação de modelos de próxima geração, a organização implementou filtros de dificuldade mais rigorosos, priorizando problemas baseados em conjecturas científicas refutadas em artigos recentes publicados no arXiv.

Além da mudança no conteúdo, a metodologia de execução foi ajustada para refletir o uso real da tecnologia. Os modelos agora operam em ambientes Docker isolados, utilizando seus próprios harnesses nativos e ferramentas de computação como Python e SageMath. A MathArena também introduziu limites de custo e tempo para otimizar a análise, especialmente para modelos como o Fable 5.1, que demonstrou consumo excessivo de tokens durante o processamento.

O sistema de correção também foi modernizado para garantir maior precisão. No ArXivMath, um LLM-judge substituiu scripts de verificação baseados em SymPy, enquanto o BrokenArXiv passou a exigir que a IA identifique corretamente a falsidade de uma premissa para obter a pontuação máxima. Essas mudanças visam garantir que os benchmarks continuem servindo como um sinal confiável para o desenvolvimento de modelos de linguagem de grande escala.

## Fontes

- [MathArena atualiza benchmarks de IA após saturação pelo GPT-6 Astra](https://matharena.ai/arxiv_august/) (2026-09-17)

---

Publicado por Daily Journal. Versão HTML: https://dailyjournal.news/news/2026-09-17/matharena-atualiza-benchmarks-de-ia-apos-saturacao-pelo-gpt-6-astra
