---
title: "OpenAI retira recomendação do benchmark SWE-Bench Pro após auditoria"
url: https://dailyjournal.news/news/2026-07-08/openai-aponta-falhas-metodologicas-no-benchmark-swe-bench-pro
published: 2026-07-08T20:33:49.276341+00:00
updated: 2026-07-08T21:32:07.892+00:00
categories: ["technology"]
topics: ["inteligencia-artificial"]
source_count: 2
outlet_count: 2
language: pt-BR
publisher: "Daily Journal"
---

# OpenAI retira recomendação do benchmark SWE-Bench Pro após auditoria

A OpenAI identificou falhas em 30% das tarefas do SWE-Bench Pro e questiona a confiabilidade das métricas atuais de codificação para modelos de IA.

## Pontos principais

- A OpenAI realizou uma auditoria técnica no SWE-Bench Pro, ferramenta usada para avaliar a capacidade de codificação de modelos de IA.
- Cerca de 30% das tarefas do benchmark foram classificadas como problemáticas ou quebradas pela empresa.
- A companhia retirou oficialmente sua recomendação de uso do benchmark para testes de desempenho.
- O relatório aponta dificuldades em distinguir sinais reais de ruído em avaliações de engenharia de software.
- A empresa defende a necessidade de maior transparência e aprimoramento nos padrões de avaliação da indústria.

A OpenAI anunciou a retirada de sua recomendação oficial para o uso do SWE-Bench Pro, um dos principais benchmarks utilizados pela indústria para medir a capacidade de modelos de linguagem em resolver problemas complexos de engenharia de software. Após uma auditoria detalhada, a empresa constatou que aproximadamente 30% das tarefas contidas no conjunto de testes apresentam falhas, comprometendo a precisão dos resultados. O relatório destaca a dificuldade de separar sinais reais de ruído durante as avaliações, o que levanta questionamentos sobre a confiabilidade das métricas atuais. Segundo a OpenAI, a decisão visa incentivar a transparência e o desenvolvimento de padrões de avaliação mais rigorosos e eficazes para o setor. A medida reflete uma preocupação crescente com a integridade dos benchmarks utilizados para validar o progresso de modelos de IA no desenvolvimento de código.

## Fontes

- [OpenAI says it found widespread task issues in SWE-Bench Pro, estimates ~30% of tasks are broken, and retracts its earlier recommendation to adopt the benchmark (OpenAI)](https://www.techmeme.com/260708/p41#a260708p41) — Techmeme (2026-07-08)
- [Separating signal from noise in coding evaluations](https://openai.com/index/separating-signal-from-noise-coding-evaluations) — OpenAI (2026-07-08)

## Tópicos relacionados

- [Inteligência Artificial](https://dailyjournal.news/topics/inteligencia-artificial)

---

Publicado por Daily Journal. Versão HTML: https://dailyjournal.news/news/2026-07-08/openai-aponta-falhas-metodologicas-no-benchmark-swe-bench-pro
