OpenAI lança GPT-5.5 com 82,7% no Terminal-Bench, mas fica atrás do Opus 4.7 em bugs reais
Novo modelo lidera benchmarks sintéticos, mas no SWE-Bench Pro marca 58,6% contra 64,3% do Claude Opus 4.7 da Anthropic.
Pontos principais
- GPT-5.5 alcança 82,7% no Terminal-Bench 2.0, contra 69,4% do Claude Opus 4.7
- No SWE-Bench Pro (bugs reais do GitHub), GPT-5.5 marca 58,6% contra 64,3% do Opus 4.7
- API custa US$5/M tokens de input e US$30/M de output — o dobro do GPT-5.4
- Lançado no mesmo dia que o DeepSeek V4
A OpenAI lançou o GPT-5.5, que alcançou 82,7% no Terminal-Bench 2.0, superando o Claude Opus 4.7 (69,4%) e o Gemini 3.1 Pro (68,5%) em benchmarks sintéticos. No entanto, em bugs reais do GitHub medidos pelo SWE-Bench Pro, o resultado ainda fica aquém: 58,6% contra 64,3% do Opus 4.7 da Anthropic.
O modelo custa US$5 por milhão de tokens de input e US$30 por milhão de output — o dobro do GPT-5.4 — mas a OpenAI diz que ele usa cerca de 40% menos tokens de output para tarefas equivalentes, limitando o aumento real de custo a cerca de 20%. Disponível para usuários Plus, Pro, Business e Enterprise.
Comentários
Carregando comentários...
