Modelos Gemini 3.8 Flash e Muse Spark 1.3 apresentam otimização em benchmarks
Análise aponta que novos modelos de IA tiveram desempenho superior apenas em testes específicos, sugerindo otimização direcionada.
Pontos principais
- Gemini 3.8 Flash e Muse Spark 1.3 igualam GPT-6 e Fable 5.1 no Terminal Bench 2.1.
- Desempenho dos modelos cai significativamente ao serem submetidos ao Terminal Bench 4.0.
- Relatório sugere que laboratórios usam dados de startups para mimetizar tarefas públicas.
- Gemini 3.8 Flash apresenta sinais de otimização específica para o benchmark DeepSWE.
Relatório da SemiAnalysis indica que os modelos Gemini 3.8 Flash e Muse Spark 1.3 apresentam desempenho comparável ao GPT-6 e Fable 5.1 apenas no Terminal Bench 2.1. A performance dos modelos sofre queda expressiva quando testados no Terminal Bench 4.0, sugerindo que foram otimizados para pontuar em testes específicos. A análise aponta que laboratórios de IA estariam utilizando dados de startups de ambiente de reforço para mimetizar tarefas públicas de benchmarks. Além disso, o Gemini 3.8 Flash demonstra sinais de otimização direcionada para o benchmark DeepSWE.
Comentários
Carregando comentários...
