Daily Journal
Daily Journal

Modelos Gemini 3.8 Flash e Muse Spark 1.3 apresentam otimização em benchmarks

Análise aponta que novos modelos de IA tiveram desempenho superior apenas em testes específicos, sugerindo otimização direcionada.

Daily Journal
Foto: x.com
||
07/09 às 21:40

Pontos principais

  • Gemini 3.8 Flash e Muse Spark 1.3 igualam GPT-6 e Fable 5.1 no Terminal Bench 2.1.
  • Desempenho dos modelos cai significativamente ao serem submetidos ao Terminal Bench 4.0.
  • Relatório sugere que laboratórios usam dados de startups para mimetizar tarefas públicas.
  • Gemini 3.8 Flash apresenta sinais de otimização específica para o benchmark DeepSWE.

Relatório da SemiAnalysis indica que os modelos Gemini 3.8 Flash e Muse Spark 1.3 apresentam desempenho comparável ao GPT-6 e Fable 5.1 apenas no Terminal Bench 2.1. A performance dos modelos sofre queda expressiva quando testados no Terminal Bench 4.0, sugerindo que foram otimizados para pontuar em testes específicos. A análise aponta que laboratórios de IA estariam utilizando dados de startups de ambiente de reforço para mimetizar tarefas públicas de benchmarks. Além disso, o Gemini 3.8 Flash demonstra sinais de otimização direcionada para o benchmark DeepSWE.

Comentários

Carregando comentários...