Claude Fable 5 lidera benchmark de codificação autônoma MirrorCode
O modelo Fable 5 da Anthropic atingiu 64% de taxa de sucesso no MirrorCode, superando modelos da OpenAI em testes de programação de alta complexidade.
Pontos principais
- O benchmark MirrorCode avalia a capacidade de agentes de IA reimplementarem softwares complexos do zero sem acesso ao código-fonte.
- A atualização de agosto de 2026 focou em 15 programas de níveis Médio e Grande, utilizando as linguagens Go e Ada.
- O Claude Fable 5 obteve 64% de aproveitamento, destacando-se pela baixa variação de desempenho entre linguagens populares e raras.
- Modelos da OpenAI como o GPT-5.6 Sol (20%), GPT-5.4 (16%) e GPT-5.5 (10%) registraram pontuações inferiores na nova configuração.
- A queda de desempenho do GPT-5.5 em relação ao paper de junho deve-se à remoção de tarefas fáceis e à obrigatoriedade da linguagem Ada.
- O Fable 5 foi o primeiro modelo a resolver tarefas complexas como o pré-processador C e a linguagem Pkl sob os critérios rigorosos do leaderboard.
- Cada tarefa no benchmark permite um orçamento de até 10 bilhões de tokens por tentativa, testando a resiliência de longo prazo dos modelos.
A Epoch AI e a METR atualizaram o leaderboard do MirrorCode em 3 de agosto de 2026, revelando um novo patamar de desempenho para agentes de IA em tarefas de engenharia de software autônoma. O Claude Fable 5, da Anthropic, destacou-se ao atingir 64% de sucesso, superando significativamente os modelos da OpenAI. A avaliação atual é considerada mais rigorosa que a apresentada no paper de junho, pois exclui programas simples e exige a implementação em Ada, uma linguagem com corpus de treinamento reduzido, forçando os modelos a demonstrarem maior capacidade de generalização.
O desempenho do Fable 5 evidencia uma evolução na capacidade das IAs de manterem a coerência arquitetural em projetos complexos, como a reimplementação do pré-processador C e da linguagem Pkl da Apple. Segundo a Epoch AI, a disparidade entre os resultados anteriores e atuais não indica uma regressão técnica dos modelos, mas reflete a dificuldade acrescida do novo formato, que elimina atalhos baseados em memorização e testa a habilidade de depuração e raciocínio lógico em cenários de longo horizonte.
Comentários
Carregando comentários...
