Daily Journal
Daily Journal

Claude Mythos é a primeira IA a concluir os dois testes de ciberataque do governo britânico

Modelo da Anthropic resolveu o cenário de 32 passos em 6 de 10 tentativas, à frente do GPT-5.5.

Daily Journal
||
14/05 às 09:00

Pontos principais

  • Versão de pré-lançamento do Claude Mythos concluiu os dois ambientes de ciberataque simulado do AISI
  • Resolveu o cenário 'The Last Ones', de 32 passos, em 6 de 10 tentativas
  • GPT-5.5 fez o mesmo cenário em 3 de 10 e não terminou o segundo ambiente
  • Duração das tarefas de cibersegurança vem dobrando a cada 4,7 meses
  • Cada modelo recebe orçamento de até 100 milhões de tokens por tentativa

Uma versão de pré-lançamento do Claude Mythos, modelo da Anthropic, tornou-se a primeira IA a concluir os dois ambientes de ciberataque simulado do AI Security Institute do Reino Unido, que reproduzem ataques a pequenas redes corporativas sem defesa. O modelo resolveu o cenário de 32 passos, 'The Last Ones', em 6 de 10 tentativas, e o ambiente de tecnologia operacional 'Cooling Tower', até então não resolvido, em 3 de 10. O GPT-5.5, da OpenAI, fez o primeiro cenário em 3 de 10 e não terminou o segundo.

O instituto estima que a duração das tarefas de cibersegurança que esses modelos conseguem executar vem dobrando a cada 4,7 meses, uma aceleração frente à estimativa de 8 meses feita em novembro de 2025.

Comentários

Carregando comentários...