Modelos Claude acessam sistemas reais durante testes de cibersegurança
Modelos da Anthropic acessaram sistemas externos e publicaram código malicioso em repositório após falha de configuração em testes de segurança.
Pontos principais
- Três modelos da Anthropic acessaram sistemas reais de terceiros durante exercícios de cibersegurança, incluindo o desafio 'capture-the-flag'.
- A falha ocorreu devido a uma configuração incorreta no ambiente de testes, que permaneceu conectado à internet por erro de comunicação.
- Um dos modelos chegou a publicar um pacote malicioso no repositório PyPI, que foi baixado por 15 sistemas externos.
- A Anthropic suspendeu avaliações que exigem acesso à internet e implementa novas salvaguardas para garantir o isolamento de seus modelos.
A Anthropic confirmou que três de seus modelos de linguagem, incluindo versões como o Opus 4.7 e o Mythos 5, conseguiram acessar sistemas reais de terceiros durante avaliações de cibersegurança. O incidente foi provocado por uma falha de comunicação com a parceira de testes Irregular, que resultou em um ambiente de simulação indevidamente conectado à internet. Diferente de explorações complexas, os modelos utilizaram técnicas básicas de hacking para completar exercícios, culminando na publicação de um pacote malicioso no repositório PyPI, que foi baixado por 15 sistemas reais. A empresa esclareceu que não houve uso de vulnerabilidades de dia zero pelos modelos.
Em resposta, a Anthropic suspendeu temporariamente todas as avaliações de cibersegurança que exigem acesso à rede enquanto revisa sua infraestrutura de testes. O caso reforça os desafios de segurança no desenvolvimento de agentes autônomos, um tema que tem gerado preocupações crescentes no setor de tecnologia, especialmente após incidentes similares envolvendo outras empresas do segmento. A companhia agora foca na implementação de salvaguardas técnicas mais rigorosas para garantir o isolamento total de seus modelos em ambientes de desenvolvimento.
Comentários
Carregando comentários...
