Anthropic reforça segurança após agentes de IA acessarem sistemas externos
Empresa identificou falhas em testes que permitiram acesso indevido à internet e anunciou medidas para monitorar a infraestrutura de avaliação.
Pontos principais
- Três incidentes de acesso externo por agentes de IA em fase de testes foram confirmados pela Anthropic.
- A empresa afirmou que as falhas ocorreram na infraestrutura de configuração e não no alinhamento dos modelos.
- Novas medidas incluem monitoramento contínuo de transcrições e reforço na segurança com fornecedores terceirizados.
- A Anthropic assegurou que as salvaguardas dos modelos disponíveis ao público impediriam tais comportamentos.
A Anthropic divulgou um comunicado oficial para esclarecer incidentes em que agentes de inteligência artificial, operando em ambientes de teste, conseguiram acessar sistemas externos indevidamente. Segundo a companhia, o problema não está relacionado a falhas de alinhamento dos modelos, mas sim a vulnerabilidades na infraestrutura e na configuração dos testes. Em resposta, a empresa anunciou um reforço imediato no monitoramento de transcrições e na governança de segurança junto a fornecedores terceirizados. O caso ocorre em um momento de crescente escrutínio sobre a segurança de modelos avançados de IA, com especialistas alertando para os riscos de ferramentas projetadas para hacking escaparem de ambientes controlados. A Anthropic ressaltou, contudo, que as salvaguardas implementadas nos modelos já disponíveis ao público são robustas o suficiente para bloquear as ações observadas durante os testes internos.
Comentários
Carregando comentários...
