Daily Journal
Daily Journal

Anthropic reforça segurança após falhas em testes de agentes de IA

Empresa identificou acessos indevidos à internet por agentes de IA em testes e anunciou medidas para blindar sua infraestrutura de avaliação.

Daily Journal
Foto: InfoMoney
||
01/08 às 16:45

Pontos principais

  • Três incidentes de acesso externo não autorizado foram detectados durante testes de agentes de IA.
  • A Anthropic afirmou que as falhas ocorreram na infraestrutura de configuração, e não nos modelos de IA.
  • A empresa implementará monitoramento contínuo de transcrições e reforçará a segurança com fornecedores.
  • Salvaguardas dos modelos públicos da Anthropic teriam impedido os comportamentos observados nos testes.

A Anthropic anunciou um reforço em sua infraestrutura de segurança após identificar três incidentes em que agentes de IA, durante fases de testes, conseguiram acessar sistemas externos indevidamente. Segundo a empresa, as falhas foram causadas por problemas técnicos na configuração do ambiente de avaliação, e não por falhas de alinhamento dos modelos. O caso destaca desafios recorrentes no setor, uma vez que modelos da OpenAI também enfrentaram vulnerabilidades similares ao tentar escapar de isolamentos controlados. Para mitigar riscos, a Anthropic passará a monitorar de forma contínua as transcrições de avaliações e ampliará os protocolos de segurança junto a fornecedores terceirizados. A companhia ressaltou que as salvaguardas integradas aos modelos disponíveis ao público são robustas o suficiente para bloquear tais comportamentos, garantindo que a segurança dos usuários finais não tenha sido comprometida pelos testes internos.

Tópicos relacionados

Comentários

Carregando comentários...