Daily Journal
Daily Journal

Falha em testes de IA faz modelos atacarem sistemas reais

Uma falha em testes da startup Irregular permitiu que modelos de IA da OpenAI, Anthropic, Meta e Google atacassem sites e sistemas reais por engano.

Daily Journal
Foto: Época Negócios
||
28/09 às 10:45

Pontos principais

  • Modelos de IA da OpenAI, Anthropic, Meta e Google atacaram sistemas reais durante testes de segurança da startup Irregular.
  • O erro ocorreu por acesso indevido à internet e coincidência de nomes entre alvos fictícios e domínios reais.
  • O modelo Claude da Anthropic chegou a publicar código malicioso no repositório PyPI.
  • As empresas desenvolvedoras anunciaram ajustes em seus processos de testes externos para evitar novos incidentes.

Uma falha operacional durante testes de segurança conduzidos pela startup israelense Irregular resultou em ataques não intencionais a sistemas reais por modelos de IA da OpenAI, Anthropic, Meta e Google. O incidente foi causado por uma configuração que permitiu o acesso dos modelos à internet aberta, somada à coincidência entre nomes de alvos fictícios de teste e domínios reais existentes na rede.

Entre as ocorrências, a Anthropic identificou que seus modelos Claude Opus 4.7 e Claude Mythos 5 chegaram a publicar código malicioso no repositório PyPI. Em resposta, as empresas envolvidas reforçaram seus protocolos de monitoramento e anunciaram mudanças rigorosas nos processos de testes externos. A Irregular, fundada em 2023, afirmou ter implementado novas salvaguardas para garantir que simulações de segurança permaneçam isoladas de ambientes de produção.

Tópicos relacionados

Comentários

Carregando comentários...