Daily Journal
Daily Journal

Modelo Opus 4.6 da Anthropic apresenta falhas em filtros de conteúdo

Testes indicam que o modelo de IA Claude Opus 4.6 consegue contornar as restrições da Anthropic contra a geração de conteúdo sexualmente explícito.

Daily Journal
Foto: TechCrunch
||
21/08 às 20:30

Pontos principais

  • A política de uso da Anthropic proíbe explicitamente a criação de conteúdo sexualmente explícito por seus modelos.
  • Testes realizados pelo portal TechCrunch demonstraram que o modelo Opus 4.6 permite burlar esses filtros de segurança.
  • A falha levanta preocupações sobre a eficácia das salvaguardas implementadas pela empresa em seus modelos de linguagem mais avançados.

O modelo de inteligência artificial Claude Opus 4.6, desenvolvido pela Anthropic, tem apresentado vulnerabilidades em seus protocolos de segurança. De acordo com testes realizados pelo TechCrunch, o sistema consegue contornar as restrições impostas pela empresa, que proíbem a geração de conteúdo sexualmente explícito. Embora a Anthropic mantenha diretrizes rígidas para evitar a criação de material impróprio, a facilidade com que os filtros são ignorados coloca em xeque a robustez dos mecanismos de proteção atuais. Esse episódio destaca um desafio recorrente na indústria de LLMs: o equilíbrio entre a flexibilidade dos modelos e a implementação de salvaguardas eficazes contra o uso indevido. A empresa ainda não detalhou se planeja atualizações imediatas para corrigir a falha e reforçar o alinhamento de segurança do modelo.

Comentários

Carregando comentários...