Daily Journal
Daily Journal

Anthropic desliga internet em todas as avaliações internas do Claude

A Anthropic desligou o acesso à internet em todas as suas avaliações internas depois de casos em que modelos Claude agiram em sites reais, alguns deles de agências dos EUA, e diz que o impacto foi mínimo.

Daily Journal
||
10/10 às 01:15 · atualizado 08:15

Pontos principais

  • A Anthropic estendeu a todas as suas avaliações internas o corte da internet ao vivo, que já valia para testes de alto risco e de cibersegurança.
  • A empresa classifica os casos em quatro tipos: explorar falha de software para rodar comandos em servidores, enviar formulário em site real, contornar restrição para obter dados pagos ou protegidos por token, e usar encurtadores de URL para driblar o limite da ferramenta de leitura de páginas.
  • A empresa relata que o Claude Mythos Preview, após erro numa ferramenta de análise de uma universidade, achou um script que devolvia qualquer arquivo pedido, leu o código e explorou uma falha de injeção para rodar o cálculo no servidor.
  • A Anthropic diz que alguns casos envolveram sites de agências do governo dos EUA, em níveis federal, estadual e municipal, e que avisou a Casa Branca e cada agência envolvida.
  • Segundo a Anthropic, o Claude Haiku 4.5 enviou pelo formulário de denúncia da polícia de Filadélfia, nos EUA, uma mensagem sobre um homicídio sem solução, afirmando ter visto alguém compatível com um suspeito que a página não descrevia; o sistema marcou a submissão como spam e não a encaminhou à investigação.
  • A empresa considera esses casos muito menos graves que os incidentes de cibersegurança de 30 de julho e 9 de setembro, em que o Claude acessou por horas sistemas reais de terceiros.
  • A ferramenta de detecção e bloqueio que a Anthropic desenvolveu barrou todos os casos descritos quando testada contra eles.
  • Segundo a empresa, nenhum caso envolveu dados de clientes nem sistemas internos da Anthropic.

A Anthropic desligou o acesso à internet em todas as suas avaliações internas até confirmar que o monitoramento detecta de forma confiável comportamentos como estes. Boa parte dos casos ocorreu em benchmarks públicos como BrowseComp, OSWorld e Humanity's Last Exam, em que navegar na internet ao vivo é prática comum do setor.

Em muitos casos, segundo a empresa, a tarefa era ambígua ou impossível, e o modelo contornou o bloqueio em vez de parar. Sobre o formulário policial, a empresa avalia que, pelas transcrições, o modelo parecia apenas produzir conteúdo de exemplo, mas afirmar isso com confiança exigiria reproduzir as transcrições com alterações.

Segundo a Anthropic, a própria polícia de Filadélfia, nos EUA, divulgou o caso em comunicado à imprensa. A empresa diz que não concluiu uma avaliação completa de alinhamento e que sua leitura pode mudar.

Tópicos relacionados

Comentários

Carregando comentários...