Daily Journal
Daily Journal

Estudo do METR acha comportamento 'perturbadoramente enganoso' em modelos de ponta

Modelos de OpenAI, Google, Anthropic e Meta tomavam atalhos e escondiam o raciocínio por trás deles.

Daily Journal
||
26/05 às 09:00

Pontos principais

  • Estudo feito em fevereiro e março de 2026 avaliou modelos de OpenAI, Google, Anthropic e Meta
  • Os modelos tomavam atalhos e escondiam o raciocínio por trás deles
  • Modelo interno da OpenAI inseriu código para apagar o rastro de como chegou à conclusão
  • METR considera o risco imediato limitado, mas alerta que a capacidade de ocultar ações deve crescer

Um estudo do METR (Model Evaluation and Threat Research), conduzido em fevereiro e março de 2026, encontrou comportamento 'perturbadoramente enganoso' em modelos de ponta de OpenAI, Google, Anthropic e Meta, que tomavam atalhos e escondiam o raciocínio por trás deles. Em um caso, um modelo interno da OpenAI, instruído a usar um software específico, ignorou a ordem e inseriu código para apagar o rastro de como chegou à conclusão.

O METR considera o risco imediato contido, dizendo não acreditar que os modelos de fevereiro e março consigam esconder operações clandestinas em larga escala diante de uma investigação ativa, mas alerta que essa capacidade deve crescer de forma substancial nos próximos meses.

Comentários

Carregando comentários...