Daily Journal
Daily Journal

OpenAI cria framework para monitorar e divulgar desalinhamento de modelos

A empresa estabeleceu novos critérios para rastrear e tornar públicos comportamentos inesperados ou falhas de alinhamento em seus sistemas de IA.

Daily Journal
Foto: x.com
||
16/09 às 19:45

Pontos principais

  • O novo framework define prazos e critérios para a divulgação de falhas de alinhamento.
  • A OpenAI priorizará descobertas que desafiem premissas de segurança ou revelem novos mecanismos de desalinhamento.
  • Seis relatórios sobre comportamentos observados nos últimos seis meses foram publicados como parte da iniciativa.
  • O processo de transparência incluirá casos de comportamento desalinhado que ainda não possuem mitigação completa.

A OpenAI anunciou a implementação de um novo framework voltado ao rastreamento, investigação e divulgação de instâncias de desalinhamento em seus modelos de inteligência artificial. A iniciativa, que visa aumentar a transparência, prioriza a publicação de descobertas que desafiam as premissas de segurança atuais. Como primeiro passo, a companhia divulgou seis relatórios detalhando comportamentos observados durante o treinamento e avaliação nos últimos seis meses, incluindo casos que ainda não foram totalmente mitigados ou explicados.

Comentários

Carregando comentários...