OpenAI cria framework para monitorar e divulgar desalinhamento de modelos
A empresa estabeleceu novos critérios para rastrear e tornar públicos comportamentos inesperados ou falhas de alinhamento em seus sistemas de IA.
Pontos principais
- O novo framework define prazos e critérios para a divulgação de falhas de alinhamento.
- A OpenAI priorizará descobertas que desafiem premissas de segurança ou revelem novos mecanismos de desalinhamento.
- Seis relatórios sobre comportamentos observados nos últimos seis meses foram publicados como parte da iniciativa.
- O processo de transparência incluirá casos de comportamento desalinhado que ainda não possuem mitigação completa.
A OpenAI anunciou a implementação de um novo framework voltado ao rastreamento, investigação e divulgação de instâncias de desalinhamento em seus modelos de inteligência artificial. A iniciativa, que visa aumentar a transparência, prioriza a publicação de descobertas que desafiam as premissas de segurança atuais. Como primeiro passo, a companhia divulgou seis relatórios detalhando comportamentos observados durante o treinamento e avaliação nos últimos seis meses, incluindo casos que ainda não foram totalmente mitigados ou explicados.
Comentários
Carregando comentários...
