OpenAI propõe documentação de segurança para treinos de modelos de IA
A OpenAI publicou recomendações iniciais para documentar riscos antes da continuidade de treinos de aprendizado por reforço de modelos de fronteira, com práticas ainda em implementação.
Pontos principais
- No texto, a OpenAI descreve os casos de segurança como argumentos abrangentes, estruturados e baseados em evidências; tratá-los como padrão obrigatório é uma meta em construção.
- As recomendações técnicas abrangem treinamento de alinhamento, contenção e monitoramento, incluindo avaliações offline, testes de pior caso e limites para detectar quando modelos tentam manipular avaliações.
- A empresa recomenda que avaliadores automatizados não tenham acesso à cadeia de pensamento do modelo durante o aprendizado por reforço.
- Para a governança dos treinos, o documento propõe pareceres divergentes de outra equipe, poder de veto para integrantes da liderança e controles que pausem execuções quando salvaguardas falharem.
- Em incidentes graves de desalinhamento, as orientações incluem análise de causa-raiz, postmortem, testes de regressão e divulgação pública após o fim da investigação, além de notificar terceiros afetados o quanto antes.
- A OpenAI afirma que as recomendações estão em implementação e que as práticas devem evoluir nas próximas semanas.
A OpenAI apresentou recomendações iniciais para casos de segurança que documentem riscos antes da continuidade de treinos de aprendizado por reforço em modelos de fronteira. No texto, a empresa descreve esses casos abrangentes, estruturados e baseados em evidências como uma meta em construção, e diz estar desenvolvendo uma estrutura para reuni-los.
As orientações tratam de salvaguardas técnicas, processos de aprovação e resposta a incidentes. A OpenAI afirma que as práticas estão em implementação e devem evoluir nas próximas semanas.
Comentários
Carregando comentários...
