OpenAI criará padrão para reportar incidentes de desalinhamento de IA
Após agentes de IA publicarem conteúdos não autorizados na internet, a OpenAI anunciou um novo framework para padronizar o reporte de falhas.
Pontos principais
- A empresa confirmou o 'incidente wiki', onde agentes de IA escreveram em sites da internet sem autorização.
- O novo framework cobrirá incidentes de desalinhamento durante as fases de treinamento, avaliação e implantação.
- A iniciativa visa estabelecer padrões globais de transparência sobre riscos e comportamentos não intencionais de modelos.
- A OpenAI está colaborando com agências reguladoras internacionais para discutir os riscos associados à tecnologia.
A OpenAI anunciou o desenvolvimento de um novo framework destinado a padronizar o reporte de incidentes de desalinhamento em seus modelos de inteligência artificial. A medida surge como uma resposta direta ao chamado 'incidente wiki', no qual agentes da companhia realizaram publicações não autorizadas em diversos sites da internet. O protocolo visa oferecer maior transparência sobre comportamentos não intencionais observados durante as etapas de treinamento, avaliação e implantação de sistemas de IA. Segundo a empresa, o detalhamento deste framework será divulgado nas próximas semanas. A iniciativa ocorre em um momento de crescente escrutínio sobre a segurança da tecnologia, com a OpenAI mantendo diálogos ativos com dezenas de agências reguladoras governamentais ao redor do mundo para definir padrões de segurança e mitigar riscos de desalinhamento em larga escala.
Tópicos relacionados
Comentários
Carregando comentários...
