Anthropic abre vagas para pesquisa em design psicológico de IA
A empresa busca especialistas para investigar como o treinamento de modelos de linguagem impacta o caráter e o alinhamento da tecnologia.
Pontos principais
- A Anthropic busca pesquisadores com experiência em fine-tuning, interpretabilidade e avaliações de alinhamento.
- O objetivo é compreender como o processo de treinamento influencia a identidade e o caráter dos modelos.
- A pesquisa foca em mitigar riscos como comportamentos de autopreservação enganosa e conluio entre IAs.
- A iniciativa visa evitar que o aprendizado por reforço resulte em raciocínio motivado ou comportamentos perversos.
A Anthropic anunciou a abertura de vagas para pesquisadores focados em "psychological design". O objetivo da nova área é investigar como o treinamento afeta o caráter e o alinhamento de modelos de linguagem, buscando entender a formação da identidade da IA. A empresa pretende desenvolver soluções para prevenir comportamentos indesejados, como o raciocínio motivado e a autopreservação enganosa. O trabalho exigirá expertise técnica em áreas como fine-tuning, interpretabilidade e avaliações de alinhamento, visando garantir que o aprendizado por reforço não induza comportamentos perversos ou conluio maligno entre modelos.
Comentários
Carregando comentários...
