Falha em APIs de IA permite extrair raciocínio oculto de modelos
Pesquisadores descobriram que traços de raciocínio criptografados de modelos de IA podem ser extraídos e expor dados sensíveis ou facilitar destilação.
Pontos principais
- A vulnerabilidade afeta APIs da OpenAI, Anthropic e Google, permitindo a decodificação de blocos de raciocínio ocultos.
- O método consiste em injetar traços criptografados em modelos menores e menos alinhados da mesma família, que revelam o conteúdo em texto puro.
- Pesquisadores extraíram 315.320 blocos de raciocínio a partir de 6.708 trajetórias públicas de agentes no GitHub e Hugging Face.
- A varredura de dados expostos encontrou 62 chaves de API, 33 endereços de e-mail e 33 senhas em sessões públicas.
- O modelo Kimi-K3, da chinesa Moonshot AI, apresentou padrões de raciocínio similares aos de modelos americanos, sugerindo possível destilação.
- Empresas como OpenAI, Anthropic e Google implementaram mitigações após serem notificadas, embora a estrutura das APIs ainda permita riscos residuais.
Uma equipe de pesquisadores liderada por Alexander Panfilov identificou uma falha de segurança em APIs de modelos de fronteira que expõe os processos de raciocínio interno, conhecidos como 'chain-of-thought'. Ao capturar blocos criptografados que as plataformas enviam para o computador do usuário, atacantes podem processá-los em modelos menores da mesma empresa, contornando restrições de segurança e revelando dados confidenciais, como senhas e chaves de API, que estavam presentes em logs de depuração compartilhados publicamente.
Além do risco de privacidade, a descoberta reacende o debate sobre a destilação de modelos, técnica onde o comportamento de um sistema avançado é copiado para um mais simples. Embora não haja prova causal definitiva, a semelhança entre as saídas do modelo chinês Kimi-K3 e os traços de raciocínio de modelos da Anthropic e OpenAI levantou suspeitas sobre o uso dessa prática para acelerar o desenvolvimento de IAs. As empresas afetadas já iniciaram ajustes em suas APIs para mitigar a reprodução indevida desses dados.
Comentários
Carregando comentários...
