Daily Journal
Daily Journal

Ranking da FAR.AI aponta disparidade em segurança de modelos de IA

Estudo revela que custo para realizar jailbreak em modelos de IA varia até cem vezes entre as principais empresas do setor.

Daily Journal
||
01/08 às 21:46

Pontos principais

  • A FAR.AI lançou um ranking que avalia a resistência de modelos de IA contra ataques de jailbreak em cinco domínios de risco.
  • Claude Fable 5 e GPT-5.6 Sol não apresentaram falhas, com custo de ataque estimado acima de US$ 14 mil.
  • Grok 4.5 foi o modelo mais vulnerável, permitindo jailbreaks com custo médio de US$ 58.
  • O Gemini 3.1 Pro apresentou resistência intermediária, com custo de invasão de aproximadamente US$ 278.
  • A metodologia utilizou 1.500 ataques, combinando técnicas automatizadas e orientadas por especialistas.
  • A FAR.AI publicou o 'Minimal Standard for Safeguards' para definir padrões de segurança que modelos de fronteira devem seguir.

A organização de pesquisa FAR.AI divulgou em 29 de julho de 2026 um novo ranking de segurança para inteligência artificial, expondo uma disparidade significativa na proteção de modelos de ponta. Enquanto sistemas como o Claude Fable 5 e o GPT-5.6 Sol resistiram a todos os testes realizados, o Grok 4.5 e o Gemini 3.1 Pro mostraram vulnerabilidades que permitem a execução de jailbreaks de forma rápida e barata. A análise utilizou uma taxonomia de mais de 60 técnicas de ataque para testar a robustez contra ameaças químicas, biológicas, radiológicas, nucleares e cibernéticas.

Segundo a FAR.AI, a diferença de custo de mais de cem vezes entre os modelos mais e menos seguros indica que a segurança é uma escolha de engenharia, e não uma limitação tecnológica. A organização ressaltou que as vulnerabilidades encontradas pertencem a classes de ataques conhecidas, para as quais já existem defesas implementadas em outros sistemas. O relatório alerta que, devido à facilidade de contornar as proteções de certos modelos, agentes mal-intencionados podem alternar entre diferentes IAs até encontrar uma que responda a solicitações perigosas.

Comentários

Carregando comentários...