Daily Journal
Daily Journal

Nvidia desenvolve técnica para acelerar transferência de cache em IA

Nova técnica da Nvidia utiliza álgebra linear para transferir cache entre modelos, reduzindo latência e custos computacionais em fluxos de IA.

Daily Journal
Foto: Venturebeat
||
21/08 às 14:02

Pontos principais

  • A técnica utiliza um mapeador linear baseado em regressão ridge para transferir cache KV entre modelos de diferentes tamanhos.
  • O método elimina a necessidade de recomputar o histórico de conversas ao alternar entre modelos em sistemas agentes.
  • Testes indicam que o processo é até 25 vezes mais rápido que a recomputação completa, mantendo 98% da precisão.
  • A solução foi validada em modelos como Llama 3.1, Qwen3 e Ministral 3, com saltos de escala de até 8,8 vezes em parâmetros.

Pesquisadores da Nvidia apresentaram um avanço significativo para a eficiência de sistemas de inteligência artificial ao desenvolver um método que utiliza álgebra linear simples para a transferência de cache KV entre modelos. Ao substituir processos complexos por um mapeador linear baseado em regressão ridge, a técnica permite que sistemas agentes alternem entre modelos de diferentes capacidades sem a necessidade de recomputar todo o histórico de dados. Essa inovação reduz drasticamente a latência e o custo computacional, sendo de 2,7 a 25 vezes mais rápida que os métodos tradicionais de recomputação. A solução, validada em famílias de modelos como Llama 3.1 e Qwen3, mantém até 98% da precisão original. O avanço é estratégico para aplicações empresariais que dependem de longos contextos e tarefas de raciocínio complexas, mitigando gargalos de memória e otimizando o uso de infraestrutura em fluxos de trabalho multi-modelo.

Tópicos relacionados

Comentários

Carregando comentários...