Daily Journal
Daily Journal

Google lança TurboQuant: 6x menos memória e 8x mais velocidade em LLMs

Framework comprime caches de key-value a 3 bits sem perda de precisão, viabilizando modelos potentes em dispositivos de 16GB.

Daily Journal
||
26/03 às 09:00

Pontos principais

  • TurboQuant comprime caches KV a 3 bits por valor
  • Redução de 6x na memória e até 8x de aceleração na inferência
  • Não requer calibração específica por dataset (data-oblivious)
  • Testado em modelos Gemma e Mistral em GPUs NVIDIA H100
  • Permite rodar modelos grandes em Mac Mini de 16GB

O Google Research publicou o TurboQuant, um framework de quantização que combina duas técnicas: PolarQuant, que converte vetores cartesianos em coordenadas polares eliminando overhead de normalização, e QJL (Quantized Johnson-Lindenstrauss), que reduz erros residuais a bits de sinal sem custo de memória.

O resultado é uma compressão de caches de key-value a 3 bits por valor — 6x menos memória e até 8x mais velocidade em GPUs H100, sem perda de precisão. O algoritmo foi validado em benchmarks como LongBench, Needle In A Haystack e RULER. A compressão é suficiente para rodar modelos potentes localmente em dispositivos como Mac Mini de 16GB ou smartphones.

Comentários

Carregando comentários...