Google lança TurboQuant: 6x menos memória e 8x mais velocidade em LLMs
Framework comprime caches de key-value a 3 bits sem perda de precisão, viabilizando modelos potentes em dispositivos de 16GB.
Pontos principais
- TurboQuant comprime caches KV a 3 bits por valor
- Redução de 6x na memória e até 8x de aceleração na inferência
- Não requer calibração específica por dataset (data-oblivious)
- Testado em modelos Gemma e Mistral em GPUs NVIDIA H100
- Permite rodar modelos grandes em Mac Mini de 16GB
O Google Research publicou o TurboQuant, um framework de quantização que combina duas técnicas: PolarQuant, que converte vetores cartesianos em coordenadas polares eliminando overhead de normalização, e QJL (Quantized Johnson-Lindenstrauss), que reduz erros residuais a bits de sinal sem custo de memória.
O resultado é uma compressão de caches de key-value a 3 bits por valor — 6x menos memória e até 8x mais velocidade em GPUs H100, sem perda de precisão. O algoritmo foi validado em benchmarks como LongBench, Needle In A Haystack e RULER. A compressão é suficiente para rodar modelos potentes localmente em dispositivos como Mac Mini de 16GB ou smartphones.
Comentários
Carregando comentários...
