---
title: "Google lança TurboQuant: 6x menos memória e 8x mais velocidade em LLMs"
url: https://dailyjournal.news/news/2026-03-26/google-lanca-turboquant-6x-menos-memoria-e-8x-mais-velocidade-em-llms
published: 2026-03-26T12:00:00+00:00
categories: ["technology"]
source_count: 2
outlet_count: 0
language: pt-BR
publisher: "Daily Journal"
---

# Google lança TurboQuant: 6x menos memória e 8x mais velocidade em LLMs

Framework comprime caches de key-value a 3 bits sem perda de precisão, viabilizando modelos potentes em dispositivos de 16GB.

## Pontos principais

- TurboQuant comprime caches KV a 3 bits por valor
- Redução de 6x na memória e até 8x de aceleração na inferência
- Não requer calibração específica por dataset (data-oblivious)
- Testado em modelos Gemma e Mistral em GPUs NVIDIA H100
- Permite rodar modelos grandes em Mac Mini de 16GB

O Google Research publicou o TurboQuant, um framework de quantização que combina duas técnicas: PolarQuant, que converte vetores cartesianos em coordenadas polares eliminando overhead de normalização, e QJL (Quantized Johnson-Lindenstrauss), que reduz erros residuais a bits de sinal sem custo de memória.

O resultado é uma compressão de caches de key-value a 3 bits por valor — 6x menos memória e até 8x mais velocidade em GPUs H100, sem perda de precisão. O algoritmo foi validado em benchmarks como LongBench, Needle In A Haystack e RULER. A compressão é suficiente para rodar modelos potentes localmente em dispositivos como Mac Mini de 16GB ou smartphones.

## Fontes

- [TurboQuant do Google reduz uso de memória em IA sem perder precisão](https://www.helpnetsecurity.com/2026/03/25/google-turboquant-ai-model-compression/) (2026-03-26)
- [TurboQuant do Google reduz requisitos de memória de cache de LLM em 6x](https://www.tomshardware.com/tech-industry/artificial-intelligence/googles-turboquant-compresses-llm-kv-caches-to-3-bits-with-no-accuracy-loss) (2026-03-26)

---

Publicado por Daily Journal. Versão HTML: https://dailyjournal.news/news/2026-03-26/google-lanca-turboquant-6x-menos-memoria-e-8x-mais-velocidade-em-llms
