Google lança DiffusionGemma com geração de texto em paralelo
Novo modelo experimental do Google utiliza difusão para gerar tokens simultaneamente, prometendo maior velocidade e capacidade de autocorreção.
Pontos principais
- O DiffusionGemma gera 256 tokens de forma paralela, superando a limitação sequencial dos modelos autorregressivos.
- A arquitetura permite atenção bidirecional e autocorreção, sendo eficaz em tarefas como resolução de Sudoku e código.
- Benchmarks indicam que o modelo pode ser de 4 a 6 vezes mais rápido que modelos padrão em baixa concorrência.
- O modelo possui suporte nativo à plataforma vLLM e é baseado na estrutura Gemma 4.
- O Google recomenda o uso do Gemma 4 padrão para aplicações que exigem precisão superior.
O Google anunciou o lançamento do DiffusionGemma, um modelo experimental de linguagem que rompe com o padrão autorregressivo tradicional ao gerar 256 tokens simultaneamente. Ao aplicar princípios de difusão, a tecnologia permite que o sistema realize autocorreções durante o processo de geração, utilizando atenção bidirecional para melhorar o desempenho em tarefas estruturadas, como a escrita de código e a resolução de problemas lógicos. Segundo a empresa, a arquitetura oferece ganhos significativos de velocidade, podendo ser até seis vezes mais rápida que modelos convencionais em cenários de baixa concorrência. Embora represente um avanço na eficiência de inferência local com suporte nativo ao vLLM, o Google ressalta que a qualidade geral do DiffusionGemma é inferior à do Gemma 4 padrão, sendo este último ainda a recomendação principal para aplicações que demandam máxima precisão.
Tópicos relacionados
Comentários
Carregando comentários...
