Google DeepMind lança EmbeddingGemma 2 para uso local em dispositivos
O Google DeepMind apresentou o EmbeddingGemma 2, modelo multimodal de 740 milhões de parâmetros otimizado para execução local e RAG privado.
Pontos principais
- O anúncio detalha os 740 milhões de parâmetros: 270 milhões no modelo de texto, com codificadores opcionais de visão (170 milhões) e áudio (300 milhões).
- Segundo o Google, o modelo mapeia texto, código, imagens, áudio e vídeo em um espaço vetorial compartilhado.
- A janela de contexto de 8 mil tokens permite processar até 5,5 minutos de áudio, 29 imagens ou 58 quadros de vídeo, segundo a empresa.
- Com Matryoshka Representation Learning, o anúncio informa que os vetores podem ser reduzidos de 768 para 512, 256 ou 128 dimensões, com redução de até seis vezes no armazenamento.
- Em um Pixel 11 Pro, após quantização, o consumo de RAM ativa fica em cerca de 191 MB no uso apenas com texto e 567 MB no modelo multimodal completo, segundo o Google.
- No benchmark MTEB Code, o Google informa que a pontuação subiu de 68,76 para 78,68 em relação ao EmbeddingGemma, ganho de 9,92 pontos.
- Os pesos estão disponíveis sob licença Apache 2.0 no Hugging Face e no Kaggle, informa a empresa.
- O Google diz que o EmbeddingGemma 2 compartilha o tokenizador de texto e o codificador de áudio do Gemma 4, permitindo combiná-los em fluxos locais de RAG com menor uso total de memória.
O Google DeepMind anunciou o EmbeddingGemma 2, modelo aberto de embeddings multimodais voltado à execução em dispositivos locais. Segundo a empresa, ele reúne texto, código, imagens, áudio e vídeo em um espaço vetorial compartilhado e pode viabilizar buscas entre formatos, como localizar um trecho de vídeo por uma consulta de áudio.
O comunicado afirma que o EmbeddingGemma anterior superou 20 milhões de downloads. Para a nova versão, o Google destaca o uso local como forma de reduzir a latência e manter dados no dispositivo, inclusive em aplicações que funcionam offline.
Cobertura da mídia
@Google: We’re releasing EmbeddingGemma 2, our first natively multimodal open model engineered for on-device embeddings.
x.com • 6 out, 13:15
@googlegemma: Introducing EmbeddingGemma 2! 🚀
x.com • 6 out, 13:05
@GoogleDeepMind: Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings.
x.com • 6 out, 13:04
Comentários
Carregando comentários...
