Google lança EmbeddingGemma 2 para processamento multimodal
O Google lançou o EmbeddingGemma 2, modelo aberto que gera embeddings unificados para texto, código, imagens, áudio e vídeo.
Pontos principais
- Modelo aberto de 740 milhões de parâmetros, sob licença Apache 2.0.
- Mapeia texto, código, imagens, áudio e vídeo em um espaço vetorial compartilhado; a versão só de texto usa 270 milhões de parâmetros, com encoders opcionais de visão (170 milhões) e áudio (300 milhões).
- Janela de contexto de 8 mil tokens, quatro vezes a do EmbeddingGemma original; cabem até 5,5 minutos de áudio, 29 imagens ou 58 quadros de vídeo.
- A saída Matryoshka pode ser reduzida de 768 para 512, 256 ou 128 dimensões, com armazenamento até 6 vezes menor.
- Em um Pixel 11 Pro quantizado, usa cerca de 191 MB de RAM ativa só com texto e 567 MB com multimodal completo.
- No MTEB Code, a pontuação sobe de 68,76 para 78,68; a Google afirma liderar entre embedders multimodais abaixo de 1 bilhão de parâmetros em benchmarks como MTEB Code e MAEB.
- Pesos disponíveis no Hugging Face e no Kaggle; a disponibilidade no Model Garden do Gemini Enterprise Agent Platform está prevista para breve.
- Pode ser servido com transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama e LM Studio.
Os pesquisadores Sahil Dua e Henrique Schechter Vera, do Google DeepMind, assinam o anúncio do EmbeddingGemma 2, publicado em 6 de outubro de 2026. A Google diz que o modelo foi feito para rodar no próprio dispositivo: gerar embeddings localmente mantém os dados privados, reduz a latência e permite que a busca funcione sem conexão.
Como é construído sobre o Gemma 4, o modelo compartilha o tokenizador de texto e o encoder de áudio com ele, o que permite rodar os dois em um mesmo pipeline com menor consumo total de memória. A Google lembra que o EmbeddingGemma original, lançado no ano passado, passou de 20 milhões de downloads.
Cobertura da mídia
Comentários
Carregando comentários...
