Daily Journal
Daily Journal

Google introduz compreensão de vídeo agentica nos modelos Gemini

Nova funcionalidade permite que modelos Gemini analisem vídeos com maior precisão, reduzindo o consumo de tokens em até 88% e os custos operacionais em 66%.

Daily Journal
Foto: DeepMind
||
01/09 às 14:32 · atualizado 15:10

Pontos principais

  • A tecnologia de compreensão de vídeo agentica foi integrada aos modelos Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite.
  • O sistema analisa dinamicamente transcrições, áudio e quadros para selecionar momentos específicos do vídeo.
  • A ferramenta permite processar vídeos longos com uma redução de 88% no uso de tokens.
  • O custo de processamento de vídeo foi reduzido em 66% para desenvolvedores.
  • Testes indicam um aumento de 7% na precisão da análise de conteúdo em comparação com versões anteriores.
  • O recurso já está disponível via Gemini API no Google AI Studio e na Gemini Enterprise Agent Platform.
  • A funcionalidade será integrada futuramente ao aplicativo Gemini e à ferramenta Ask YouTube.

O Google anunciou a implementação de capacidades de compreensão de vídeo agentica em sua linha de modelos Gemini. A nova tecnologia permite que os modelos 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite adaptem a velocidade de processamento para identificar movimentos rápidos e extrair informações de forma dinâmica, analisando transcrições, áudio e quadros de vídeo de maneira integrada. O avanço é voltado principalmente para a otimização de tarefas complexas que envolvem conteúdos de longa duração.

Além do ganho de 7% na precisão da análise, a atualização traz benefícios significativos de eficiência para desenvolvedores que utilizam a Gemini API. Segundo a empresa, a nova arquitetura reduz o consumo de tokens em até 88% e diminui os custos de processamento em 66%. A ferramenta já pode ser acessada por meio do Google AI Studio e da Gemini Enterprise Agent Platform, com planos de expansão para o aplicativo Gemini e o recurso Ask YouTube em breve.

Comentários

Carregando comentários...