Daily Journal
Daily Journal

Google lança modelos Gemini 3.8 Flash para síntese de voz

A nova tecnologia de conversão de texto em fala do Google, que liderou os principais benchmarks de qualidade de voz da Hume AI, oferece mais de 100 idiomas, biblioteca de 2 mil vozes e suporte a agentes em tempo real.

Daily Journal
Foto: DeepMind
||
23/09 às 12:32 · atualizado 13:02

Pontos principais

  • O Google anunciou os modelos Gemini 3.8 Flash TTS, voltado a direção criativa, e Gemini 3.8 Flash-Lite TTS, otimizado para escala e custo, ambos para síntese de voz.
  • No Voice Design Benchmark da Hume AI, o Flash TTS ficou em 1º lugar geral (71,4 pontos) e também liderou o quesito de modelagem de sotaque (60,8 pontos).
  • No Overall Quality Index da Hume AI, o Flash TTS ficou em 1º lugar e o Flash-Lite TTS em 2º.
  • Os modelos suportam mais de 100 idiomas e dialetos, incluindo variações regionais como espanhol mexicano, francês de Quebec e inglês escocês.
  • A biblioteca reúne mais de 2.000 vozes prontas, com criação de vozes por prompt e clonagem a partir de 30 segundos de áudio, sujeita a verificação de consentimento.
  • Todo áudio gerado carrega marca d'água SynthID e credenciais C2PA para identificação de conteúdo sintético.
  • Os modelos já estão disponíveis para desenvolvedores no Google AI Studio e na API do Gemini; para empresas, o acesso via Gemini Enterprise chega em breve.
  • Entre usuários finais, o Flash TTS chega ao Gemini Notebook e o Flash-Lite TTS ao Google Vids; parceiros de lançamento incluem Agora, LiveKit, Pipecat e Vercel.

O Google anunciou o lançamento dos modelos Gemini 3.8 Flash TTS, voltado a direção criativa, e Gemini 3.8 Flash-Lite TTS, otimizado para escala e custo. Segundo o comunicado do Google, o Flash TTS liderou o Voice Design Benchmark e o Overall Quality Index da Hume AI, com 71,4 pontos no primeiro; o Flash-Lite TTS ficou em 2º lugar no segundo.

As ferramentas suportam mais de 100 idiomas, biblioteca de mais de 2.000 vozes e clonagem a partir de 30 segundos de áudio, mediante consentimento. Já estão disponíveis no Google AI Studio e na API do Gemini, com marca d'água SynthID em todo áudio gerado.

Comentários

Carregando comentários...