Daily Journal
Daily Journal

Google libera Gemini 3.1 Flash TTS com 70+ idiomas e 200 marcadores inline

Modelo de texto-para-voz supera ElevenLabs v3 no ranking da Artificial Analysis e oferece 30 vozes, marcadores como [sussurros] e marca d'água SynthID.

Daily Journal
||
16/04 às 09:00

Pontos principais

  • Lançado em prévia via Gemini API, Google AI Studio, Vertex AI e Google Vids
  • Suporta mais de 70 idiomas e 30 vozes pré-construídas
  • 200+ marcadores inline (ex.: [sussurros], [ri], [excitadamente]) controlam tom, cadência e sons não verbais
  • Elo de 1.211 na Artificial Analysis — acima do ElevenLabs v3 e atrás só do Inworld 1.5 Max
  • Preço pago: US$1/milhão de tokens de entrada e US$20/milhão de tokens de áudio (metade em batch)
  • Todo áudio gerado recebe marca d'água SynthID para identificar conteúdo de IA

O modelo foca expressividade e controle fino sobre a entrega vocal — algo que a ElevenLabs vinha dominando. Os marcadores inline permitem ao desenvolvedor orquestrar tom, ritmo, sotaque e efeitos não verbais frase a frase, sem treinar uma voz customizada.

O preço o posiciona como opção de custo-benefício: o ranking da Artificial Analysis destacou a relação qualidade/preço, e o Google acrescentou a marca d'água SynthID a todo áudio gerado, em aceno à regulação sobre conteúdo sintético.

Comentários

Carregando comentários...