Google libera Gemini 3.1 Flash TTS com 70+ idiomas e 200 marcadores inline
Modelo de texto-para-voz supera ElevenLabs v3 no ranking da Artificial Analysis e oferece 30 vozes, marcadores como [sussurros] e marca d'água SynthID.
Pontos principais
- Lançado em prévia via Gemini API, Google AI Studio, Vertex AI e Google Vids
- Suporta mais de 70 idiomas e 30 vozes pré-construídas
- 200+ marcadores inline (ex.: [sussurros], [ri], [excitadamente]) controlam tom, cadência e sons não verbais
- Elo de 1.211 na Artificial Analysis — acima do ElevenLabs v3 e atrás só do Inworld 1.5 Max
- Preço pago: US$1/milhão de tokens de entrada e US$20/milhão de tokens de áudio (metade em batch)
- Todo áudio gerado recebe marca d'água SynthID para identificar conteúdo de IA
O modelo foca expressividade e controle fino sobre a entrega vocal — algo que a ElevenLabs vinha dominando. Os marcadores inline permitem ao desenvolvedor orquestrar tom, ritmo, sotaque e efeitos não verbais frase a frase, sem treinar uma voz customizada.
O preço o posiciona como opção de custo-benefício: o ranking da Artificial Analysis destacou a relação qualidade/preço, e o Google acrescentou a marca d'água SynthID a todo áudio gerado, em aceno à regulação sobre conteúdo sintético.
Comentários
Carregando comentários...
