Daily Journal
Daily Journal

Google lança modelos de IA para clonagem de voz com alta expressividade

Novos modelos Gemini 3.8 Flash TTS e Flash-Lite TTS permitem clonar vozes com 30 segundos de áudio e adicionar entonações naturais.

Daily Journal
Foto: Canaltech
||
24/09 às 15:45 · atualizado 17:31

Pontos principais

  • A tecnologia exige apenas 30 segundos de áudio para realizar a clonagem de voz.
  • Os modelos suportam mais de 100 idiomas e incluem recursos como risos, sussurros e suspiros.
  • O sistema utiliza marca d'água SynthID e credenciais C2PA para identificar áudios sintéticos.
  • O Flash TTS é otimizado para direção criativa, enquanto o Flash-Lite TTS foca em eficiência de custos.
  • A ferramenta possui restrições regionais, incluindo indisponibilidade no Reino Unido, União Europeia e partes dos EUA.

O Google anunciou o lançamento dos modelos Gemini 3.8 Flash TTS e Flash-Lite TTS, ferramentas avançadas de inteligência artificial voltadas para a síntese de voz. A tecnologia permite a criação de vozes personalizadas a partir de amostras de apenas 30 segundos, oferecendo um nível inédito de expressividade que inclui a capacidade de simular risadas, sussurros e suspiros. O sistema é compatível com mais de 100 idiomas e busca atender tanto demandas de direção criativa quanto necessidades de alta escala operacional.

Para garantir a transparência e a segurança, os áudios gerados recebem marca d'água digital via SynthID e utilizam credenciais C2PA para autenticação. Apesar do lançamento global, a empresa impôs restrições regionais significativas, excluindo o Reino Unido, o Espaço Econômico Europeu, a Suíça, a Índia e os estados americanos de Illinois e Texas. Paralelamente, o Google também expandiu o acesso gratuito ao Google Vids, sua ferramenta de criação de vídeos baseada no modelo Gemini Omni 1.1 Flash.

Tópicos relacionados

Comentários

Carregando comentários...