Google lança modelos de IA para clonagem de voz com alta expressividade
Novos modelos Gemini 3.8 Flash TTS e Flash-Lite TTS permitem clonar vozes com 30 segundos de áudio e adicionar entonações naturais.
Pontos principais
- A tecnologia exige apenas 30 segundos de áudio para realizar a clonagem de voz.
- Os modelos suportam mais de 100 idiomas e incluem recursos como risos, sussurros e suspiros.
- O sistema utiliza marca d'água SynthID e credenciais C2PA para identificar áudios sintéticos.
- O Flash TTS é otimizado para direção criativa, enquanto o Flash-Lite TTS foca em eficiência de custos.
- A ferramenta possui restrições regionais, incluindo indisponibilidade no Reino Unido, União Europeia e partes dos EUA.
O Google anunciou o lançamento dos modelos Gemini 3.8 Flash TTS e Flash-Lite TTS, ferramentas avançadas de inteligência artificial voltadas para a síntese de voz. A tecnologia permite a criação de vozes personalizadas a partir de amostras de apenas 30 segundos, oferecendo um nível inédito de expressividade que inclui a capacidade de simular risadas, sussurros e suspiros. O sistema é compatível com mais de 100 idiomas e busca atender tanto demandas de direção criativa quanto necessidades de alta escala operacional.
Para garantir a transparência e a segurança, os áudios gerados recebem marca d'água digital via SynthID e utilizam credenciais C2PA para autenticação. Apesar do lançamento global, a empresa impôs restrições regionais significativas, excluindo o Reino Unido, o Espaço Econômico Europeu, a Suíça, a Índia e os estados americanos de Illinois e Texas. Paralelamente, o Google também expandiu o acesso gratuito ao Google Vids, sua ferramenta de criação de vídeos baseada no modelo Gemini Omni 1.1 Flash.
Tópicos relacionados
Comentários
Carregando comentários...
