OpenAI lança GPT-Live com arquitetura de voz full-duplex
A nova tecnologia permite que o ChatGPT ouça e fale simultaneamente, tornando as conversas por voz mais naturais, fluidas e com menor latência.
Pontos principais
- A arquitetura full-duplex permite que o modelo processe áudio continuamente, eliminando a necessidade de turnos de fala rígidos.
- O GPT-Live-1 está disponível para assinantes dos planos Go, Plus e Pro, enquanto o GPT-Live-1 mini atende usuários gratuitos.
- O sistema separa a camada de interação de voz da camada de raciocínio, delegando tarefas complexas ao modelo GPT-5.5.
- A tecnologia suporta tradução em tempo real, respostas com suporte visual e melhor compreensão de interrupções durante o diálogo.
- Novos protocolos de segurança foram implementados para prevenir a imitação de vozes reais.
- A OpenAI planeja disponibilizar a nova tecnologia para desenvolvedores via API em um futuro próximo.
A OpenAI anunciou o lançamento do GPT-Live, uma nova geração de modelos de voz projetada para elevar a naturalidade das interações com o ChatGPT. A principal inovação reside na arquitetura full-duplex, que permite ao sistema ouvir e falar simultaneamente. Diferente das versões anteriores, que dependiam de detecção de silêncio e turnos de fala rígidos, o GPT-Live processa áudio de forma contínua, permitindo que o usuário interrompa o assistente de forma orgânica e que a IA responda com maior fluidez e expressividade. A atualização visa reduzir drasticamente a latência, aproximando a experiência de uso de uma conversa humana real.
Para viabilizar essa capacidade, a OpenAI implementou uma estrutura que separa a camada de interação de voz da camada de raciocínio. Durante uma conversa, o sistema pode delegar tarefas complexas, como buscas na web ou cálculos, ao modelo GPT-5.5, enquanto mantém o fluxo de áudio ativo. Além disso, a ferramenta introduz recursos como tradução em tempo real e a exibição de cartões visuais informativos, tornando o assistente mais versátil para diferentes contextos de uso. A empresa também reforçou os protocolos de segurança para evitar a imitação de vozes reais, respondendo a preocupações éticas levantadas em lançamentos anteriores.
A disponibilidade do recurso foi segmentada pela OpenAI: o GPT-Live-1, que oferece a experiência completa, está restrito aos assinantes dos planos Go, Plus e Pro. Já os usuários da conta gratuita terão acesso ao GPT-Live-1 mini, uma versão otimizada da tecnologia. Com este lançamento, a OpenAI busca consolidar o ChatGPT como um assistente virtual avançado, capaz de lidar com ambientes ruidosos e mudanças de ritmo na fala. A companhia já sinalizou que pretende expandir o acesso a essa tecnologia para desenvolvedores por meio de sua API em breve, ampliando o potencial de integração em outros produtos e serviços.
Comentários
Carregando comentários...
