Daily Journal
Daily Journal

OpenAI lança GPT-Live com arquitetura de voz full-duplex

A nova tecnologia permite que o ChatGPT ouça e fale simultaneamente, tornando as conversas por voz mais naturais, fluidas e com menor latência.

Daily Journal
Foto: TecMundo
||
08/07 às 14:01 · atualizado 09/07 às 09:13

Pontos principais

  • A arquitetura full-duplex permite que o modelo processe áudio continuamente, eliminando a necessidade de turnos de fala rígidos.
  • O GPT-Live-1 está disponível para assinantes dos planos Go, Plus e Pro, enquanto o GPT-Live-1 mini atende usuários gratuitos.
  • O sistema separa a camada de interação de voz da camada de raciocínio, delegando tarefas complexas ao modelo GPT-5.5.
  • A tecnologia suporta tradução em tempo real, respostas com suporte visual e melhor compreensão de interrupções durante o diálogo.
  • Novos protocolos de segurança foram implementados para prevenir a imitação de vozes reais.
  • A OpenAI planeja disponibilizar a nova tecnologia para desenvolvedores via API em um futuro próximo.

A OpenAI anunciou o lançamento do GPT-Live, uma nova geração de modelos de voz projetada para elevar a naturalidade das interações com o ChatGPT. A principal inovação reside na arquitetura full-duplex, que permite ao sistema ouvir e falar simultaneamente. Diferente das versões anteriores, que dependiam de detecção de silêncio e turnos de fala rígidos, o GPT-Live processa áudio de forma contínua, permitindo que o usuário interrompa o assistente de forma orgânica e que a IA responda com maior fluidez e expressividade. A atualização visa reduzir drasticamente a latência, aproximando a experiência de uso de uma conversa humana real.

Para viabilizar essa capacidade, a OpenAI implementou uma estrutura que separa a camada de interação de voz da camada de raciocínio. Durante uma conversa, o sistema pode delegar tarefas complexas, como buscas na web ou cálculos, ao modelo GPT-5.5, enquanto mantém o fluxo de áudio ativo. Além disso, a ferramenta introduz recursos como tradução em tempo real e a exibição de cartões visuais informativos, tornando o assistente mais versátil para diferentes contextos de uso. A empresa também reforçou os protocolos de segurança para evitar a imitação de vozes reais, respondendo a preocupações éticas levantadas em lançamentos anteriores.

A disponibilidade do recurso foi segmentada pela OpenAI: o GPT-Live-1, que oferece a experiência completa, está restrito aos assinantes dos planos Go, Plus e Pro. Já os usuários da conta gratuita terão acesso ao GPT-Live-1 mini, uma versão otimizada da tecnologia. Com este lançamento, a OpenAI busca consolidar o ChatGPT como um assistente virtual avançado, capaz de lidar com ambientes ruidosos e mudanças de ritmo na fala. A companhia já sinalizou que pretende expandir o acesso a essa tecnologia para desenvolvedores por meio de sua API em breve, ampliando o potencial de integração em outros produtos e serviços.

Fonte primária

OpenAI (openai.com)

Introducing GPT-Live

A OpenAI anuncia o lançamento do GPT-Live, nova geração de modelos de voz que passa a operar o ChatGPT Voice. A empresa descreve dois avanços arquiteturais em relação às gerações anteriores: (1) arquitetura full-duplex, em que o modelo processa continuamente o áudio de entrada enquanto já gera saída, tomando decisões de interação (falar, continuar ouvindo, pausar, interromper ou acionar uma ferramenta) várias vezes por segundo — ao contrário dos sistemas em cascata (STT→LLM→TTS) do ChatGPT Voice original e dos modelos por turnos do Advanced Voice Mode, que esperavam o silêncio do usuário para responder; (2) delegação para trabalho mais profundo: quando a pergunta exige busca, raciocínio ou tarefas mais agênticas, o GPT-Live delega ao modelo de fronteira mais recente (GPT-5.5 no lançamento) em segundo plano, mantendo a conversa fluindo enquanto aguarda o resultado. Duas versões começam a ser distribuídas globalmente hoje: GPT-Live-1 (padrão para usuários Go, Plus e Pro) e GPT-Live-1 mini (padrão para usuários Free), nos apps iOS, Android e ChatGPT.com; a API virá em breve. Em avaliações internas de preferência humana (conversas de 5–10 minutos), as duas versões foram fortemente preferidas ao Advanced Voice Mode em naturalidade, alternância de turnos e fluxo da conversa. A OpenAI também reporta ganhos do GPT-Live-1 sobre o Advanced Voice Mode nos benchmarks GPQA (raciocínio científico), BrowseComp (busca web agêntica) e τ³-Voice Telecom (suporte por voz multi-turno). No lançamento, ainda não há suporte a voz com vídeo ou compartilhamento de tela. A empresa afirma ter expandido os testes de segurança específicos para voz (autolesão, psicose/mania, dependência emocional, violência, conteúdo sexual) e criado salvaguardas que atuam em tempo real durante a fala, incluindo fluxos de suporte a crise e controles parentais para usuários adolescentes.

Comentários

Carregando comentários...