Daily Journal
Daily Journal

OpenAI lança modelos de voz GPT-Realtime para interação em tempo real

A OpenAI apresentou três modelos especializados da família GPT-Realtime, focados em raciocínio avançado, tradução e transcrição de baixa latência.

Daily Journal
Foto: Venturebeat
||
08/05 às 09:07 · atualizado 19:04

Pontos principais

  • A nova linha inclui o GPT-Realtime-2, com raciocínio de nível GPT-5, além dos modelos especializados em tradução e transcrição.
  • A arquitetura separa tarefas de processamento para otimizar custos e eficiência em aplicações corporativas.
  • Os modelos suportam janelas de contexto de 128K tokens, visando a orquestração complexa de agentes de voz.
  • A iniciativa compete com soluções como a linha Voxtral, da Mistral, no mercado de agentes de IA.

A OpenAI anunciou o lançamento de três novos modelos de voz da família GPT-Realtime, projetados para operar em tempo real e transformar a interação com interfaces de inteligência artificial. Disponibilizados via API, os modelos permitem que desenvolvedores criem aplicações que reagem dinamicamente às conversas. O GPT-Realtime-2 destaca-se pelo raciocínio avançado, com capacidade de nível GPT-5, enquanto o GPT-Realtime-Translate oferece tradução em mais de 70 idiomas e o GPT-Realtime-Whisper foca em transcrição de baixa latência.

Além das capacidades técnicas, a nova arquitetura da OpenAI separa as tarefas de tradução, transcrição e raciocínio em modelos especializados, em vez de utilizar um sistema único. Essa mudança estratégica visa reduzir custos operacionais e contornar limitações de contexto enfrentadas por empresas ao implementar agentes de voz. Com suporte a janelas de contexto de 128K tokens, a solução busca otimizar a orquestração de fluxos de dados, posicionando a OpenAI como uma competidora direta da linha Voxtral, da Mistral, no mercado corporativo.

Tópicos relacionados

Comentários

Carregando comentários...