OpenAI lança modelos de voz GPT-Realtime para interação em tempo real
A OpenAI apresentou três modelos especializados da família GPT-Realtime, focados em raciocínio avançado, tradução e transcrição de baixa latência.
Pontos principais
- A nova linha inclui o GPT-Realtime-2, com raciocínio de nível GPT-5, além dos modelos especializados em tradução e transcrição.
- A arquitetura separa tarefas de processamento para otimizar custos e eficiência em aplicações corporativas.
- Os modelos suportam janelas de contexto de 128K tokens, visando a orquestração complexa de agentes de voz.
- A iniciativa compete com soluções como a linha Voxtral, da Mistral, no mercado de agentes de IA.
A OpenAI anunciou o lançamento de três novos modelos de voz da família GPT-Realtime, projetados para operar em tempo real e transformar a interação com interfaces de inteligência artificial. Disponibilizados via API, os modelos permitem que desenvolvedores criem aplicações que reagem dinamicamente às conversas. O GPT-Realtime-2 destaca-se pelo raciocínio avançado, com capacidade de nível GPT-5, enquanto o GPT-Realtime-Translate oferece tradução em mais de 70 idiomas e o GPT-Realtime-Whisper foca em transcrição de baixa latência.
Além das capacidades técnicas, a nova arquitetura da OpenAI separa as tarefas de tradução, transcrição e raciocínio em modelos especializados, em vez de utilizar um sistema único. Essa mudança estratégica visa reduzir custos operacionais e contornar limitações de contexto enfrentadas por empresas ao implementar agentes de voz. Com suporte a janelas de contexto de 128K tokens, a solução busca otimizar a orquestração de fluxos de dados, posicionando a OpenAI como uma competidora direta da linha Voxtral, da Mistral, no mercado corporativo.
Tópicos relacionados
Comentários
Carregando comentários...
