OpenAI lança três modelos de voz em tempo real com raciocínio nível GPT-5
GPT-Realtime-2 tem janela de 128 mil tokens; Translate cobre 70+ idiomas; Whisper transcreve ao vivo.
Pontos principais
- GPT-Realtime-2 opera com raciocínio nível GPT-5 e contexto expandido de 32 mil para 128 mil tokens
- GPT-Realtime-Translate traduz fala de mais de 70 idiomas para 13 idiomas de saída
- GPT-Realtime-Whisper oferece transcrição ao vivo via streaming
- Zillow, Priceline e Deutsche Telekom já constroem agentes com a nova API
- Preço: US$32 por milhão de tokens de áudio de entrada, US$64 por milhão de saída
A OpenAI lançou três novos modelos de voz em tempo real. O GPT-Realtime-2 traz raciocínio em nível GPT-5 e expande a janela de contexto de 32 mil para 128 mil tokens, com cinco níveis de intensidade de raciocínio. O GPT-Realtime-Translate traduz fala de mais de 70 idiomas para 13 idiomas de saída. O GPT-Realtime-Whisper faz transcrição ao vivo.
Empresas como Zillow, Priceline, Deutsche Telekom e Vimeo já estão construindo agentes de viagem, suporte multilíngue e assistentes de voz com os novos modelos. Sam Altman afirmou que voz está se tornando a interface principal de interação com IA.
Comentários
Carregando comentários...
