Meta lança Muse Voice Transcribe, seu primeiro modelo de áudio em tempo real
Modelo faz transcrição em streaming, separa mais de 20 falantes e foi treinado em mais de 70 idiomas, com 25 verificados extensivamente.
Pontos principais
- O Meta Superintelligence Labs apresentou o Muse Voice Transcribe em 1º de setembro de 2026.
- É o primeiro modelo de percepção de áudio em tempo real do laboratório e pertence à família Muse Spark.
- Ele entrega reconhecimento de fala em streaming, diarização para mais de 20 falantes e detecção de fim de fala.
- A Meta afirma liderar o ranking da Artificial Analysis em speech-to-text em streaming, com dados de 1º de setembro de 2026.
- O modelo processa áudio em blocos de 80 ms, a 12,5 Hz, e decide a cada bloco se continua ouvindo ou emite um token de texto.
- O treinamento usa aprendizado por reforço, combinando de forma multiplicativa uma recompensa de taxa de erro de palavras e uma de atraso.
- Foi treinado em mais de 70 idiomas, com 25 extensivamente verificados, e suporta troca de idioma dentro da mesma frase.
- Está disponível via Meta Model API, Meta AI para Mac e Muse Code, e passa a alimentar o ditado por voz nesses produtos.
A escolha técnica central é o processamento em blocos curtos: a cada 80 ms o modelo decide se segue ouvindo ou se já emite texto, o que é o que permite transcrição em streaming sem esperar o fim da frase. O treinamento por reforço combina de forma multiplicativa duas recompensas concorrentes — acerto de palavras e baixa latência —, de modo que ganhar em uma às custas da outra não compensa.
A cobertura multilíngue é o outro diferencial reivindicado. Além dos mais de 70 idiomas de treino, o modelo aceita troca de idioma dentro de uma mesma frase e lida nativamente com áudios de mais de uma hora, sem pós-processamento.
Comentários
Carregando comentários...
