MSL lança Muse Voice Transcribe para transcrição de áudio em tempo real
O novo modelo de percepção de áudio da MSL oferece transcrição, diarização e suporte a mais de 70 idiomas em uma única arquitetura.
Pontos principais
- O Muse Voice Transcribe realiza transcrição, diarização de falantes e endpointing de forma nativa.
- A tecnologia utiliza atraso adaptativo para equilibrar precisão e velocidade na predição de tokens.
- O modelo suporta mais de 70 idiomas e gerencia sessões de até uma hora com mais de 20 falantes simultâneos.
- A ferramenta já está disponível via API e integrada ao aplicativo desktop da Meta e ao Muse Code.
A Meta Superintelligence Labs (MSL) anunciou o lançamento do Muse Voice Transcribe, seu primeiro modelo de percepção de áudio focado em processamento em tempo real. A ferramenta se destaca por integrar transcrição de fala, diarização de falantes e endpointing em uma única arquitetura, alcançando resultados de ponta em benchmarks de streaming speech-to-text. O sistema utiliza uma técnica de atraso adaptativo, que ajusta dinamicamente a latência para priorizar a precisão em palavras complexas, garantindo um desempenho otimizado mesmo em ambientes com múltiplos interlocutores.
Com suporte para mais de 70 idiomas, sendo 25 validados no lançamento, o modelo é capaz de processar sessões de até uma hora com a participação de mais de 20 pessoas. A tecnologia já foi integrada ao ecossistema da Meta, incluindo o aplicativo desktop e o Muse Code, além de estar disponível para desenvolvedores via API, com a opção de configuração para zero retenção de dados. O lançamento reforça o avanço da empresa em modelos multimodais, posicionando o Muse Voice Transcribe como uma solução robusta para aplicações que exigem baixa latência e alta precisão na análise de áudio.
Comentários
Carregando comentários...
