Pesquisador lança Audio8 ASR Infinite para reconhecimento de fala
O novo modelo Audio8 ASR Infinite oferece reconhecimento de fala em streaming otimizado para operações contínuas com latência constante.
Pontos principais
- O modelo utiliza arquitetura de streaming nativa com decodificação de 12,5 vezes por segundo.
- A tecnologia emprega um 'rolling KV Cache' para manter o uso de memória estável em operações 24/7.
- O sistema processa um token de texto por passo de clock para equilibrar recursos.
- Uma demonstração do modelo foi disponibilizada via Gradio no HuggingChat.
O pesquisador AK anunciou o lançamento do Audio8 ASR Infinite, um modelo de reconhecimento de fala projetado para streaming e operação contínua. A arquitetura decodifica 12,5 vezes por segundo e utiliza um 'rolling KV Cache' para garantir que a latência e o uso de memória permaneçam constantes durante o funcionamento 24/7.
O sistema processa um token de texto a cada passo de clock, buscando um equilíbrio entre a granularidade da percepção e o custo computacional. Interessados já podem realizar testes com a tecnologia por meio de um fluxo de trabalho disponível no HuggingChat.
Cobertura da mídia
Comentários
Carregando comentários...
