Daily Journal
Daily Journal

Alibaba lança Qwen-Audio-3.1 com redução de preços em APIs

A Qwen anunciou a nova família de modelos de áudio e cortes de até 95% nos custos de suas APIs de inteligência artificial.

Daily Journal
Foto: x.com
||
23/09 às 06:40

Pontos principais

  • Lançamento dos modelos TTS-Next para criação e ASR-Next para compreensão de áudio.
  • Redução de preços nas APIs: 70% para TTS, 85% para Realtime e 95% para ASR.
  • O modelo ASR-Next identifica múltiplos falantes, emoções e eventos sonoros.
  • O modelo Realtime permite interrupções na fala e respostas empáticas.
  • O TTS-Next utiliza LM e difusão para gerar voz, efeitos e áudio de fundo.

A Qwen, divisão de inteligência artificial do Alibaba, apresentou o Qwen-Audio-3.1, uma nova linha de modelos focada em processamento de áudio. A atualização inclui os modelos TTS-Next, voltado para a criação de conteúdo, e o ASR-Next, especializado na compreensão de áudio com suporte a múltiplos falantes e identificação de emoções.

Além das novas ferramentas, a empresa implementou uma redução agressiva nos custos de suas APIs, chegando a 95% no serviço de ASR. O modelo Realtime também foi aprimorado, permitindo interrupções durante a conversação e respostas baseadas no tom do usuário, enquanto o TTS-Next utiliza uma estrutura unificada de LM e difusão para gerar vozes e efeitos sonoros.

Comentários

Carregando comentários...