Daily Journal
Daily Journal

Mistral lança Voxtral, modelo de voz open-source que supera Whisper e GPT-4o mini

ASR com pesos abertos e licença Apache 2.0 clona voz a partir de 3 segundos de áudio por $0,016 a cada mil caracteres.

Daily Journal
||
28/03 às 09:00

Pontos principais

  • Voxtral 24B (baseado em Mistral Small 3.1) e Voxtral Mini 3B para edge, além de TTS de 4B parâmetros
  • Voxtral 24B superou Whisper large-v3, GPT-4o mini Transcribe e Gemini 2.5 Flash em benchmarks
  • TTS clona voz a partir de 3 segundos de áudio com latência de 70ms
  • Preço de $0,016 por 1.000 caracteres (TTS) e $0,001 por minuto (ASR)
  • ASR sob licença Apache 2.0; TTS sob CC BY NC 4.0
  • Suporte a 9 idiomas com detecção automática

A Mistral lançou o Voxtral, plataforma de voz com modelos ASR e TTS de pesos abertos. O Voxtral 24B, baseado no Mistral Small 3.1, alcançou performance 'best in class' contra Whisper large-v3, GPT-4o mini Transcribe e Gemini 2.5 Flash em benchmarks de inglês e multilíngue FLEURS.

O modelo TTS de 4 bilhões de parâmetros clona voz a partir de 3 segundos de áudio de referência, capturando sotaque, inflexão e padrões naturais de fala, com latência de 70ms por $0,016 a cada 1.000 caracteres. Os modelos ASR estão sob licença Apache 2.0 no Hugging Face; o TTS é CC BY NC 4.0, com uso comercial exigindo acordo separado.

Comentários

Carregando comentários...