Microsoft lança três modelos próprios de IA: transcrição, voz e imagem
MAI-Transcribe-1 supera Whisper da OpenAI em 25 línguas; equipes de menos de 10 engenheiros cada.
Pontos principais
- MAI-Transcribe-1 tem taxa de erro de 3,8%, superando Whisper em 25 línguas
- MAI-Voice-1 gera 60 segundos de áudio em 1 segundo
- MAI-Image-2 ficou no top 3 do Arena AI para imagens
- Mustafa Suleyman chamou Microsoft de 'um dos três maiores labs'
- Equipes de menos de 10 engenheiros, com metade das GPUs dos concorrentes
A Microsoft lançou três modelos de IA desenvolvidos internamente: o MAI-Transcribe-1, de transcrição de áudio para texto, supera o Whisper da OpenAI em todas as 25 línguas testadas com taxa de erro média de 3,8%. O MAI-Voice-1 gera 60 segundos de áudio em apenas 1 segundo, e o MAI-Image-2 estreou no top 3 do Arena AI.
Mustafa Suleyman, CEO de IA da Microsoft e cofundador da DeepMind, declarou a empresa como 'um dos três maiores labs' — cada modelo foi construído por equipes de menos de 10 engenheiros, usando metade das GPUs dos concorrentes.
Comentários
Carregando comentários...
