OpenAI abre modo Ultrafast com chips Cerebras a 750 tokens por segundo
Tier em preview limitado roda o GPT-5.6 Sol até 14 vezes mais rápido que o Standard e afasta a OpenAI da dependência total da Nvidia.
Pontos principais
- A Cerebras anunciou em 13 de agosto que fornece a infraestrutura do modo Ultrafast na API da OpenAI
- O tier roda o GPT-5.6 Sol a até 750 tokens de output por segundo, até 14 vezes o processamento Standard
- A Cerebras diz que a qualidade do modelo é a mesma do Standard
- Dados da Artificial Analysis citados colocam o Ultrafast 5 vezes mais rápido que o Claude Opus 4.8 em modo Fast e 11 vezes mais que o Claude Fable 5
- O preview é limitado a um grupo pequeno de clientes e a OpenAI não divulgou preços
- A velocidade vem da arquitetura Wafer-Scale Engine e de 44GB de SRAM no próprio chip
A Cerebras fabrica processadores do tamanho de um prato de jantar, cortados de uma única pastilha de silício, o que permite que um modelo inteiro caiba em um só chip em vez de ser dividido entre racks de GPUs Nvidia. Isso reduz os gargalos de movimentação de dados que limitam a inferência em sistemas baseados em GPU.
A OpenAI já havia sinalizado o tier Sol servido pela Cerebras quando apresentou o GPT-5.6, dizendo que chegaria a até 750 tokens por segundo em julho; o preview público só abriu em 13 de agosto. O acesso será ampliado conforme a capacidade crescer.
Comentários
Carregando comentários...
