Nvidia Vera Rubin NVL72 supera GB200 em eficiência e custo
Nova arquitetura Vera Rubin NVL72 entrega até 5,4x mais performance por megawatt e 5x mais eficiência de custo que o sistema GB200 NVL72.
Pontos principais
- O Vera Rubin NVL72 apresenta 5,4x mais performance por megawatt e 5x mais performance por dólar em relação ao GB200 NVL72.
- A Nvidia disponibilizou o stack de software Rubin (CUDA 13.4) com suporte integrado ao PyTorch, vLLM e OpenAI Triton.
- A arquitetura Rubin permite a reutilização de kernels do Blackwell, acelerando o processo de implementação e time-to-market.
- O Vera Rubin utiliza um design de bandeja de computação sem cabos, visando um ramp de produção mais rápido que a geração anterior.
- A nova arquitetura introduz um núcleo de tensor LUT programável de 3 bits e memória compartilhada (SMEM) aumentada para 328 KiB.
- Dados preliminares baseados no modelo DeepSeek R1 foram coletados pela CoreWeave e aguardam validação oficial no InferenceX.
A Nvidia iniciou a fase de implementação da arquitetura Vera Rubin NVL72, a segunda geração de sua plataforma rack-scale Oberon. Segundo análises da SemiAnalysis, o novo sistema demonstra ganhos significativos em inferência, superando o GB200 NVL72 em eficiência energética e custo total de propriedade (TCO). Embora o custo por hora por GPU do Rubin seja superior ao das gerações anteriores, a performance bruta permite uma redução de até 5x no custo por milhão de tokens em cenários de alta demanda.
O desenvolvimento do ecossistema de software para o Rubin tem se mostrado mais fluido do que a transição entre as arquiteturas Hopper e Blackwell, graças à compatibilidade com kernels existentes. A Nvidia já liberou o stack de software compatível com CUDA 13.4 e integrou melhorias em compiladores como o OpenAI Triton. A empresa comprometeu-se a submeter resultados verificáveis ao benchmark InferenceX até o terceiro trimestre de 2026, consolidando a comparação técnica com soluções concorrentes.
Tópicos relacionados
Comentários
Carregando comentários...
