Sistema GB300 NVL72 supera arquitetura Hopper em inferência agentica
Nova arquitetura da Nvidia entrega desempenho 13 vezes superior por dólar em tarefas de inferência agentica, segundo a SemiAnalysis.
Pontos principais
- O sistema GB300 NVL72 utiliza um backplane de cobre para escalar até 72 unidades.
- A arquitetura anterior, Hopper, era limitada a 8 unidades.
- O design permite otimizações como o paralelismo de especialistas em larga escala via vLLM.
- Cada GPU processa apenas um subconjunto de especialistas para aumentar a eficiência computacional.
O sistema GB300 NVL72 apresenta um desempenho por dólar 13 vezes superior ao da arquitetura Hopper em inferência agentica. A nova solução utiliza um backplane de cobre que permite expandir o domínio de escala para 72 unidades, superando o limite de 8 unidades da geração anterior.
A arquitetura possibilita otimizações como o paralelismo de especialistas em larga escala através do vLLM. Com esse design, cada GPU processa apenas um subconjunto de especialistas, o que otimiza a eficiência computacional do sistema.
Comentários
Carregando comentários...
