Daily Journal
Daily Journal

Vera Rubin NVL72 estreia no MLPerf com throughput até 3,7x o do GB300

A rodada v6.1 do MLPerf Inference teve recorde de 30 organizações e estreou cinco processadores, incluindo AMD MI350P e Intel Arc Pro B70.

Daily Journal
||
17/09 às 09:00

Pontos principais

  • A MLCommons divulgou em 16 de setembro de 2026 os resultados do MLPerf Inference v6.1, com recorde de 30 organizações submetendo.
  • Estrearam cinco processadores: AMD Ryzen AI Max+ 395, AMD Instinct MI350P e Intel Arc Pro B70 (disponíveis), além de Nvidia Rubin e Vera Rubin NVL72 (preview).
  • No Qwen3-VL, o Vera Rubin NVL72 entregou throughput até 3,7 vezes maior que o do GB300 NVL72, com vLLM e o framework aberto Nvidia Dynamo.
  • No DeepSeek-R1, com a biblioteca Nvidia TensorRT-LLM, o ganho foi de até 2,5 vezes sobre o GB300 NVL72.
  • Em testes preliminares no AgentX, benchmark externo de tarefas agênticas da SemiAnalysis, a Nvidia diz que o Vera Rubin teve desempenho até 30 vezes superior ao do GB300 NVL72.
  • Uma submissão de DeepSeek-R1 com 288 GPUs em quatro racks GB300 NVL72 atingiu 99% de eficiência de escala no cenário offline.
  • No benchmark de geração de vídeo WAN 2.2, o GB300 NVL72 processou 0,65 vídeo em 720p por segundo (5,7 segundos por vídeo), com throughput 9 vezes maior e latência 7,5 vezes menor que um único nó.
  • Só as otimizações de software elevaram os resultados do v6.1 em até 1,6 vez frente ao v6.0.
  • A Nvidia diz ter seguido otimizando o software após o prazo de submissão da v6.1, com ganhos adicionais em GPT-OSS-120B e DLRMv3 ainda não verificados pela MLCommons.
  • No teste DeepSeek-R1, o melhor resultado por acelerador no cenário server foi 5,7 vezes maior que um ano antes, na v5.1.
  • A rodada acrescentou um benchmark de RAG ponta a ponta e um de inferência agêntica em edge, este testado pela Nvidia com o Jetson AGX Thor e o modelo Qwen3.6-27B.

O Vera Rubin entrou em produção plena, com sistemas previstos para começar a ser enviados no outono de 2026 no hemisfério norte. Os resultados em preview são a primeira medição revisada por pares da plataforma.

Separadamente, em um encontro de executivos de IA na Escócia, Jensen Huang disse que a Nvidia espera vender em 2027 o dobro de chips que em 2026.

Fontes primárias

MLCommons

MLCommons Sets Participation Record with New MLPerf Inference v6.1 Benchmark Results

MLCommons divulga os resultados do MLPerf Inference v6.1, com participação recorde de 30 organizações submissoras. Entre os aceleradores inéditos nesta rodada está o NVIDIA Vera Rubin NVL72, submetido em status "preview". O comunicado destaca ganhos de geração para geração: 2,99x no teste de modelo de linguagem visual frente ao v6.0 e 5,7x no DeepSeek-R1 frente ao v5.1 (um ano antes). A rodada também introduz dois benchmarks novos: RAG (Retrieval-Augmented Generation) ponta a ponta e Edge Agentic Inference, refletindo a evolução do setor para cargas de trabalho agentic e multi-etapa.

NVIDIA

NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut

Na estreia do Vera Rubin NVL72 no MLPerf Inference v6.1 (submissão preview), a NVIDIA reporta throughput até 3,7x maior que o GB300 NVL72 no benchmark Qwen3-VL (cenários offline, server e interactive), usando vLLM com o framework de inferência open source NVIDIA Dynamo. No DeepSeek-R1, usando a biblioteca NVIDIA TensorRT-LLM, o ganho reportado é de até 2,5x sobre o GB300 NVL72. As submissões do Vera Rubin usaram fortemente serving desagregado (separação de prefill e decode) e paralelismo de especialistas (expert parallelism). Em cargas agentic, no benchmark AgentX da SemiAnalysis, o Vera Rubin teria desempenho até 30x superior ao GB300 em testes preview. Entre v6.0 e v6.1, o próprio GB300 NVL72 ganhou até 1,6x de performance no Qwen3-VL via otimizações de precisão e fusão de kernels.

Comentários

Carregando comentários...