Daily Journal

Ep. 030 - Rubin Ultra Drops From 1 TB to 192GB of HBM (Memory)

SemiAnalysis14 de setembro de 202638minVer no YouTube|

A revisão arquitetural dos futuros aceleradores de inteligência artificial da NVIDIA reflete uma mudança estrutural na cadeia de suprimentos de semicondutores e nos paradigmas de modelagem de IA. Jordan Nanos e Myron Xie, analistas da SemiAnalysis, detalham por que o carro-chefe Rubin Ultra teve sua especificação de memória High Bandwidth Memory (HBM) reduzida de 1 TB para 192 GB por pacote, marcando a primeira vez no histórico recente da empresa em que uma GPU de nova geração chega ao mercado com menos capacidade de memória do que a geração anterior (Blackwell Ultra e Rubin padrão, ambas com 288 GB).


Redução de Especificações: De 1 TB para 192 GB no Rubin Ultra

No anúncio conceitual inicial do Rubin Ultra durante a GTC da NVIDIA, a projeção previa:

  • 1 TB de memória HBM por pacote.
  • Configuração de silício: 4 dies de computação (compute dies) integrados a 16 pilhas (stacks) de memória HBM4E.
  • Estrutura de empilhamento: matrizes DRAM de 32 Gb (4 GB por die) empilhadas a 16 camadas de altura (16-Hi).

A especificação real revisada para lançamento comercial foi ajustada para:

  • 192 GB de memória HBM por pacote.
  • Configuração de silício: 2 dies de computação por pacote.
  • Estrutura de empilhamento: memória HBM4 inicial (3 GB por die DRAM) configurada em pilhas de 8 camadas (8-Hi).
  • Comparativo de linha: 192 GB é inferior aos 288 GB do Blackwell Ultra (B300) e do Rubin convencional, ambos sustentados por pilhas 12-Hi de HBM3E/HBM4.

A Escassez de Wafers de DRAM como Vetor da Mudança

A principal motivação para a redução de capacidade não é limitação de engenharia ou desempenho térmico, mas sim a oferta física restrita de DRAM na indústria global:

  • Racionamento de DRAM: Os fornecedores de memória e clientes como NVIDIA, Google e Broadcom enfrentam uma capacidade finita de wafers de DRAM alocados. Se a NVIDIA utilizasse pilhas 12-Hi ou 16-Hi, o volume de silício DRAM consumido por acelerador limitaria severamente o número total de GPUs que poderiam ser encapsuladas junto à TSMC.
  • Maximização de unidades: Reduzir o empilhamento para 8-Hi (e a proposta da indústria de avançar para 4-Hi) permite extrair significativamente mais cubos funcionais de HBM a partir da mesma cota de wafers brutos de DRAM, viabilizando o envio de um número muito maior de aceleradores lógicos completos.
  • Equilíbrio de CoWoS e lógica: O gargalo deixa de ser a capacidade de empacotamento avançado da TSMC e passa a ser a disponibilidade de bits de memória por chip.

Dinâmica Técnica e Econômica: Capacidade vs. Largura de Banda (Bandwidth)

O Limite Físico do Barramento HBM

  • Interface de I/O: O barramento físico entre o cubo HBM4/HBM4E e o die de lógica de computação conta com 2.048 conexões de sinal/dados (I/O). Cada camada de DRAM no cubo suporta até 512 I/Os.
  • Saturação em 4-Hi: Para saturar completamente os 2.048 fios de dados e entregar 100% da largura de banda teórica da pilha, são necessárias apenas 4 camadas de DRAM (4-Hi). Fisicamente, um cubo 1-Hi ou 2-Hi não conseguiria entregar a largura de banda máxima do barramento.
  • Custo por Gigabyte vs. Largura de Banda: Os fornecedores de memória (SK Hynix, Samsung, Micron) cobram HBM com base na capacidade em dólares por gigabyte ($/GB). Pilhas 8-Hi ou 12-Hi dobram ou triplicam o preço do cubo de HBM sem fornecer nenhum ganho adicional de largura de banda em relação a um cubo 4-Hi. Para cargas de trabalho dependentes exclusivamente de bandwidth, o acréscimo de camadas de DRAM torna-se um custo excedente com retornos decrescentes.

Mudança no Perfil das Cargas de Trabalho (Inferência e Pós-Treinamento)

  • Transição de Pré-treino para Inferência: O consumo de computação nos laboratórios de ponta (frontier labs) passou a ser dominado por inferência e pós-treinamento (reinforcement learning, cadeias de raciocínio). Ao contrário do pré-treinamento clássico, essas etapas são limitadas por largura de banda por token gerado, e não por capacidade pura de armazenamento de parâmetros.
  • Infraestrutura de Data Centers: Os novos data centers comissionados priorizam nós distribuídos para pesquisa, pós-treino e inferência em vez de clusters centralizados monolíticos de mais de 100.000 GPUs dedicados a uma única corrida de pré-treino de modelos de dezenas de trilhões de parâmetros.

Redução da Pressão de Capacidade nos Modelos e Sistemas

A necessidade de gigabytes massivos por chip caiu em decorrência da evolução das arquiteturas de sistemas e técnicas de modelagem:

  • Expansão do Domínio de Scale-Up:
    • Na era Hopper (HGX H100), um nó de 8 GPUs somava 640 GB de HBM. Um modelo como o Llama 3.1 405B quantizado em FP8 ocupava ~405 GB, consumindo mais de 60% da memória total do nó.
    • Na era GB200 NVL72, o domínio unificado de 72 GPUs soma ~20,7 TB de HBM. Um modelo de grande porte como o Kimi K3 (2,88 trilhões de parâmetros, da Moonshot AI), quando quantizado em MXFP4, consome apenas ~8% da memória total do rack NVL72.
    • O ecossistema Rubin Ultra expandirá a interconexão NVLink para racks NVL576 (um aumento de 8 vezes no tamanho do domínio de scale-up), multiplicando a capacidade agregada disponível mesmo com chips individuais de menor densidade (192 GB).
  • Técnicas Algorítmicas de Eficiência:
    • Modelos recentes evitam o crescimento bruto de contagem de parâmetros através de looped transformers (confirmado no GPT-5 / GPT-6 Astra), que passam entradas pelas mesmas camadas múltiplas vezes para adicionar profundidade de computação sem expandir a pegada de memória do modelo.
    • Quantização avançada (MXFP4) e técnicas de raciocínio em tempo de inferência substituem a necessidade de modelos densos de mais de 10 a 20 trilhões de parâmetros.

Impactos na Manufatura e Cadeia de Suprimentos

Rendimento (Yield) e Fabricação de Cubos 4-Hi vs. 12-Hi

  • Perda Cumulativa de Rendimento: A fabricação de pilhas HBM sofre perdas a cada camada adicionada. Assumindo um rendimento de 99% por camada de DRAM, o empilhamento de 12 camadas sofre perdas compostas muito maiores do que uma pilha 4-Hi.
  • Entrega de Energia: A transmissão de energia elétrica vertical ao longo de 4 dies de DRAM é significativamente mais simples e gera menos problemas térmicos e estruturais do que em pilhas de 8 ou 12 camadas.
  • Colheita de Cubos (Harvesting): A transição para 4-Hi permite mais do que dobrar a quantidade líquida de cubos HBM finais utilizáveis a partir do mesmo volume de wafers brutos processados.

Efeitos Colaterais no Resto da Cadeia

  • Deslocamento do Gargalo: Ao aliviar o suprimento de HBM, os pontos de estrangulamento da indústria migram para:
    • Wafers de lógica avançada na TSMC.
    • Substratos ABF de alta densidade.
    • Placas de circuito impresso (PCBs).
    • Disponibilidade de energia elétrica nos data centers.
  • Alívio na DRAM Tradicional de Servidores: A alta demanda por HBM vinha canibalizando linhas de produção de DRAM commodity, forçando a degradação de especificações (d-specing) de memória por soquete em servidores convencionais. O alívio de wafers de DRAM beneficia servidores com CPUs responsáveis por chamadas de ferramentas (tool calls) em pipelines de IA generativa.

Projeções para a Indústria e Segmentação de SKUs

Perspectiva de Suprimento de Memória até 2030

Myron Xie afirma que o alívio estrutural na escassez global de DRAM e HBM não deve ocorrer antes do fim desta década (2030). A expansão não pode ser acelerada a curto prazo devido a:

  1. Prazos longos de construção e qualificação de novas salas limpas (clean rooms).
  2. Prazos extensos de entrega de maquinário litográfico avançado (EUV da ASML), limitados por cadeias industriais ultracomplexas (como a produção de espelhos de precisão).

Adoção por Outros Fabricantes e Proliferação de SKUs Customizados

  • Acompanhamento de Mercado: A SemiAnalysis projeta que outros fornecedores de aceleradores (como AMD, Google e Broadcom) readequarão seus roteiros para adotar pilhas HBM de menor altura (8-Hi e 4-Hi) a fim de garantir volume de entrega.
  • Diversificação de Modelos: Cresce a oferta de modelos customizados (custom/semi-custom SKUs) para hyperscalers com necessidades distintas de memória. Como exemplo, a Meta contratou variantes personalizadas do acelerador AMD Instinct MI450 utilizando pilhas 8-Hi em vez da configuração padrão de 12-Hi.
  • Condição de Retorno a Pilhas Altas: Apenas no cenário em que novos modelos de fronteira superem em 3 vezes ou mais a escala de parâmetros do Kimi K3 é que o ganho de eficiência de loteamento (batching economics) justificará novamente o custo financeiro e o consumo de silício de pilhas 8-Hi ou 12-Hi.