Ep. 030 - Rubin Ultra Drops From 1 TB to 192GB of HBM (Memory)
A revisão arquitetural dos futuros aceleradores de inteligência artificial da NVIDIA reflete uma mudança estrutural na cadeia de suprimentos de semicondutores e nos paradigmas de modelagem de IA. Jordan Nanos e Myron Xie, analistas da SemiAnalysis, detalham por que o carro-chefe Rubin Ultra teve sua especificação de memória High Bandwidth Memory (HBM) reduzida de 1 TB para 192 GB por pacote, marcando a primeira vez no histórico recente da empresa em que uma GPU de nova geração chega ao mercado com menos capacidade de memória do que a geração anterior (Blackwell Ultra e Rubin padrão, ambas com 288 GB).
Redução de Especificações: De 1 TB para 192 GB no Rubin Ultra
No anúncio conceitual inicial do Rubin Ultra durante a GTC da NVIDIA, a projeção previa:
- 1 TB de memória HBM por pacote.
- Configuração de silício: 4 dies de computação (compute dies) integrados a 16 pilhas (stacks) de memória HBM4E.
- Estrutura de empilhamento: matrizes DRAM de 32 Gb (4 GB por die) empilhadas a 16 camadas de altura (16-Hi).
A especificação real revisada para lançamento comercial foi ajustada para:
- 192 GB de memória HBM por pacote.
- Configuração de silício: 2 dies de computação por pacote.
- Estrutura de empilhamento: memória HBM4 inicial (3 GB por die DRAM) configurada em pilhas de 8 camadas (8-Hi).
- Comparativo de linha: 192 GB é inferior aos 288 GB do Blackwell Ultra (B300) e do Rubin convencional, ambos sustentados por pilhas 12-Hi de HBM3E/HBM4.
A Escassez de Wafers de DRAM como Vetor da Mudança
A principal motivação para a redução de capacidade não é limitação de engenharia ou desempenho térmico, mas sim a oferta física restrita de DRAM na indústria global:
- Racionamento de DRAM: Os fornecedores de memória e clientes como NVIDIA, Google e Broadcom enfrentam uma capacidade finita de wafers de DRAM alocados. Se a NVIDIA utilizasse pilhas 12-Hi ou 16-Hi, o volume de silício DRAM consumido por acelerador limitaria severamente o número total de GPUs que poderiam ser encapsuladas junto à TSMC.
- Maximização de unidades: Reduzir o empilhamento para 8-Hi (e a proposta da indústria de avançar para 4-Hi) permite extrair significativamente mais cubos funcionais de HBM a partir da mesma cota de wafers brutos de DRAM, viabilizando o envio de um número muito maior de aceleradores lógicos completos.
- Equilíbrio de CoWoS e lógica: O gargalo deixa de ser a capacidade de empacotamento avançado da TSMC e passa a ser a disponibilidade de bits de memória por chip.
Dinâmica Técnica e Econômica: Capacidade vs. Largura de Banda (Bandwidth)
O Limite Físico do Barramento HBM
- Interface de I/O: O barramento físico entre o cubo HBM4/HBM4E e o die de lógica de computação conta com 2.048 conexões de sinal/dados (I/O). Cada camada de DRAM no cubo suporta até 512 I/Os.
- Saturação em 4-Hi: Para saturar completamente os 2.048 fios de dados e entregar 100% da largura de banda teórica da pilha, são necessárias apenas 4 camadas de DRAM (4-Hi). Fisicamente, um cubo 1-Hi ou 2-Hi não conseguiria entregar a largura de banda máxima do barramento.
- Custo por Gigabyte vs. Largura de Banda: Os fornecedores de memória (SK Hynix, Samsung, Micron) cobram HBM com base na capacidade em dólares por gigabyte ($/GB). Pilhas 8-Hi ou 12-Hi dobram ou triplicam o preço do cubo de HBM sem fornecer nenhum ganho adicional de largura de banda em relação a um cubo 4-Hi. Para cargas de trabalho dependentes exclusivamente de bandwidth, o acréscimo de camadas de DRAM torna-se um custo excedente com retornos decrescentes.
Mudança no Perfil das Cargas de Trabalho (Inferência e Pós-Treinamento)
- Transição de Pré-treino para Inferência: O consumo de computação nos laboratórios de ponta (frontier labs) passou a ser dominado por inferência e pós-treinamento (reinforcement learning, cadeias de raciocínio). Ao contrário do pré-treinamento clássico, essas etapas são limitadas por largura de banda por token gerado, e não por capacidade pura de armazenamento de parâmetros.
- Infraestrutura de Data Centers: Os novos data centers comissionados priorizam nós distribuídos para pesquisa, pós-treino e inferência em vez de clusters centralizados monolíticos de mais de 100.000 GPUs dedicados a uma única corrida de pré-treino de modelos de dezenas de trilhões de parâmetros.
Redução da Pressão de Capacidade nos Modelos e Sistemas
A necessidade de gigabytes massivos por chip caiu em decorrência da evolução das arquiteturas de sistemas e técnicas de modelagem:
- Expansão do Domínio de Scale-Up:
- Na era Hopper (HGX H100), um nó de 8 GPUs somava 640 GB de HBM. Um modelo como o Llama 3.1 405B quantizado em FP8 ocupava ~405 GB, consumindo mais de 60% da memória total do nó.
- Na era GB200 NVL72, o domínio unificado de 72 GPUs soma ~20,7 TB de HBM. Um modelo de grande porte como o Kimi K3 (2,88 trilhões de parâmetros, da Moonshot AI), quando quantizado em MXFP4, consome apenas ~8% da memória total do rack NVL72.
- O ecossistema Rubin Ultra expandirá a interconexão NVLink para racks NVL576 (um aumento de 8 vezes no tamanho do domínio de scale-up), multiplicando a capacidade agregada disponível mesmo com chips individuais de menor densidade (192 GB).
- Técnicas Algorítmicas de Eficiência:
- Modelos recentes evitam o crescimento bruto de contagem de parâmetros através de looped transformers (confirmado no GPT-5 / GPT-6 Astra), que passam entradas pelas mesmas camadas múltiplas vezes para adicionar profundidade de computação sem expandir a pegada de memória do modelo.
- Quantização avançada (MXFP4) e técnicas de raciocínio em tempo de inferência substituem a necessidade de modelos densos de mais de 10 a 20 trilhões de parâmetros.
Impactos na Manufatura e Cadeia de Suprimentos
Rendimento (Yield) e Fabricação de Cubos 4-Hi vs. 12-Hi
- Perda Cumulativa de Rendimento: A fabricação de pilhas HBM sofre perdas a cada camada adicionada. Assumindo um rendimento de 99% por camada de DRAM, o empilhamento de 12 camadas sofre perdas compostas muito maiores do que uma pilha 4-Hi.
- Entrega de Energia: A transmissão de energia elétrica vertical ao longo de 4 dies de DRAM é significativamente mais simples e gera menos problemas térmicos e estruturais do que em pilhas de 8 ou 12 camadas.
- Colheita de Cubos (Harvesting): A transição para 4-Hi permite mais do que dobrar a quantidade líquida de cubos HBM finais utilizáveis a partir do mesmo volume de wafers brutos processados.
Efeitos Colaterais no Resto da Cadeia
- Deslocamento do Gargalo: Ao aliviar o suprimento de HBM, os pontos de estrangulamento da indústria migram para:
- Wafers de lógica avançada na TSMC.
- Substratos ABF de alta densidade.
- Placas de circuito impresso (PCBs).
- Disponibilidade de energia elétrica nos data centers.
- Alívio na DRAM Tradicional de Servidores: A alta demanda por HBM vinha canibalizando linhas de produção de DRAM commodity, forçando a degradação de especificações (d-specing) de memória por soquete em servidores convencionais. O alívio de wafers de DRAM beneficia servidores com CPUs responsáveis por chamadas de ferramentas (tool calls) em pipelines de IA generativa.
Projeções para a Indústria e Segmentação de SKUs
Perspectiva de Suprimento de Memória até 2030
Myron Xie afirma que o alívio estrutural na escassez global de DRAM e HBM não deve ocorrer antes do fim desta década (2030). A expansão não pode ser acelerada a curto prazo devido a:
- Prazos longos de construção e qualificação de novas salas limpas (clean rooms).
- Prazos extensos de entrega de maquinário litográfico avançado (EUV da ASML), limitados por cadeias industriais ultracomplexas (como a produção de espelhos de precisão).
Adoção por Outros Fabricantes e Proliferação de SKUs Customizados
- Acompanhamento de Mercado: A SemiAnalysis projeta que outros fornecedores de aceleradores (como AMD, Google e Broadcom) readequarão seus roteiros para adotar pilhas HBM de menor altura (8-Hi e 4-Hi) a fim de garantir volume de entrega.
- Diversificação de Modelos: Cresce a oferta de modelos customizados (custom/semi-custom SKUs) para hyperscalers com necessidades distintas de memória. Como exemplo, a Meta contratou variantes personalizadas do acelerador AMD Instinct MI450 utilizando pilhas 8-Hi em vez da configuração padrão de 12-Hi.
- Condição de Retorno a Pilhas Altas: Apenas no cenário em que novos modelos de fronteira superem em 3 vezes ou mais a escala de parâmetros do Kimi K3 é que o ganho de eficiência de loteamento (batching economics) justificará novamente o custo financeiro e o consumo de silício de pilhas 8-Hi ou 12-Hi.
