Daily Journal

E251|推理芯片之战:聊聊Groq、Cerebras与OpenAI三大路径与Bill Dally的设计哲学

硅谷101播客16 de setembro de 20261h31minVer no YouTube|

Arquitetura de Chips de Inferência: Groq, Cerebras, OpenAI e a Filosofia de Bill Dally

Discussão técnica conduzida por Hongjun (fundadora do Silicon Valley 101) com dois empreendedores de semicondutores para IA: Mark (ex-doutorando de Bill Dally, cientista-chefe da NVIDIA) e Xu Ziyang (ex-pesquisador da Annapurna Labs da Amazon, onde trabalhou na pilha de software e compiladores dos chips Trainium).


Treinamento vs. Inferência: Computação vs. Largura de Banda de Memória

A distinção fundamental entre chips voltados para treinamento e para inferência reside na métrica física limitante:

  • Treinamento e fase de Prefill (Inferência): São processos compute-bound (limitados por poder computacional). Na etapa de prefill, o prompt completo do usuário é processado em paralelo de uma só vez. O modelo é lido da memória uma única vez para calcular as ativações de dezenas ou centenas de tokens de entrada simultaneamente, alcançando alto paralelismo e alta taxa de ocupação dos núcleos de computação.
  • Fase de Decode (Inferência): É estritamente memory bandwidth-bound (limitada pela largura de banda da memória). A geração ocorre de forma autorregressiva, token por token. Para gerar cada novo token, a totalidade dos pesos do modelo (por exemplo, um modelo de 1,6 trilhão de parâmetros) precisa ser transferida da memória para as unidades de processamento.

O problema do Batching nas GPUs

Como a leitura de centenas de gigabytes de pesos de uma HBM para gerar apenas um token de um único usuário desperdiçaria quase toda a capacidade computacional da GPU, os data centers utilizam batching massivo (agrupamento de 10.000 requisições simultâneas, por exemplo). A GPU processa o primeiro token de 10.000 usuários em paralelo em cada passagem de memória. A desvantagem direta para o usuário final é a latência: a resposta individual fica lenta porque o usuário é obrigado a esperar a computação dos outros 9.999 tokens do lote.


A Física da Memória: SRAM, DRAM e HBM

A viabilidade econômica e o desempenho da inferência dependem da distância física e da tecnologia de armazenamento dos pesos:

  • DRAM: Densidade alta, utiliza 1 transistor e 1 capacitor por bit. Fica fisicamente distante do chip de cálculo, operando com latência alta (50 a 100 ns) e largura de banda limitada por barramentos externos.
  • HBM (High Bandwidth Memory): Empilhamento 3D de DRAM sobre interposer de silício ao lado do chip de cálculo. Aumenta expressivamente a largura de banda através de barramentos ultra-largos, mas possui custo financeiro proibitivo e sofre com escassez global de fabricação.
  • SRAM: Integrada diretamente no mesmo silício das unidades de computação. Utiliza 6 transistores por bit. Oferece latência ínfima (0,3 a 3 ns) e largura de banda de 2 a 3 ordens de magnitude superior à HBM por unidade de custo, mas sua densidade física é baixíssima (cerca de duas ordens de magnitude menor que HBM em área equivalente).

Rotas Arquiteturais: Groq vs. Cerebras

Ambas as empresas perceberam que eliminar o gargalo de largura de banda exige colocar os pesos em SRAM, mas adotaram abordagens radicalmente distintas para contornar a limitação de capacidade:

Groq (Escalonamento Estático e Determinismo)

  • Filosofia de Jonathan Ross: Projetada pelo cofundador da TPU do Google com foco total no compilador. A Groq removeu controladores dinâmicos de hardware, dependendo de um compilador 100% estático que mapeia exatamente qual ciclo de clock executará qual instrução e qual ciclo fará a comunicação inter-chip.
  • Vantagem: Elimina o overhead de controle em tempo de execução e garante determinismo temporal estrito.
  • Gargalo com MoE (Mixture of Experts): A Groq foi concebida antes da popularização dos Transformers e de redes MoE. Em modelos MoE (como DeepSeek), os especialistas ativados variam dinamicamente a cada token em tempo de execução (ex.: selecionar 8 de 128 especialistas). O compilador estático não consegue prever quais chips serão acionados, forçando estratégias conservadoras (como enviar dados para todos os nós), o que gera nós ociosos (idling) e degrada a eficiência de custo.

Cerebras (Wafer-Scale Engine)

  • Filosofia: Para evitar a penalidade física de conectar centenas de chips discretos em racks, a Cerebras constrói um chip do tamanho de um wafer inteiro de silício, mantendo toda a comunicação dentro do mesmo substrato com larguras de banda internas extremas.
  • Vantagens de Velocidade: Atinge taxas de geração de 750 a 2.000 tokens/s por usuário.
  • Gargalos de Custo e Yield (Rendimento):
    • Em wafers convencionais cortados em dies de 800 mm², se o rendimento for de 50%, aproveitam-se 20 dies funcionais de 40 possíveis.
    • Na Cerebras, o produto é o wafer completo. Apesar de possuir redundância de software para contornar cerca de 30% de núcleos defeituosos, defeitos em barramentos críticos podem inutilizar wafers inteiros. Se 9 em cada 10 wafers falharem estruturalmente, o custo real de produção unitária dispara.
    • Exige engenharia de sistemas proprietária para refrigeração, alimentação elétrica e gabinetes que não seguem os padrões de mercado.

O Acqui-hire da Groq pela NVIDIA e a Superação do CUDA na Inferência

  • Por que a NVIDIA absorveu a Groq: A divisão de pesquisa da NVIDIA (NV Research) estuda arquiteturas CGRA e processamento baseado em SRAM há anos, mas transferir inovações disruptivas para a linha de produtos principal é burocrático e lento. Adquirir a Groq permitiu internalizar uma equipe pronta e construir sistemas híbridos (GPUs para prefill/treinamento e chips SRAM para decode).
  • Inevitabilidade do fim do monopólio do CUDA na inferência: Em treinamento, a conveniência do ecossistema de software do CUDA supera custos operacionais. Na inferência, o custo marginal do token dita o modelo de negócios. Provedores aceitam softwares complexos ou compiladores proprietários (como TPU/JAX ou Trainium) se isso trouxer ganhos de 10x em custo-benefício. Além disso, a proliferação de modelos abertos baseados unicamente em arquiteturas Transformer padronizadas permite que ferramentas de IA auxiliem na escrita e otimização automatizada de kernels para novos hardwares em poucas semanas.

Métricas de Desempenho e Proposta de Cluster de SRAM

Mark e Xu Ziyang detalham o projeto de seu próprio chip de inferência baseado em SRAM:

  • Capacidade vs. Escala: Com dies individuais comportando cerca de 500 MB de SRAM, um modelo de 1 TB (quantizado em FP8) requer uma malha interconectada de 1.000 a 2.000 chips para armazenar os pesos integralmente em SRAM.
  • Topologia de Rede: O estado oculto (hidden state) do token trafega linearmente de chip em chip através de uma topologia de rede proprietária de ultra-baixa latência, garantindo que a comunicação inter-chip não engargale a taxa de transferência.
  • Ganhos Alvo: Aumento de 2 a 3 ordens de magnitude na velocidade de geração por usuário (de dezenas de tokens/s para 1.000 a 10.000 tokens/s) e redução de 10x no custo operacional total por token em comparação com soluções convencionais GPU + HBM.

A Urgência da Velocidade: Por que o Humano não é o Gargalo

Contra o argumento de que humanos leem a apenas 50–100 tokens/s, Xu Ziyang e Mark defendem que a velocidade máxima de inferência é crítica para a inteligência de sistemas autônomos (Agents):

  • A maior parte dos tokens gerados no futuro será consumida por outros agentes de IA em cadeias de pensamento (Chain-of-Thought / reflexão interna), e não por olhos humanos.
  • A resolução de problemas complexos (como diagnóstico de doenças ou previsões de mercado financeiro com prazo de validade) depende da quantidade de raciocínio que o sistema consegue executar dentro de uma janela temporal fixa. O tempo é a restrição definitiva da inteligência.

Roofline Model: MFU vs. MBU

  • MFU (Model FLOPs Utilization): Mede o percentual de tempo em que as unidades de multiplicação de matrizes estão efetivamente computando, e não ociosas esperando dados.
  • MBU (Memory Bandwidth Utilization): Mede o percentual da largura de banda de memória saturado. Em inferência de decode de baixa latência, o MBU costuma bater 100%, enquanto o MFU cai drasticamente, pois o sistema é puramente limitado pela velocidade de transferência dos dados.

Fases de Desenvolvimento de um Chip de IA e Vantagens da Cadeia na China

O ciclo de desenvolvimento de semicondutores é dividido em etapas estritas:

  1. Definição de Requisitos e Arquitetura de Sistema: Análise do workload dos próximos 2 a 3 anos.
  2. Microarquitetura: Definição dos núcleos de cálculo (matrizes e vetores), conjuntos de instruções (ISA) e localização física da SRAM.
  3. Codificação RTL (Register-Transfer Level): Demora de 2 a 3 meses.
  4. Verificação Funcional: Fase mais longa e crítica; testes exaustivos para evitar qualquer erro de silício.
  5. Backend Design e Layout: Mapeamento físico dos transistores e caminhos de roteamento conforme as regras da fundição (SDC/DRC).
  6. Tape-out: Envio do layout para a fundição fabricar as máscaras litográficas (custo de milhões de dólares).
  7. Packaging e Testes de Rendimento: Montagem no encapsulamento final e conexão das trilhas microscópicas à placa de circuito impresso.

Vantagens Competitivas na China

  • Infraestrutura e Energia: A divisão do TCO nos EUA é de cerca de 66% em energia elétrica (devido à escassez de capacidade na rede) e 33% em Capex. Na China, o custo elétrico e a disponibilidade de infraestrutura de refrigeração e construção de data centers invertem essa proporção para cerca de 33% em energia.
  • Disponibilidade da Cadeia: Agilidade no ecossistema de fornecedores de packaging e montagem.
  • Ecossistema Aberto: A proliferação de modelos abertos de alta qualidade (como Qwen e Llama) permite que startups de hardware otimizem seus chips para modelos reais sem depender de parcerias fechadas com laboratórios de ponta.

Filosofia de Engenharia: Bill Dally e Annapurna Labs

Os Princípios de Bill Dally (NVIDIA)

Mark compartilha a abordagem de seu mentor acadêmico:

  • Pesquisa de Problemas Fundamentais: Dally rejeita focar em "frutos baixos" (low-hanging fruits). Em 2017, enquanto o mercado focava apenas em redes neurais de percepção/conexão, Dally já orientava pesquisas sobre hardware especializado para IA de lógica simbólica rigorosa e grafos de conhecimento (aplicada hoje à prova automática de teoremas matemáticos).
  • Tudo gira em torno da Localidade: A eficiência computacional depende de manter os dados o mais próximo possível das unidades de cálculo no espaço e no tempo.
  • Sair de Mínimos Locais Exige Sacrifício: Melhorias incrementais permitem preservar todo o ecossistema anterior. Ganhos de ordens de magnitude exigem abrir mão deliberadamente de certas flexibilidades para maximizar um gargalo específico.
  • Conselho Prático aos Empreendedores: "Nunca utilize código escrito por alunos de PhD em produtos de produção comercial."

A Metodologia da Annapurna Labs (Amazon)

Xu Ziyang sintetiza a abordagem aplicada nos chips Trainium e Inferentia:

  • Customer Obsession e Working Backwards: O design do silício começa pelas necessidades de software do cliente final e desce progressivamente até o hardware, e não o inverso.
  • Proporção Computação/Largura de Banda: A métrica fundamental de projeto é a intensidade aritmética necessária para o workload. É preciso dimensionar o equilíbrio exato entre FLOPS e bytes transferidos para que a memória e as unidades de cálculo alcancem saturação simultânea nos modelos que estarão em produção 3 anos após o início do projeto.

Análise do Chip Jalapeño (OpenAI & Broadcom)

Em adendo gravado após o anúncio da OpenAI em 24 de junho de 2026 sobre seu chip proprietário de inferência, Jalapeño, Xu Ziyang avalia os trade-offs da empresa:

  • Desenvolvimento Ágil: Concluído em 9 meses do projeto ao tape-out, graças ao uso intensivo de agentes de IA (Codex) para geração e otimização de kernels em linguagem Wulong e automação de etapas de design de circuitos.
  • Opção por HBM4 (15,4 TB/s por pacote): Ao contrário das startups de SRAM que priorizam o menor custo por chip, a OpenAI possui abundância de capital financeiro, mas restrição severa de energia elétrica nos data centers norte-americanos. A prioridade máxima do Jalapeño é a métrica de Tokens por Megawatt (eficiência energética), superando a arquitetura Rubin da NVIDIA.
  • Heterogeneidade Intra-Chip vs. Nível de Sistema: Em vez de separar o pipeline em chips diferentes (SRAM para decode e GPU para prefill), o Jalapeño é um processador monolítico ultra-versátil. Ele integra suporte nativo a operações de matrizes de pequenas dimensões para baixa latência em batch size unitário, processa prefill e decode no mesmo silício e prevê compatibilidade com cargas de treino e modelos multimodais futuros.