E251|推理芯片之战:聊聊Groq、Cerebras与OpenAI三大路径与Bill Dally的设计哲学
Arquitetura de Chips de Inferência: Groq, Cerebras, OpenAI e a Filosofia de Bill Dally
Discussão técnica conduzida por Hongjun (fundadora do Silicon Valley 101) com dois empreendedores de semicondutores para IA: Mark (ex-doutorando de Bill Dally, cientista-chefe da NVIDIA) e Xu Ziyang (ex-pesquisador da Annapurna Labs da Amazon, onde trabalhou na pilha de software e compiladores dos chips Trainium).
Treinamento vs. Inferência: Computação vs. Largura de Banda de Memória
A distinção fundamental entre chips voltados para treinamento e para inferência reside na métrica física limitante:
- Treinamento e fase de Prefill (Inferência): São processos compute-bound (limitados por poder computacional). Na etapa de prefill, o prompt completo do usuário é processado em paralelo de uma só vez. O modelo é lido da memória uma única vez para calcular as ativações de dezenas ou centenas de tokens de entrada simultaneamente, alcançando alto paralelismo e alta taxa de ocupação dos núcleos de computação.
- Fase de Decode (Inferência): É estritamente memory bandwidth-bound (limitada pela largura de banda da memória). A geração ocorre de forma autorregressiva, token por token. Para gerar cada novo token, a totalidade dos pesos do modelo (por exemplo, um modelo de 1,6 trilhão de parâmetros) precisa ser transferida da memória para as unidades de processamento.
O problema do Batching nas GPUs
Como a leitura de centenas de gigabytes de pesos de uma HBM para gerar apenas um token de um único usuário desperdiçaria quase toda a capacidade computacional da GPU, os data centers utilizam batching massivo (agrupamento de 10.000 requisições simultâneas, por exemplo). A GPU processa o primeiro token de 10.000 usuários em paralelo em cada passagem de memória. A desvantagem direta para o usuário final é a latência: a resposta individual fica lenta porque o usuário é obrigado a esperar a computação dos outros 9.999 tokens do lote.
A Física da Memória: SRAM, DRAM e HBM
A viabilidade econômica e o desempenho da inferência dependem da distância física e da tecnologia de armazenamento dos pesos:
- DRAM: Densidade alta, utiliza 1 transistor e 1 capacitor por bit. Fica fisicamente distante do chip de cálculo, operando com latência alta (50 a 100 ns) e largura de banda limitada por barramentos externos.
- HBM (High Bandwidth Memory): Empilhamento 3D de DRAM sobre interposer de silício ao lado do chip de cálculo. Aumenta expressivamente a largura de banda através de barramentos ultra-largos, mas possui custo financeiro proibitivo e sofre com escassez global de fabricação.
- SRAM: Integrada diretamente no mesmo silício das unidades de computação. Utiliza 6 transistores por bit. Oferece latência ínfima (0,3 a 3 ns) e largura de banda de 2 a 3 ordens de magnitude superior à HBM por unidade de custo, mas sua densidade física é baixíssima (cerca de duas ordens de magnitude menor que HBM em área equivalente).
Rotas Arquiteturais: Groq vs. Cerebras
Ambas as empresas perceberam que eliminar o gargalo de largura de banda exige colocar os pesos em SRAM, mas adotaram abordagens radicalmente distintas para contornar a limitação de capacidade:
Groq (Escalonamento Estático e Determinismo)
- Filosofia de Jonathan Ross: Projetada pelo cofundador da TPU do Google com foco total no compilador. A Groq removeu controladores dinâmicos de hardware, dependendo de um compilador 100% estático que mapeia exatamente qual ciclo de clock executará qual instrução e qual ciclo fará a comunicação inter-chip.
- Vantagem: Elimina o overhead de controle em tempo de execução e garante determinismo temporal estrito.
- Gargalo com MoE (Mixture of Experts): A Groq foi concebida antes da popularização dos Transformers e de redes MoE. Em modelos MoE (como DeepSeek), os especialistas ativados variam dinamicamente a cada token em tempo de execução (ex.: selecionar 8 de 128 especialistas). O compilador estático não consegue prever quais chips serão acionados, forçando estratégias conservadoras (como enviar dados para todos os nós), o que gera nós ociosos (idling) e degrada a eficiência de custo.
Cerebras (Wafer-Scale Engine)
- Filosofia: Para evitar a penalidade física de conectar centenas de chips discretos em racks, a Cerebras constrói um chip do tamanho de um wafer inteiro de silício, mantendo toda a comunicação dentro do mesmo substrato com larguras de banda internas extremas.
- Vantagens de Velocidade: Atinge taxas de geração de 750 a 2.000 tokens/s por usuário.
- Gargalos de Custo e Yield (Rendimento):
- Em wafers convencionais cortados em dies de 800 mm², se o rendimento for de 50%, aproveitam-se 20 dies funcionais de 40 possíveis.
- Na Cerebras, o produto é o wafer completo. Apesar de possuir redundância de software para contornar cerca de 30% de núcleos defeituosos, defeitos em barramentos críticos podem inutilizar wafers inteiros. Se 9 em cada 10 wafers falharem estruturalmente, o custo real de produção unitária dispara.
- Exige engenharia de sistemas proprietária para refrigeração, alimentação elétrica e gabinetes que não seguem os padrões de mercado.
O Acqui-hire da Groq pela NVIDIA e a Superação do CUDA na Inferência
- Por que a NVIDIA absorveu a Groq: A divisão de pesquisa da NVIDIA (NV Research) estuda arquiteturas CGRA e processamento baseado em SRAM há anos, mas transferir inovações disruptivas para a linha de produtos principal é burocrático e lento. Adquirir a Groq permitiu internalizar uma equipe pronta e construir sistemas híbridos (GPUs para prefill/treinamento e chips SRAM para decode).
- Inevitabilidade do fim do monopólio do CUDA na inferência: Em treinamento, a conveniência do ecossistema de software do CUDA supera custos operacionais. Na inferência, o custo marginal do token dita o modelo de negócios. Provedores aceitam softwares complexos ou compiladores proprietários (como TPU/JAX ou Trainium) se isso trouxer ganhos de 10x em custo-benefício. Além disso, a proliferação de modelos abertos baseados unicamente em arquiteturas Transformer padronizadas permite que ferramentas de IA auxiliem na escrita e otimização automatizada de kernels para novos hardwares em poucas semanas.
Métricas de Desempenho e Proposta de Cluster de SRAM
Mark e Xu Ziyang detalham o projeto de seu próprio chip de inferência baseado em SRAM:
- Capacidade vs. Escala: Com dies individuais comportando cerca de 500 MB de SRAM, um modelo de 1 TB (quantizado em FP8) requer uma malha interconectada de 1.000 a 2.000 chips para armazenar os pesos integralmente em SRAM.
- Topologia de Rede: O estado oculto (hidden state) do token trafega linearmente de chip em chip através de uma topologia de rede proprietária de ultra-baixa latência, garantindo que a comunicação inter-chip não engargale a taxa de transferência.
- Ganhos Alvo: Aumento de 2 a 3 ordens de magnitude na velocidade de geração por usuário (de dezenas de tokens/s para 1.000 a 10.000 tokens/s) e redução de 10x no custo operacional total por token em comparação com soluções convencionais GPU + HBM.
A Urgência da Velocidade: Por que o Humano não é o Gargalo
Contra o argumento de que humanos leem a apenas 50–100 tokens/s, Xu Ziyang e Mark defendem que a velocidade máxima de inferência é crítica para a inteligência de sistemas autônomos (Agents):
- A maior parte dos tokens gerados no futuro será consumida por outros agentes de IA em cadeias de pensamento (Chain-of-Thought / reflexão interna), e não por olhos humanos.
- A resolução de problemas complexos (como diagnóstico de doenças ou previsões de mercado financeiro com prazo de validade) depende da quantidade de raciocínio que o sistema consegue executar dentro de uma janela temporal fixa. O tempo é a restrição definitiva da inteligência.
Roofline Model: MFU vs. MBU
- MFU (Model FLOPs Utilization): Mede o percentual de tempo em que as unidades de multiplicação de matrizes estão efetivamente computando, e não ociosas esperando dados.
- MBU (Memory Bandwidth Utilization): Mede o percentual da largura de banda de memória saturado. Em inferência de decode de baixa latência, o MBU costuma bater 100%, enquanto o MFU cai drasticamente, pois o sistema é puramente limitado pela velocidade de transferência dos dados.
Fases de Desenvolvimento de um Chip de IA e Vantagens da Cadeia na China
O ciclo de desenvolvimento de semicondutores é dividido em etapas estritas:
- Definição de Requisitos e Arquitetura de Sistema: Análise do workload dos próximos 2 a 3 anos.
- Microarquitetura: Definição dos núcleos de cálculo (matrizes e vetores), conjuntos de instruções (ISA) e localização física da SRAM.
- Codificação RTL (Register-Transfer Level): Demora de 2 a 3 meses.
- Verificação Funcional: Fase mais longa e crítica; testes exaustivos para evitar qualquer erro de silício.
- Backend Design e Layout: Mapeamento físico dos transistores e caminhos de roteamento conforme as regras da fundição (SDC/DRC).
- Tape-out: Envio do layout para a fundição fabricar as máscaras litográficas (custo de milhões de dólares).
- Packaging e Testes de Rendimento: Montagem no encapsulamento final e conexão das trilhas microscópicas à placa de circuito impresso.
Vantagens Competitivas na China
- Infraestrutura e Energia: A divisão do TCO nos EUA é de cerca de 66% em energia elétrica (devido à escassez de capacidade na rede) e 33% em Capex. Na China, o custo elétrico e a disponibilidade de infraestrutura de refrigeração e construção de data centers invertem essa proporção para cerca de 33% em energia.
- Disponibilidade da Cadeia: Agilidade no ecossistema de fornecedores de packaging e montagem.
- Ecossistema Aberto: A proliferação de modelos abertos de alta qualidade (como Qwen e Llama) permite que startups de hardware otimizem seus chips para modelos reais sem depender de parcerias fechadas com laboratórios de ponta.
Filosofia de Engenharia: Bill Dally e Annapurna Labs
Os Princípios de Bill Dally (NVIDIA)
Mark compartilha a abordagem de seu mentor acadêmico:
- Pesquisa de Problemas Fundamentais: Dally rejeita focar em "frutos baixos" (low-hanging fruits). Em 2017, enquanto o mercado focava apenas em redes neurais de percepção/conexão, Dally já orientava pesquisas sobre hardware especializado para IA de lógica simbólica rigorosa e grafos de conhecimento (aplicada hoje à prova automática de teoremas matemáticos).
- Tudo gira em torno da Localidade: A eficiência computacional depende de manter os dados o mais próximo possível das unidades de cálculo no espaço e no tempo.
- Sair de Mínimos Locais Exige Sacrifício: Melhorias incrementais permitem preservar todo o ecossistema anterior. Ganhos de ordens de magnitude exigem abrir mão deliberadamente de certas flexibilidades para maximizar um gargalo específico.
- Conselho Prático aos Empreendedores: "Nunca utilize código escrito por alunos de PhD em produtos de produção comercial."
A Metodologia da Annapurna Labs (Amazon)
Xu Ziyang sintetiza a abordagem aplicada nos chips Trainium e Inferentia:
- Customer Obsession e Working Backwards: O design do silício começa pelas necessidades de software do cliente final e desce progressivamente até o hardware, e não o inverso.
- Proporção Computação/Largura de Banda: A métrica fundamental de projeto é a intensidade aritmética necessária para o workload. É preciso dimensionar o equilíbrio exato entre FLOPS e bytes transferidos para que a memória e as unidades de cálculo alcancem saturação simultânea nos modelos que estarão em produção 3 anos após o início do projeto.
Análise do Chip Jalapeño (OpenAI & Broadcom)
Em adendo gravado após o anúncio da OpenAI em 24 de junho de 2026 sobre seu chip proprietário de inferência, Jalapeño, Xu Ziyang avalia os trade-offs da empresa:
- Desenvolvimento Ágil: Concluído em 9 meses do projeto ao tape-out, graças ao uso intensivo de agentes de IA (Codex) para geração e otimização de kernels em linguagem Wulong e automação de etapas de design de circuitos.
- Opção por HBM4 (15,4 TB/s por pacote): Ao contrário das startups de SRAM que priorizam o menor custo por chip, a OpenAI possui abundância de capital financeiro, mas restrição severa de energia elétrica nos data centers norte-americanos. A prioridade máxima do Jalapeño é a métrica de Tokens por Megawatt (eficiência energética), superando a arquitetura Rubin da NVIDIA.
- Heterogeneidade Intra-Chip vs. Nível de Sistema: Em vez de separar o pipeline em chips diferentes (SRAM para decode e GPU para prefill), o Jalapeño é um processador monolítico ultra-versátil. Ele integra suporte nativo a operações de matrizes de pequenas dimensões para baixa latência em batch size unitário, processa prefill e decode no mesmo silício e prevê compatibilidade com cargas de treino e modelos multimodais futuros.
