Daily Journal

Why Hardware-Software Co-Design Is AI's Real 100x: Dylan Patel of SemiAnalysis

Sequoia Capital30 de junho de 20261h10minVer no YouTube|

Contexto

Dylan Patel, fundador da SemiAnalysis, discute com Shaun Maguire e Sonya Huang (Sequoia Capital) a evolução da infraestrutura de IA. O foco central é o argumento de que os ganhos de performance mais significativos na IA não derivam apenas de chips mais rápidos, mas da co-otimização entre hardware, software e arquitetura de modelos.

Pontos Principais

  • Co-design Hardware-Software: Patel defende que a otimização conjunta (kernels, silício e arquitetura de modelo) gera ganhos exponenciais (100x) em comparação com melhorias isoladas em cada camada.
  • O Fim do "CUDA Moat": O domínio da Nvidia não se deve apenas ao CUDA, mas ao fato de que os modelos de ponta (como os de DeepSeek e Alibaba) são co-projetados especificamente para GPUs Nvidia. A vantagem é de ecossistema e otimização de arquitetura, não apenas de software.
  • InferenceX: Projeto de benchmarking da SemiAnalysis que rastreia o desempenho de modelos em mais de US$ 50 milhões em hardware. Patel observa uma queda anual de aproximadamente 60x no custo por unidade de qualidade.
  • Otimização de Modelos: Modelos como o DeepSeek V3 foram otimizados para a arquitetura Hopper da Nvidia. TPUs do Google, embora potentes, não rodam esses modelos com a mesma eficiência, demonstrando que a arquitetura do chip dita a viabilidade do modelo.
  • Demanda e Compute Crunch: A demanda por tarefas úteis de IA está crescendo mais rápido do que a capacidade de computação. Patel prevê que o mercado de inferência será maior que o de petróleo, atingindo escalas de terawatts até 2040.
  • Estratégia de Jensen Huang: A Nvidia financia ativamente "Neoclouds" e laboratórios de IA independentes para evitar um mundo onde apenas os grandes hyperscalers (Google, Amazon, Microsoft) controlem a infraestrutura, garantindo um ecossistema multipolar que favoreça a venda de GPUs.

"A inovação real acontece quando você pula algumas camadas, co-otimiza e co-projeta, e de repente, o que poderia ser um 2x aqui e um 2x ali, torna-se 100x."

Implicações

  • Especialização de Hardware: A tendência é de maior bifurcação entre arquiteturas de hardware e modelos. Empresas que tentam rodar modelos otimizados para uma arquitetura em outra (ex: rodar DeepSeek em TPUs) enfrentarão ineficiências severas.
  • O Papel das Neoclouds: O sucesso de empresas como CoreWeave e Crusoe é impulsionado pela capacidade de entrega rápida de infraestrutura e pela falta de burocracia dos hyperscalers, tornando-as essenciais para o suprimento de curto prazo.
  • ROI de IA: Patel refuta a ideia de que IA não tem ROI. Ele monitora o custo por token e a receita gerada, afirmando que, para modelos de ponta, o custo da computação é secundário diante do valor da tarefa realizada.
  • Futuro da Computação: A longo prazo (10-20 anos), Patel vê a possibilidade de data centers espaciais como uma solução para as limitações de energia e infraestrutura terrestre.