Daily Journal

Naveen Rao: 4D Computing, AI's Energy Wall & Beating Biology

All-In Podcast21 de setembro de 202622minVer no YouTube|

Naveen Rao, cofundador e CEO da Unconventional AI, detalha a proposta de sua nova startup de semicondutores: redesenhar os computadores a partir de primeiros princípios para superar o gargalo energético da inteligência artificial por meio de computação dinâmica quadridimensional (4D computing).

Trajetória do fundador e contexto da empresa

Naveen Rao iniciou a carreira como engenheiro eletricista, migrou para a neurociência teórica (doutorado) para investigar como cérebros geram inteligência e fundou a Nervana Systems em 2014 — pioneira em chips para IA vendida à Intel, onde ele estruturou e liderou a divisão de IA até 2020. Em seguida, criou a MosaicML para desenvolver infraestrutura de escalonamento de Large Language Models (LLMs), empresa vendida à Databricks em 2023 (e que hoje responde por cerca de 25% da receita total da Databricks). Em janeiro de 2024, fundou a Unconventional AI com o objetivo de alcançar 1.000x mais eficiência energética em hardware para IA, meta inicialmente estimada para 5 anos e recentemente reduzida para 3,5 anos devido ao ritmo acelerado de pesquisa.

O gargalo energético da inteligência artificial

A demanda computacional dos modelos de IA está colidindo com a oferta física de eletricidade:

  • Demanda do Google: O Google processa cerca de 3,2 quatrilhões de tokens por mês. Considerando um consumo conservador de 10 joules por token, essa operação isolada demandaria cerca de 12 gigawatts (GW).
  • Capacidade instalada: A totalidade dos data centers nos EUA consome aproximadamente 40 GW de energia, representando cerca de metade da capacidade global de data centers (que é inferior a 100 GW). Assim, uma única empresa exigiria uma fatia desproporcional da energia disponível.
  • Transição de restrições: A escassez crítica de infraestrutura migrou sucessivamente de espaço físico (área/racks) para equipamentos de rede, depois para GPUs e agora para contratos de fornecimento de energia.
  • Estrutura de custos: Cerca de 50% do custo para servir um token em produção corresponde diretamente à eletricidade consumida, sendo o restante Capex de hardware e infraestrutura.
  • Projeção de escassez: Segundo a estimativa de Rao, sem uma ruptura tecnológica no hardware, a capacidade energética disponível para expansão de data centers se esgotará em cerca de 3 anos.

Ineficiência da arquitetura von Neumann vs. Biologia

Rao compara a física da computação digital tradicional aos sistemas biológicos para demonstrar o nível de desperdício energético:

  • Cérebro humano: Opera com cerca de 20 watts (W) e movimenta apenas 16 bilhões de bits por segundo no córtex (que possui entre 13 e 14 bilhões de neurônios).
  • Cérebro animal: O cérebro de um macaco consome cerca de 1 W (equivalente ao consumo de um smartphone); o cérebro de um esquilo executa cálculos motores complexos e precisos consumindo apenas 8 miliwatts (mW) — o equivalente a operar mais de 100 cérebros de esquilo na potência de um telefone.
  • Hardware sintético (GPUs): Uma GPU de ponta transfere cerca de 30 trilhões de bits por segundo entre chip e memória externa (e até 10x a 100x mais internamente). A maior parte da energia gasta em computação não vai para o cálculo, mas para a movimentação física de dados entre processador e memória.
  • Fim da Lei de Moore: Desde o ENIAC (1945), a computação digital baseia-se na separação estrita entre processamento e memória (arquitetura von Neumann). As abstrações digitais (binário forçado sobre estados analógicos, álgebra linear e aritmética de ponto flutuante) impõem perdas de eficiência. Com o fim do escalonamento de frequência, desempenho single-thread e eficiência por redução de transistor, a arquitetura tradicional atingiu um teto físico.

Computação 4D e Sistemas Dinâmicos

A Unconventional AI propõe eliminar intermediários de abstração ligando a física do semicondutor diretamente às propriedades da rede neural por meio da teoria de sistemas dinâmicos:

  • Comportamento emergente: Inspiração na sincronização física observada na natureza (bandos de pássaros, colônias de formigas ou metrônomos mecânicos sobre uma base móvel que sincronizam suas fases espontaneamente por acoplamento físico).
  • Arquitetura 4D: Integração física tridimensional (empilhamento vertical de dies / 3D die stacking) combinada à dimensão temporal da dinâmica de estados dos osciladores. Não há barramento ou interface de memória separada: cada elemento de cálculo funciona simultaneamente como elemento de memória.
  • Esparsidade (Sparsity): Em vez de manter redes densamente interconectadas que escalam de forma quadrática ($n^2$), a arquitetura remove conexões redundantes. Isso reduz a complexidade física e melhora a treinabilidade e estabilidade do sistema.
  • Modelo Uno: Demonstração em código aberto desenvolvida pela empresa que utiliza osciladores acoplados para gerar imagens condicionadas por trajetórias no espaço de estados (state space trajectories).

Protótipo físico e resultados laboratoriais

Rao revelou publicamente o primeiro processador físico baseado em computação dinâmica:

  • Prazo de desenvolvimento: A empresa começou as operações em janeiro de 2024, realizou o tape-out (envio do design para a fábrica/fundição) em 1º de junho e já recebeu e testou o silício no laboratório em 5 meses de ciclo.
  • Métricas de consumo: O chip gerou imagens funcionais consumindo cerca de 500 nanojoules (nJ) por imagem, enquanto computadores tradicionais baseados em GPU consomem na escala de milijoules (mJ) para tarefas equivalentes — uma diferença de várias ordens de magnitude.
  • Limite termodinâmico: Cérebros de mamíferos operam a 1 ou 2 ordens de magnitude de distância do limite termodinâmico teórico da computação. O hardware digital atual está a cerca de 10 bilhões de vezes ($10^{10}$) desse limite. A meta da empresa é encostar no limite da litografia 2D em 3,5 anos e, a longo prazo, superar a biologia em eficiência.
  • Impacto de mercado: Rao cita o Paradoxo de Jevons: ao reduzir o custo por token em 1.000x, o consumo total de computação aumentará em proporção superior à redução do custo unitário, multiplicando o mercado potencial de IA e viabilizando robótica dinâmica e data centers distribuídos de menor porte.

Sessão de perguntas com Chamath Palihapitiya

  • Formato do produto e cronograma: O primeiro produto comercial completo será um sistema de rack para data centers previsto para até 2 anos. Operacionalmente, a interface externa funcionará como a de servidores padrão (entrada e saída de tokens via rede), mas a arquitetura interna é inteiramente não-von Neumann.
  • Portabilidade de modelos existentes: A compatibilidade com modelos atuais (Transformers/LLMs) não ocorre no nível de instruções/operações individuais (operações convencionais de multiplicação de matrizes / matmul não existem fisicamente no hardware, sendo expressas como multiplicações de matriz de estado atual por matriz de transição ao longo do tempo). A conversão é feita no nível do modelo, exigindo uma etapa de recomputação para mapear os pesos.
  • Composição da equipe: A empresa uniu teóricos de sistemas dinâmicos e neurociência a projetistas de silício tradicional, dois grupos historicamente desconectados.
  • Camada de software: Em substituição ao modelo CUDA, a Unconventional AI desenvolveu bibliotecas em Python que permitem aos programadores expressar elementos variantes no tempo com comportamento estocástico.