Daily Journal

How Jev Turns AI Into Software That Gets Things Done

a16z28 de setembro de 202642minVer no YouTube|

Diogo Almeida, fundador e CEO da TypeSafe AI (ex-OpenAI e Google Brain), discute com Ben Horowitz e Martin Casado (sócios da Andreessen Horowitz / a16z) a lacuna entre o avanço dos modelos de inteligência artificial e a escassez de automação real no mundo produtivo. Almeida apresenta a proposta do Jev, um modelo projetado não como chatbot ou assistente de geração de código para humanos, mas como uma primitiva inteligente embutida diretamente no código-fonte para tomada de decisões probabilísticas em máquinas de estado.

O problema da automação e o conceito de "Smart Software"

  • A frustração central: Almeida resume sua tese na pergunta: "Onde diabos está toda a automação?". Apesar de a IA demonstrar alta capacidade analítica, a maior parte do software corporativo permanece idêntica à de uma década atrás, sem conseguir automatizar tarefas básicas de rotina (como atendimento ao cliente, objetivo perseguido pela OpenAI desde 2020).
  • Agentes de código vs. Software inteligente: Ferramentas como Codex, Claude Code e Cursor apenas aceleram a escrita de código tradicional ("software just-in-time", na definição de Garry Tan citada na conversa). Elas não tornam o software resultante mais potente ou estruturalmente novo. Almeida busca expandir o vocabulário e o poder expressivo do software em si, permitindo que os programas expressem intenção e operem de forma autônoma no backend.
  • Prod vs. God: Ao contrário dos grandes laboratórios focados em modelos monolíticos orientados a AGI ("uma grande mente para governar todas"), o lema da TypeSafe é "We build prod, not god" (construímos produção, não deus).

O que é o Jev e como ele opera

  • Primitiva de máquina de estados: O Jev funciona como uma biblioteca/camada inteligente interna ao software. Ele recebe como entrada o estado atual do programa e linguagem natural, processa a intenção e seleciona a próxima transição ou ação com níveis de confiança estatísticos mensuráveis.
  • Jev como classificador: Diogo Almeida assume abertamente a natureza do modelo: "Jev é absolutamente um classificador". Diferente de modelos que geram texto livre para um ser humano interpretar, o Jev atua como um sistema determinístico/probabilístico prático para engenharia de sistemas, superando a eficiência de uma equipe inteira de engenheiros de Machine Learning de 2019.
  • Métrica norteadora: A métrica primária de design da TypeSafe é a inteligência por dólar (com inteligência por segundo sendo um vetor secundário no curto prazo), visando operações com latência de milissegundos comparáveis a consultas de banco de dados.

Trajetória de Diogo Almeida

  • Início e competição: Formação competitiva em matemática (mathlete); transição para ciência da computação motivada pelo foco prático em algoritmos e sistemas.
  • Vitória no Kaggle e Isabelle Guyon: Venceu uma competição no Kaggle usando abordagens de engenharia de sistemas (loops aninhados massivos e automação direta) em vez de formulações matemáticas complexas. O feito chamou a atenção de Isabelle Guyon (co-inventora das máquinas de vetores de suporte / SVM), que o introduziu à comunidade de pesquisa em IA e o levou a palestrar no NeurIPS.
  • Carreira prévia: Passagens por uma startup com Jeremy Howard (fundador da fast.ai), pelo Google Brain e pela OpenAI.
  • A virada do RLHF (2021): No final de 2021, participou do desenvolvimento de modelos pré-ChatGPT na OpenAI. Testou a generalização de Reinforcement Learning from Human Feedback (RLHF) com consultas deliberadamente ausentes da internet (ex.: "Por que é importante comer meias antes de meditar?"). A capacidade de gerar respostas estruturadas convincentes provou a ausência de decoreba (cheating), mas o fato de a técnica não ter levado diretamente à AGI gerou nele a percepção de que a indústria bifurcou entre promessas exageradas e falta de entregas em automação real.

Divergências conceituais sobre AGI, RSI e Dados

  • Ceticismo quanto ao RSI: Almeida discorda de teses de Autoaperfeiçoamento Recursivo (RSI - Recursive Self-Improvement). Ele sustenta que o conceito de AGI como automação da maior parte do trabalho economicamente valioso é factível, mas que a indústria passou a otimizar a avaliação feita por juízes humanos (foco em demos, benchmarks estéticos e chatbots) em vez de pipelines de execução autônoma.
  • A tese dos dados: Rejeita a justificativa de que a falta de automação produtiva se deve exclusivamente à distribuição de cauda longa (heavy-tailed distribution) do mundo real. O volume de tarefas rotineiras de baixo risco que continuam manuais demonstra que o gargalo foi a falta de confiabilidade do software, não a ausência de dados.

Engenharia de Confiabilidade (Reliability)

Almeida categoriza a confiabilidade em três níveis técnicos:

  1. Uptime / SLA: Disponibilidade operacional do serviço.
  2. Determinismo: Respostas idênticas a inputs idênticos (útil para testes unitários, mas insuficiente para lidar com pequenas variações como a inserção de um UUID no prompt).
  3. Robustez / Inteligência Consistente: Garantia estatística de que o modelo demonstrará o mesmo nível de discernimento diante de variações operacionais, permitindo que desenvolvedores programem sem necessidade de testar consultas de exemplo a cada iteração.

O "Anti-Apocalipse" do SaaS e Novas Capacidades

  • Reversão da crise do SaaS: Martin Casado aponta que o surgimento de agentes de geração de código causou pânico inicial no mercado de SaaS sob a premissa de que software seria trivialmente replicado. Almeida defende que o SaaS tradicional é o maior beneficiário da IA: empresas estabelecidas já possuem a distribuição, conhecem os fluxos de trabalho reais dos usuários e detêm o capital para absorver os investimentos de infraestrutura (capex).
  • Fim dos formulários de múltipla escolha: Almeida prevê a substituição de formulários rígidos e interfaces legadas dos anos 1980 (estilo 4GL) por comandos diretos de linguagem natural mapeados para saídas estruturadas.
  • O impacto no código: Casado e Almeida destacam que a média de um Pull Request (PR) corporativo tem apenas cerca de 10 linhas. Agentes de código apenas aceleram essas 10 linhas triviais; uma primitiva nativa como o Jev insere inteligência e novas funcionalidades que antes não existiam no software.

IA nas entranhas dos sistemas (The Guts)

  • A analogia TCP/UDP: Almeida divide a IA em duas camadas: a camada visual/humana (chatbots, interfaces) e as entranhas profundas dos sistemas (the guts, análogo a protocolos de rede como TCP/UDP). Ele prevê que, no longo prazo, múltiplos noves (99,999...%) das chamadas de IA ocorrerão no nível de infraestrutura profunda entre componentes de software, sem interação direta com humanos.
  • Ressurgimento da programação probabilística: O modelo permite resgatar conceitos de computação probabilística e lógica bayesiana de forma prática, integrando inteligência como portas lógicas avançadas dentro de arquiteturas de sistemas distribuídos.
  • "Do What I Mean" (DWIM): O objetivo final da TypeSafe é alcançar o princípio de DWIM, onde os sistemas tecnológicos executam com precisão a intenção do usuário e do desenvolvedor sem o atrito de erros estocásticos descontrolados.