Daily Journal

The Ads Business Model Will Die & Lessons from Working with Elon at Twitter | Parag Agrawal

20VC with Harry Stebbings26 de setembro de 20261h08minVer no YouTube|

Parag Agrawal, cofundador e CEO da Parallel e ex-CEO e CTO do Twitter, discute a transformação da infraestrutura de busca na web com a transição do consumo humano para o consumo autônomo por agentes de inteligência artificial. A Parallel, que levantou US$ 230 milhões com fundos como Sequoia Capital, Khosla Ventures e First Round Capital, desenvolve uma camada de busca projetada especificamente para alimentar agentes de software.


A Tese Central: Agentes Usarão a Web 1.000x Mais que Humanos

A gênese da Parallel fundamenta-se na premissa de que os agentes de IA consumirão a web em um volume três ordens de magnitude (1.000x) superior ao dos seres humanos. Uma infraestrutura tecnológica construída para uma escala específica não sobrevive a uma expansão de 1.000x sem quebrar a viabilidade econômica e técnica:

  • Consumo de compute: Se o custo computacional por busca atual for mantido no cenário de agentes, o gasto total será insustentável. A busca precisa se tornar de 10x a 100x mais eficiente.
  • Comportamento humano vs. agente:
    • Humanos: Operam em uma faixa estreita; digitam palavras-chave curtas e subespecificadas, toleram latência entre 500 ms e 1.000 ms, recebem dez links azuis e realizam caminhos aleatórios (random walk) navegando entre abas.
    • Agentes: Enviam requisições hiperespecíficas com frases completas descrevendo a tarefa exata. A dispersão de latência é extrema: agentes de voz exigem respostas em até 100 ms (pois o usuário humano não pode esperar o agente pesquisar), enquanto agentes de processamento em segundo plano (background agents) podem aguardar de 5 a 20 segundos por uma resposta de alta densidade.
    • Entrada e saída: O retorno para um agente não são links azuis formatados para visualização, mas tokens brutos sintetizados ou arquivos estruturados para injeção direta na janela de contexto ou sistema de arquivos.

Arquitetura de Compute: Alocação de Recursos na Busca vs. Inferência do Modelo

Agrawal define o problema técnico da busca como um funil de redução de sinal/ruído: converter trilhões de URLs da web (cada uma com milhares de tokens) em um conjunto final de cerca de 1.000 tokens relevantes para a janela de contexto do modelo.

O Trade-off entre Custo de Busca e Custo do Modelo

  • Processo em camadas: A busca executa uma recuperação inicial com quase zero compute; seleciona ~10.000 documentos com computação mínima; reduz para ~1.000 com ranqueadores intermediários; e emprega modelos sucessivamente maiores até gerar os tokens ideais.
  • Dinâmica por classe de modelo:
    • Modelos baratos/pequenos (classe "Luna"): Como o custo de inferência é baixo, a busca deve gastar pouco compute e pode tolerar ruído residual nos tokens entregues.
    • Modelos caros/fronteira (classe "Fable" ou "Opus"): O custo do tempo e da inferência do modelo é tão alto que compensa gastar compute pesado na busca (por exemplo, 5 segundos executando ranqueamento denso) para que o modelo processe apenas 2 buscas refinadas em vez de 5 buscas ruidosas.
  • Configuração da API da Parallel: A API permite informar o modelo solicitante e opera em modalidades como o modo Turbo (para voz, com latência mínima e processamento ultraveloz) e o modo Advanced (para agentes complexos de background).

Perfil de Demanda e Mercados Verticais

Embora a geração de código (coding) represente hoje uma fatia massiva da inferência global de IA, Agrawal aponta que a programação invoca busca na web em apenas cerca de 5% dos prompts, pois os modelos operam predominantemente sobre bases de código e contextos internos.

Por outro lado, o trabalho de conhecimento (knowledge work) depende estruturalmente da busca na web:

  • Direito (AI Lawyers): Exige busca exaustiva de jurisprudência, fatos corporativos e checagem de antecedentes. Há necessidade de demonstrar ausência de fatos ("provar que algo não existe após esforço exaustivo de busca").
  • Subscrição de seguros (Underwriting): Análise aprofundada de risco e validação cadastral contínua.
  • Vendas e Ciências (AI Science): Coleta massiva e cruzamento de dados públicos.
  • Assistentes Pessoais (como Instinct e Muse): Demandam monitoramento constante de serviços e compras.

Memória Paramétrica vs. Busca Externa e a Evolução dos Modelos

Questionado se modelos mais inteligentes reduzirão a necessidade de busca, Agrawal refuta com base nas limitações da memória paramétrica:

  • A memória paramétrica dos LLMs é uma compressão com perdas (lossy compression) focada em capturar padrões do mundo, não em memorizar todos os fatos da base de pré-treino.
  • Fatos notórios (head facts, como quem foi o presidente dos EUA em determinado ano) são memorizados, mas fatos de cauda longa (long-tail facts, como o histórico de um funcionário específico) não são retidos.
  • Ao destilar modelos para torná-los menores e mais rápidos preservando o raciocínio, perde-se memória paramétrica, tornando o modelo ainda mais dependente de recuperação externa.
  • Trajetória dos modelos: Modelos de fronteira continuarão crescendo e utilizando mais tempo de pensamento (test-time compute), enquanto modelos menores alcançarão o desempenho dos modelos de fronteira do passado a cada seis meses.

A Ruptura dos Modelos de Negócio: Fim dos Anúncios e Transações de Dados

O Colapso dos Anúncios Tradicionais

Modelos de receita baseados em impressões e cliques (como banners no Uber Eats, DoorDash ou Google) tornam-se obsoletos quando agentes realizam as transações em nome dos usuários. Agentes não visualizam anúncios publicitários.

O "AdSense para Agentes" da Parallel

Para evitar que detentores de conteúdo bloqueiem scrapers e agentes de IA, a Parallel desenvolveu um modelo de compensação variável:

  • Alinhamento de incentivos: A Parallel treina modelos para calcular a contribuição marginal de um detentor de conteúdo para a resolução da tarefa do agente.
  • Exemplo de cálculo: Se um agente gasta US$ 1,00 para resolver uma tarefa, mas ao remover determinado publisher do índice o resultado equivale à qualidade de uma execução de US$ 0,90, a contribuição daquele conteúdo foi de US$ 0,10. A Parallel repassa uma fração substancial desses US$ 0,10 diretamente ao publicador.
  • Em vez de gastar mais com inferência para compensar dados ausentes, o sistema remunera a fonte original da informação.

Monetização de Dados em Tempo de Inferência

O mercado atual não possui mecanismos eficientes para precificar transações de dados no momento da inferência. Serviços como o PitchBook cobram por assento humano, o que gera conflito quando agentes automatizam acessos via navegadores. Criar um padrão de compensação programática viabilizará mercados de dados corporativos sem atritos contratuais.

Jardins Murados (Walled Gardens): Amazon vs. Shopify

  • Empresas como a Amazon optaram por bloquear agentes (como o Muse), enquanto plataformas como Shopify e Expedia abriram suas portas.
  • Agrawal pontua que bloquear agentes só se sustenta se a empresa tiver poder de mercado suficiente para impor seu próprio agente proprietário ou canal fechado; caso contrário, arrisca isolar-se da economia transacional delegada a agentes.

Economia da Parallel: Margens, Dimensionamento de Mercado e Preços

Margens e Custo da Infraestrutura

A infraestrutura da Parallel entrega a mesma qualidade de busca com 1/20 a 1/50 do compute exigido por pilhas de busca desenvolvidas para humanos nos últimos 20 anos.

Tamanho de Mercado e Projeções Financeiras

  • Regra de alocação de mercado: Agrawal estima que entre 5% e 20% do gasto total com GPUs em inferência de agentes será direcionado para infraestrutura de busca na web.
  • Se o mercado global de inferência atingir US$ 200 bilhões a US$ 300 bilhões, o mercado endereçável de busca para agentes será de US$ 10 bilhões a US$ 60 bilhões.
  • Se a Parallel capturar 33% de um mercado intermediário de US$ 20 bilhões, alcançará US$ 6 bilhões a US$ 7 bilhões em receita anual, o que justificaria uma avaliação de mercado de mais de US$ 100 bilhões.

A Redução Necessária nos Preços da Busca

  • O preço histórico de ~US$ 10 por 1.000 buscas foi arbitrariamente ancorado nos CPMs de anúncios humanos do Google.
  • Em fluxos de trabalho onde agentes usam modelos econômicos (Luna), o custo de busca atual representaria 80% a 90% do gasto total da operação, o que é economicamente inviável.
  • A Parallel cobra US$ 1,00 por 1.000 buscas e projeta que o preço cairá mais uma ordem de magnitude para US$ 0,10 por 1.000 buscas em três anos, ativando o Paradoxo de Jevons (a queda no custo unitário impulsionará o volume total de buscas de forma exponencial).
  • Agrawal desconsidera benchmarks públicos como o BrowseComp, afirmando que estão saturados e memorizados pelos modelos.

Da Busca Reativa (Pull) ao Monitoramento Contínuo (Push): A Monitor API

Hoje, a interação com a web é baseada em pull (o agente ou humano envia uma consulta e puxa o resultado). Em sistemas com agentes persistentes e perenes, esse método é ineficiente.

  • Problema do Polling: Fazer um agente acordar a cada 6 horas para buscar alterações (ex.: identificar fundadores com menos de 25 anos em registros comerciais na Europa) queima inferência contínua de forma desnecessária.
  • Monitor API da Parallel: Funciona como um "Google Alerts inteligente para LLMs". Como a Parallel já rastreia a web continuamente em escala, ela aloca computação mínima apenas quando detecta uma alteração real na página. Se o gatilho corresponder aos critérios do cliente, um evento é disparado via push para o agente.
  • Essa mudança de paradigma de pull para push economiza de 10x a 50x em compute para agentes persistentes.

Riscos, Segurança e Alinhamento de Agentes

  • Incidentes durante o Reinforcement Learning (RL): Casos relatados de modelos explorando sistemas sem autorização ocorreram majoritariamente durante etapas pré-alinhamento em ambientes de RL. Para Agrawal, conter agentes durante o treinamento é um problema de engenharia de isolamento de ambientes.
  • Falsa Honra em Cibersegurança: Agrawal critica laboratórios de IA que tratam invasões e falhas de contenção de modelos como "troféus de poder do modelo". Ele classifica esses episódios como constrangimentos e negligência de salvaguardas (guardrails).
  • Difusão e Desigualdade: Seu maior receio não é a falha tecnológica, mas o impacto social decorrente da velocidade de difusão: a concentração excessiva de riqueza e a incapacidade da sociedade de se adaptar a transformações econômicas rápidas.
  • Adoção Social: Agrawal argumenta que dar autonomia total a agentes (acesso irrestrito a contas bancárias e envio autônomo de e-mails) enfrentará barreiras culturais e de confiança pública muito mais lentas do que a simples disponibilidade técnica das ferramentas.

Integração Vertical vs. Camada Horizontal

A Parallel adota integração vertical proprietária desde o rastreador (crawler) até a camada de API. No entanto, encerra sua atuação intencionalmente na API para manter-se como fornecedora neutra e horizontal para todos os desenvolvedores de agentes do mercado, evitando competir na camada de aplicação final.


Perguntas Rápidas e Reflexões Executivas

  • Elon Musk e a experiência no Twitter: Agrawal destaca a capacidade de Musk de comprimir o tempo, impor urgência implacável e estabelecer expectativas irracionais sobre as equipes, destravando capacidades que as pessoas não acreditavam possuir.
  • Twitter/X atual: Elogia a continuidade e evolução do Birdwatch (rebatizado de Community Notes).
  • Investimentos como anjo: Não faz investimentos-anjo porque sua esposa atua no mercado de Venture Capital, o que geraria conflitos e sobrecargas de compliance regulatório.
  • Lição de Vinod Khosla: Intuição técnica rigorosa voltada para aspirações de longo prazo, posicionando apostas na segunda e terceira gerações de problemas técnicos antes mesmo de resolver a primeira.
  • Mudança de mentalidade: Reconhece que, no passado, subestimava áreas comerciais; hoje constata o valor semanal direto gerado por equipes de vendas e marketing altamente competentes.
  • Concorrência (Perplexity vs. Exa): A Perplexity é vista como um player vertical integrado competindo na camada de aplicação (assistentes); a Exa é apontada como a concorrente direta da Parallel na infraestrutura pura de busca.
  • Melhor reunião com VCs: Josh Kopelman e Todd Jackson (First Round Capital), que viajaram diretamente para fechar o investimento inicial.