Daily Journal

Inside the Race to Measure Frontier Intelligence

a16z09 de setembro de 202639minVer no YouTube|

Rayan Krishnan, fundador e CEO da Vals, discute com os sócios da Andreessen Horowitz (a16z) Ben Horowitz, Jennifer Li e Erik Torenberg a crise metodológica na avaliação de modelos de fronteira em inteligência artificial. Com a saturação de benchmarks públicos e a proliferação de modelos agênticos e soberanos, a conversa detalha os gargalos técnicos de teste, a economia do consumo de tokens nas empresas e o papel das auditorias independentes na formulação de políticas públicas e tratados geopolíticos.

Origem da Vals e o colapso dos benchmarks públicos

Rayan Krishnan fundou a Vals no início de 2024 a partir de sua experiência em pesquisa de avaliação e geração de IA, observando que o progresso das capacidades dos modelos depende diretamente de mecanismos legíveis e externos de medição.

  • Falha de dados autorreportados: Krishnan cita o lançamento do Llama 4 pela Meta como um caso emblemático de descompasso. Nos benchmarks públicos abertos, onde questões e critérios eram conhecidos e passíveis de contaminação/otimização, o modelo exibia capacidades extraordinárias; contudo, nos benchmarks privados retidos (held-out) da Vals, o desempenho real ficou abaixo do esperado.
  • Demanda de mercado e laboratórios: Demis Hassabis e outras lideranças do setor têm defendido a criação de um ecossistema independente de testes para estabelecer um mercado comprador racional, evitando que investimentos de bilhões de dólares dependam apenas de métricas autorreportadas para justificar o retorno sobre capital.

Infraestrutura e a janela de teste de seis horas

Para não atrasar os lançamentos oficiais dos laboratórios de ponta, a Vals precisa executar dezenas de bilhões de tokens em uma janela prévia de seis horas:

  • Evolução operacional: No início, Krishnan e seu cofundador, Langston, viravam noites manualmente. A empresa desenvolveu uma infraestrutura distribuída que esgota os limites máximos de taxa (rate limits) e capacidade de cada modelo avaliado.
  • Automação com "Steve": A empresa criou o sistema interno Steve (Steve the Economic Vals employee), que assume progressivamente tarefas humanas de validação e execução em larga escala.

Conflito de interesses e o modelo de auditoria independente

Ben Horowitz traça um paralelo histórico entre a avaliação de inteligência e a classificação etária de filmes pela MPAA (Motion Picture Association of America), onde conceitos como classificação R ou PG-13 dependem de normas sociais construídas ("eu reconheço quando vejo"), e não de testes estritamente binários.

  • Recusa em vender dados de treino: Krishnan destaca que a Vals tomou a decisão estratégica de nunca comercializar dados de treinamento para os laboratórios. Ele aponta que muitas empresas de avaliação criam benchmarks apelativos (gimmick-style) apenas como funil de vendas de dados.
  • O paralelo com a Enron: A separação estrita é desenhada para evitar a falha de incentivos vista no setor de auditoria tradicional (como no caso Arthur Andersen/Enron), onde a mesma entidade prestava consultoria e auditava balanços, resultando em um modelo de "pagar para passar no teste".

Catálogo de benchmarks e o índice de autoaperfeiçoamento recursivo (RSI)

A Vals constrói métricas voltadas tanto para casos econômicos do mundo real quanto para hipóteses avançadas de pesquisa:

  • Aplicações econômicas: O Finance Agent Benchmark é utilizado por grandes instituições financeiras. O VibeCode Bench avalia a capacidade dos modelos de transformar prompts em linguagem natural em aplicações web full-stack completas.
  • Índice de Autoaperfeiçoamento Recursivo (RSI Index): Diante da ausência de uma linguagem comum sobre o potencial de modelos treinarem suas próximas versões, a Vals criou um índice com proxies para cada etapa do desenvolvimento: pré-treinamento, pós-treinamento e engenharia de harness, mensurando onde o modelo é capaz de conduzir pesquisa de forma autônoma e onde falha.
  • Depreciação contínua ("Always a Higher Peak"): Assim como exames de ordem jurídica e conselhos de medicina atualizam suas provas conforme a jurisprudência e a ciência evoluem, a Vals deprecia benchmarks saturados para evitar acomodação e refletir o estado atual do conhecimento técnico e legal.

Avaliação de sistemas agênticos e testes de longa duração

A transição de prompts simples de múltipla escolha para agentes autônomos alterou a arquitetura de testes:

  • Janelas temporais extensas: Agentes modernos em finanças, direito ou programação executam tarefas ao longo de horas, dias ou semanas. A infraestrutura de testes precisa permitir retomadas a partir de requisições falhas sem reiniciar toda a trajetória do agente.
  • Menor amostragem, maior complexidade: Se antes benchmarks como o ImageNet usavam milhões de imagens com mapeamento direto de rótulos (1:1), benchmarks agênticos atuais exigem menos amostras (ex.: construir 50 aplicações web completas), mas utilizam critérios avaliativos multidimensionais muito mais complexos.
  • Roteamento de modelos: Krishnan aponta que plataformas como a OpenRouter atuam prioritariamente como gateways, cabendo ao usuário decidir o roteamento. O principal desafio do roteamento reside na construção de avaliações que determinem a alocação ótima de inteligência para cada caso específico.

A economia corporativa da IA: gasto com tokens versus salários

Krishnan relata que o custo de inferência começa a rivalizar diretamente com a folha de pagamento das companhias, gerando distorções operacionais:

  • O caso da empresa Fortune 10: Uma corporação da Fortune 10 implementou um limite diário de uso do Claude Code de US$ 100 por engenheiro, com reinício da cota às 16h. O resultado foi uma alteração artificial na rotina de trabalho: o período mais produtivo passou a ser das 16h às 18h, enquanto o início da tarde virou um momento ocioso de espera. Posteriormente, o orçamento foi ampliado para US$ 300 diários por funcionário — valor que se aproxima do custo salarial diário de um engenheiro.
  • Experimento de Token Maxing na Vals: Em um teste interno de um mês com acesso ilimitado a ferramentas de código, engenheiros da Vals consumiram entre 1 e 2 bilhões de tokens por dia (com pico de 6 bilhões de tokens em um único dia por um engenheiro). O custo teórico acumulado no mês foi de aproximadamente US$ 1,5 milhão em tokens — um valor 10 vezes maior do que toda a folha de pagamento da equipe no período.
  • Lançamento do Valsmith: Para mitigar esse problema de alocação de capital e ROI, a Vals lançou o Valsmith. A ferramenta conecta-se ao repositório GitHub privado da empresa para testar quais agentes e modelos oferecem a melhor relação de custo-benefício (ótimo de Pareto) para aquela base de código específica, gerando recomendações automáticas para cada ticket aberto.
  • Distorções de precificação entre modelos: Em testes práticos, o Claude Sonnet mostrou-se, em determinados cenários, mais caro de operar do que o Opus devido à sua alta voracidade por tokens (token hungry), demonstrando que heurísticas simples de preço de tabela nem sempre refletem o custo real da tarefa.

Regulação, divisão de trabalho e alinhamento

A lentidão do processo legislativo contrasta com a velocidade das capacidades dos modelos, demandando divisões claras de responsabilidade:

  • Papel da Vals junto ao governo: A Vals realiza briefings regulares com membros dos poderes Executivo e Legislativo nos EUA (incluindo Departamento de Comércio e SEC), fornecendo dados empíricos sobre vetores de risco (como biossegurança, cibersegurança e saúde mental infantil) sem prescrever políticas específicas.
  • Divisão de trabalho segundo Ben Horowitz: O governo é historicamente inadequado para testar continuamente as fronteiras técnicas da tecnologia, mas possui a prerrogativa única de definir regras e aplicá-las juridicamente (enforcement). O papel das empresas privadas especializadas é testar se o modelo possui a capacidade técnica de executar o ato ilícito e se é possível induzi-lo a agir dessa forma (reward hacking ou contorno de salvaguardas).

Geopolítica, soberania da IA e o paralelo nuclear

Diante da corrida por "IA soberana", na qual nações duplicam centros de dados e infraestruturas em vez de consolidar esforços, os benchmarks tornam-se a base para acordos e tratados internacionais:

  • Analogia com o desarmamento nuclear: Krishnan cita a máxima de Ronald Reagan ("trust, but verify") ao mencionar as reuniões bilaterais entre Donald Trump e Xi Jinping. Assim como a era nuclear exigiu uma linguagem comum para contar ogivas e autorizar sobrevoos de inspeção territorial, o controle de riscos de IA dependerá de protocolos compartilhados de auditoria e verificação.
  • Prioridade de alinhamento em RSI: No curto prazo, a cooperação global deve focar em riscos cibernéticos e biológicos; a longo prazo, o maior risco geopolítico reside no autoaperfeiçoamento recursivo descontrolado por parte de uma única nação ou corporação, exigindo métricas conjuntas de ritmo de desenvolvimento.
  • Evolução dos testes de cibersegurança: Os testes da Vals estão migrando da detecção de vulnerabilidades estáticas de código (como vazamentos de memória) para simulações completas de ambientes de infraestrutura em nuvem corporativa e redes elétricas (power grids), mensurando capacidades ofensivas e defensivas de agentes em escala sistêmica.