Why The Harness Matters More Than The Model | YC Paper Club
Why The Harness Matters More Than The Model | YC Paper Club
Discussão técnica organizada pelo Y Combinator sobre o papel crítico das estruturas de suporte e orquestração (harnesses) de Modelos de Linguagem Grande (LLMs). O encontro reuniu pesquisadores e desenvolvedores da fronteira de IA — Seth Karten (Princeton / Prime Intellect), Jon Saad-Falcon (Stanford) e Josh France e Regan Bell (YC Labs) — para demonstrar como o ecossistema de software ao redor do modelo (memória, execução de código, subagentes e autoaperfeiçoamento) extrai ganhos de desempenho que superam a simples troca de pesos neurais.
A Tese do Harness e a Evolução Histórica
Existe uma crítica recorrente na comunidade acadêmica e em fóruns como o Reddit de que a engenharia de contexto e scaffolding são apenas "engenharia de prompt superficial" e não pesquisa legítima. Os resultados práticos contradizem essa visão: utilizando exatamente os mesmos pesos de modelo, uma arquitetura de suporte adequada eleva a acurácia no benchmark ARC-AGI de 30% para 95% (e até 100% no caso do AVO da NVIDIA).
Limitações do Aprendizado em Tempo de Inferência Clássico
- Saturação do In-Context Learning (ICL): Após 40 a 50 exemplos fornecidos na janela de contexto, o ICL satura e não gera mais ganhos de validação.
- Custos de Adaptação: Transicionar para abordagens como LoRA de baixo rank, LoRA de alto rank ou SFT (Fine-Tuning Supervisionado) exige pipelines de treinamento pesados. O harness atua como o mecanismo de adaptação dinâmica e rápida em tempo de teste (test-time adaptation).
Linha do Tempo da Arquitetura de Suporte
- Fevereiro de 2019 (GPT-2): Harness V0 baseado em um laço simples (
while not EOS), amostragem top-p e prompts de sistema no formato roleplay sem raciocínio explícito. - Julho de 2020 (Few-Shot & Chain-of-Thought): Distribuição do cálculo lógico ao longo de múltiplos tokens intermediários de saída.
- WebGPT e Toolformer: Introdução de chamadas de ferramentas via objetos JSON (ex.: terceirizar subtrações matemáticas diretamente para um interpretador Python).
- MemGPT: Capacidade de executar operações CRUD (Create, Read, Update, Delete) diretamente na memória e no contexto.
- Voyager: Criação e indexação de habilidades reutilizáveis (
skills.md) em ambientes abertos (Minecraft), destiladas de volta ao prompt de sistema. - InterCode, ReAct, Self-Refine e Reflection: Loops de reflexão crítica com múltiplos agentes e sinais de recompensa do ambiente.
- Harness V1: Configuração estática com orquestradores centrais, limites de passos e chamadas de ferramentas disparadas por cron ou eventos (Slack).
- Harnesses Autoaperfeiçoáveis (Era Atual):
- DSPy: Otimização genética de prompts de sistema com base em conjuntos de validação.
- Darwin Gödel Machines: Agentes capazes de modificar o próprio código de execução do harness, avaliando variantes em arquivos evolutivos.
- Treinamento Online (Estilo DAgger): Ajuste de pesos em tempo de teste a partir de poucas trajetórias geradas.
Prime Agent: Arquitetura RLM e Computador de von Neumann
Seth Karten (Princeton / Prime Intellect) apresentou o Prime Agent, um sistema de aprendizado por reforço recursivo (Recursive Language Model - RLM) projetado a partir de princípios fundamentais.
O Modelo como CPU vs. o Harness como Computador de von Neumann
- Metáfora Computacional: Um LLM isolado opera como uma Máquina de Turing de fita única (leitura e escrita sequencial de tokens). O harness transforma o modelo em uma arquitetura de von Neumann completa, fornecendo memória externa RAM, armazenamento em disco e barramentos de comunicação.
- Hierarquia de Cache no Contexto:
- L1 (Pesos e Contexto Ativo): Acesso ultrarrápido; sofre com limitações de tamanho de janela e custo de tokens. Exige mecanismos de compactação periódica de histórico.
- L2 (Memória RAM via REPL/IPython): Estado mantido em variáveis ativas de um console Python. Permite manipular grandes volumes de dados programaticamente sem despejá-los no prompt.
- L3 (Sistema de Arquivos e Armazenamento Persistente): Disco rígido onde ficam armazenadas as ferramentas, memórias de longo prazo e definições de subagentes.
- Coleta de Lixo Agêntica (Agentic Garbage Collection): Limpeza programática de variáveis de memória e encerramento de subagentes ociosos para evitar esgotamento de RAM.
Subagentes Persistentes e Comunicação Lateral
- Em vez de descartar o contexto de subagentes após cada tarefa, o Prime Agent mantém sessões RLM ativas em estado de dormência na RAM.
- Mensageria Familiar: Qualquer agente pode trocar mensagens estruturadas diretamente com seus nós-pais, nós-filhos ou nós-irmãos (siblings), eliminando a necessidade de repassar todo o histórico pelo agente raiz.
Resultados em Benchmarks e Testes de Longo Alcance
- ARC-AGI:
- Baseline do Claude Opus sem harness avançado: ~30%.
- Claude Opus no Prime Agent com ambiente REPL: 95,5%.
- GPT-4o (Taro): 25,7%.
- GPT-4o / GPT-5 (Soul): 78%.
- Eficiência de Custo: Enquanto agentes puramente visuais/interativos (ex.: Mouse Agent) chegaram a gastar US$ 5.000 rapidamente com baixa performance, a execução programática via REPL reduziu drasticamente o consumo de tokens.
- Emulator Bench: O sistema reconstruiu e testou emuladores completos de hardware (como Gameboy Color), realizando hipóteses de teste fora do loop antes da submissão final.
- Pesquisa Autônoma (nanoGPT Speedrun em 8x H200 por 7 dias): Modelos como DeepSeek, Kimi e GLM demonstraram comportamento emergente de conduzir experimentos rápidos em CPU para busca de hiperparâmetros antes de gastar tempo computacional nas GPUs H200.
- Experimento Factorio: Execução ininterrupta de 7 dias com 633 agentes e 23 milhões de tokens de saída, progredindo continuamente pela árvore tecnológica do jogo sem travar em loops infinitos.
OpenJarvis: IA Pessoal Rodando Localmente no Dispositivo
Jon Saad-Falcon (Stanford) detalhou o OpenJarvis, desenvolvido em colaboração com Avanika Narayan, Christopher Ré e Azalia Mirhoseini, focado em transferir o processamento de agentes da nuvem para dispositivos locais.
Por que Descentralizar da Nuvem?
- Custos: O uso contínuo de APIs comerciais acumula milhares de dólares por ano por usuário.
- Privacidade e Soberania: Dados sensíveis deixam de ser transmitidos para servidores de terceiros.
- Consumo Energético: Execuções locais em silício dedicado são ordens de grandeza mais eficientes energeticamente.
- Redução do Gap de Performance: Modelos abertos locais (como Qwen 2.5/3 27B) estão defasados em apenas 6 a 12 meses em relação aos modelos de fronteira fechados (atingindo patamares equivalentes ao Claude 3.5 Opus de meados de 2024/2025).
Os Cinco Primitivos do Stack de IA Pessoal
- Interface do Usuário (UI): Interfaces desktop, CLI e widgets interativos.
- Lógica Agêntica: Raciocínio componível e orquestração de tarefas.
- Inteligência (Modelos Locais): Qwen, Gemma, Llama ou GPT-OSS.
- Motores de Inferência e Hardware: Ollama, llama.cpp, vLLM ou SGLang rodando sobre Apple Silicon (chips M-series) ou GPUs dedicadas.
- Ferramentas, Memória e Aprendizado: Integração via Model Context Protocol (MCP) com módulos de otimização de prompts (DSPy) e ajuste de pesos (GRPO, LoRA, SFT).
Otimização Nuvem-para-Local
- O OpenJarvis utiliza modelos em nuvem de alta capacidade (como Claude Opus ou GPT-5) durante uma fase de calibração offline para diagnosticar gargalos, reescrever prompts e estruturar as ferramentas do stack local.
- Resultado: Redução de até 800 vezes no custo de inferência em comparação com pipelines 100% baseados em nuvem, com menor latência e retenção total de dados no dispositivo.
QM: O Harness Corporativo do Y Combinator
Josh France e Regan Bell (YC Labs) apresentaram o QM, a plataforma de agentes de código aberto utilizada internamente por todos os funcionários e sócios do YC.
Evolução Histórica Interna no YC
- Janeiro de 2025 (Agente Geral): Prompt de sistema único conectado a ferramentas de consulta em banco de dados; acessível via Slack.
- Junho de 2025 (Agentes de Codificação): Claude Code e Codex encapsulados em máquinas virtuais (VMs) acoplados ao Slack e CI/CD para triagem e resolução de bugs por usuários não técnicos, com melhorias registradas em um arquivo
agent.md. - Janeiro de 2026 (OpenClaw): Adoção massiva pelos parceiros do YC para triagem de inscrições de startups e e-mails.
- Abril de 2026 (Frota de 50+ Agentes Hermes): Cada usuário possuía uma VM dedicada. A manutenção tornou-se inviável (jogo de "bater na toupeira" com acessos manuais via SSH para consertar instâncias quebradas).
Inovações Estruturais do QM
- Desacoplamento do "Cérebro" e da Sandbox: O estado, histórico de sessões e conversas foram centralizados em um banco de dados PostgreSQL. As sandboxes deixaram de ser a moradia fixa do agente e passaram a ser tratadas como recursos computacionais descartáveis e sob demanda.
- Seleção Dinâmica de Sandbox e Provedor: O próprio agente escolhe a potência da VM (mais recursos para builds pesados, menos para tarefas simples) e o modelo/provedor LLM. Se um provedor recusa uma tarefa por falso positivo de moderação (ex.: análise de segurança ou pesquisa de IA), o agente comuta automaticamente para outro provedor.
- Três Ferramentas Centrais:
- Execução de código em sandbox remota.
- Leitura e escrita em armazenamento de objetos.
- Publicação e deploy de aplicações web internas instantâneas.
- Ferramenta de Persistência (The Grind Tool / Orçamento de Metas): Modelos frequentemente desistem de tarefas longas prematuramente. O QM impõe travas de orçamento temporal (ex.: obrigação de iterar por no mínimo 2 horas ou determinado volume de tokens), elevando drasticamente a profundidade de relatórios e pesquisas.
- Contexto Social e Permissões Corporativas: Agentes não possuem intuição social natural sobre confidencialidade e vazam dados facilmente em canais públicos do Slack se tiverem acesso irrestrito. O QM delega a segurança a uma camada estrita de permissões de banco de dados (RBAC/OAuth), exigindo aprovações humanas explícitas para operações em lote de escrita.
