Daily Journal

E253|谁在给大模型出题、卖题、判卷?聊聊AI数据行业的野蛮生长

硅谷101播客28 de setembro de 202658minVer no YouTube|

Discussão entre Yiwen (apresentadora do podcast Guigu 101), He Yunzhong (diretor de pesquisa em pós-treinamento e avaliação da Scale AI) e Sun Yiyou (pesquisador de pós-doutorado na UC Berkeley e cocriador do benchmark Agents’ Last Exam - ALE) sobre a estrutura econômica, as metodologias técnicas e os gargalos operacionais da indústria de dados para modelos de inteligência artificial.

O mercado de dados de IA e os perfis das empresas fornecedoras

O setor de dados de treinamento para modelos de fronteira passou por uma reavaliação de valuation acelerada:

  • AfterQuery: avaliada em US$ 300 milhões no Series A em abril, alcançou US$ 3,2 bilhões em nova rodada em setembro (multiplicação de 10x em menos de seis meses, estabelecendo o recorde de empresa mais rápida da Y Combinator a virar unicórnio).
  • Scale AI: recebeu aporte da Meta com valuation superior a US$ 29 bilhões.
  • Mercor: atingiu valuation de US$ 10 bilhões em rodada realizada em outubro.
  • Bespoke Labs: levantou US$ 40 milhões na soma das rodadas Seed e Series A.

He Yunzhong classifica os participantes do mercado de dados em cinco categorias com dinâmicas operacionais distintas:

  1. Empresas originadas em recrutamento: Mercor (que começou com entrevistas automatizadas por IA e foca na velocidade de mobilização de especialistas) e Handshake.
  2. Redes tradicionais de crowdsourcing: Scale AI e Surge AI. A Surge AI prioriza especialistas contratados internamente para maior controle de qualidade, perdendo flexibilidade de escala; a Scale AI opera em rede aberta com camadas proprietárias de controle de qualidade sobre dados e avaliadores.
  3. Empresas de engenharia e dados sintéticos: BigCode e Snorkel AI, com foco em geração de código e ambientes de chamada de ferramentas (tool calling).
  4. Empresas de IA corporificada (embodied AI): desenvolvedores de modelos de robótica que, antes de monetizarem os modelos finais, comercializam seus acervos brutos de captura física.
  5. Corretores de dados (data brokers) de nicho: intermediários que possuem direitos proprietários sobre ativos específicos (como acervos protegidos por direitos autorais em Hollywood) e operam apenas o licenciamento.

Da anotação humana ao pós-treinamento: Rubrics e Ambientes de RL

O foco dos laboratórios de pesquisa migrou da escala bruta no pré-treinamento para o pós-treinamento (post-training), impulsionado pelo sucesso de modelos de raciocínio (como a série o da OpenAI):

  • Supervisão Fraca para Forte (Weak-to-strong supervision) e Rubrics: Em matemática e código básico, a verificação por Reinforcement Learning (RL) é determinística (resultado binário de acerto/erro). Em domínios como história, medicina e direito, a resposta não é estruturada. A solução adotada foi o rubric data (critérios objetivos detalhados escritos por especialistas). Um modelo menor atua como assistente de correção (teaching assistant), aplicando as regras elaboradas pelo especialista (professor) para pontuar o modelo mais forte.
  • Transição para Ambientes de RL (RL Environments): He Yunzhong aponta que o mercado está saturado de rubrics estáticos puramente textuais de rodada única/múltipla. A demanda atual exige ambientes completos de agente (agentic data), compostos por tarefas em sandboxes, ferramentas executáveis, chamadas de sistema, manipulação de bancos de dados e mecanismos de verificação programática (programmatic checks).

Divergência: O esgotamento dos Rubrics e a quantificação do subjetivo

  • Posição de He Yunzhong: Rubrics de texto para conhecimento factual já foram amplamente coletados nos principais domínios; o foco migrou para a execução de código e tarefas acionáveis (knowledge work).
  • Posição de Sun Yiyou: Os rubrics estão longe de estar esgotados. Na engenharia e em tarefas complexas sem resposta única (como criação de jogos ou resoluções matemáticas alternativas), exigir correspondência estrita com um ground truth engessa a avaliação. Indicadores subjetivos (como "um jogo ser divertido" ou "uma imagem ser bonita") possuem critérios científicos em manuais de design — como suavidade da curva de recompensa dopaminérgica — que ainda não foram convertidos em rubrics públicos de larga escala.
  • Solução proposta: Yunzhong aponta para o uso de modelos de recompensa (reward models) treinados para capturar a percepção humana combinados com rubrics mais abertos quando o ambiente for altamente subjetivo.

Benchmarks versus comercialização de dados

  • Agents’ Last Exam (ALE): Projeto liderado pela UC Berkeley RDI com mais de 300 especialistas industriais para medir agentes em tarefas complexas, multi-etapas e com valor econômico verificável. A versão pública inicial conta com mais de 150 tarefas em mais de 50 setores; a versão V2 planeja expandir para mais de 1.000 tarefas.
  • Relação entre Benchmark e Dados: He Yunzhong afirma que criar benchmarks confere autoridade técnica para vender dados, mas ressalta o risco ético. Sun Yiyou alerta que empresas de dados não podem vender os conjuntos de teste de seus benchmarks para evitar a contaminação dos testes e a degradação da autoridade científica. Para Yiyou, o benchmark deve olhar para o futuro (problemas não resolvidos), enquanto os dados atendem ao presente.
  • Bench-maxxing (otimização forçada para subir em rankings): Não é necessariamente prejudicial se o benchmark espelhar com precisão o fluxo de trabalho real do usuário. Caso meça apenas capacidades isoladas ou quebra-cabeças arbitrários sem generalização, torna-se inútil.
  • Limitações do Artificial Analysis e do LMArena para Agentes: Plataformas como o LMArena funcionam bem para chat de baixa latência e custo reduzido. Em agentes executando tarefas de horas, é inviável colocar múltiplos modelos rodando em paralelo em testes A/B para o usuário final votar. Por isso, grandes laboratórios (como OpenAI e Anthropic) desenvolvem suítes internas de avaliação proprietárias alinhadas às suas próprias distribuições de uso.
  • Caso SWE-Atlas: A Scale AI desenvolveu o conjunto SWE-Atlas em três módulos: Q&A de repositório, refatoração de código e geração de testes. O módulo de Q&A (o mais simples) foi adotado precocemente pelo Artificial Analysis, provocando uma corrida imediata de laboratórios para comprar dados e otimizar especificamente essa métrica básica.

Custos de aquisição de dados e gargalos em setores verticais

Equipes pequenas de 2 a 3 pessoas conseguem altas avaliações desenvolvendo geradores de ambientes sintéticos focados em código aberto ou infraestrutura padronizada (ex.: simuladores completos de AWS para tarefas de DevOps). O limite dessa abordagem surge em áreas proprietárias:

  • Custos de licenciamento no projeto ALE V2: Ao tentar adquirir o código-fonte de um jogo MOBA de porte modesto na Steam (base de alguns milhares de jogadores) para criar uma tarefa de desenvolvimento de software, a empresa desenvolvedora cobrou entre 2 e 3 milhões de yuans por uma única entrada de código.
  • Escassez em biomedicina e ciências da vida: O ALE mapeou a árvore taxonômica de subdisciplinas da editora Nature; ao expandir a árvore até o terceiro nível hierárquico, identificaram-se cerca de 3.000 nós. Os benchmarks de biologia e ciências da vida existentes no mercado cobrem menos de 5% a 10% desses nós.
  • Setores restritos: Medicina (dados de prontuários protegidos por privacidade) e design de semicondutores (ambientes que exigem licenças caras de software comercial EDA).

Por que grandes laboratórios continuam terceirizando dados

  1. Prazos estritos de pesquisa: Pesquisadores em laboratórios de fronteira trabalham sob prazos curtos de lançamento de modelos e não possuem tempo hábil para gastar seis meses estruturando a cadeia de dados de um único setor.
  2. Conflito de interesse corporativo: Se um laboratório enviar seus engenheiros de implementação (Forward Deployed Engineers - FDE) para dentro de uma empresa cliente e, simultaneamente, tentar extrair os dados corporativos para treinamento, haverá resistência jurídica e de conformidade. O intermediário neutro (data vendor) contorna esse conflito.
  3. Entrada de Private Equity (PE): Firmas de private equity passaram a adquirir empresas tradicionais para aplicar corte de custos via IA, reestruturar operações e vender os dados operacionais proprietários dessas empresas diretamente para desenvolvedores de IA.

Receitas de treinamento, ajuste de dificuldade e combate a fraudes

  • Ajuste fino de dificuldade: Para benchmarks, a meta é não saturação (alta dificuldade). Para pós-treinamento em RL, o dado precisa estar na zona proximal de aprendizado do modelo: se a tarefa for impossível para o estado atual da rede, o modelo não gera trajetórias válidas de exploração. Fornecedores realizam calibragem entregando tarefas customizadas para checkpoints ainda não lançados dos clientes ou geram trajetórias passo a passo com especialistas para SFT (Supervised Fine-Tuning).
  • Autoaperfeiçoamento Recursivo (Recursive Self-Improvement - RSI): Testes de agentes onde modelos passam dias ou semanas treinando e refinando outros modelos em loops fechados de GPU, exigindo restrições de orçamento de tokens, tempo e etapas de execução.
  • Controvérsia do SWE-bench Verified: Em fevereiro, a OpenAI anunciou que deixaria de reportar scores no SWE-bench Verified apontando duas causas: defeitos no design dos testes (scripts avaliadores que rejeitavam soluções funcionalmente corretas) e contaminação de dados (modelos reproduzindo patches humanos idênticos sob determinados prompts por terem memorizado repositórios públicos no pré-treinamento).
  • Fraude e incentivos na coleta de especialistas: No projeto ALE, a promessa de coautoria científica levou alguns especialistas a utilizarem agentes para forjar dados de simulações químicas e engenharia sem executar o trabalho real. A detecção manual dessas fraudes é lenta e cara. A solução proposta para fornecedores comerciais é o protocolo de Proof of Work (exigir gravação contínua em vídeo de todas as 12 horas do fluxo de trabalho do especialista e registro detalhado de todas as ações no sistema).