E253|谁在给大模型出题、卖题、判卷?聊聊AI数据行业的野蛮生长
Discussão entre Yiwen (apresentadora do podcast Guigu 101), He Yunzhong (diretor de pesquisa em pós-treinamento e avaliação da Scale AI) e Sun Yiyou (pesquisador de pós-doutorado na UC Berkeley e cocriador do benchmark Agents’ Last Exam - ALE) sobre a estrutura econômica, as metodologias técnicas e os gargalos operacionais da indústria de dados para modelos de inteligência artificial.
O mercado de dados de IA e os perfis das empresas fornecedoras
O setor de dados de treinamento para modelos de fronteira passou por uma reavaliação de valuation acelerada:
- AfterQuery: avaliada em US$ 300 milhões no Series A em abril, alcançou US$ 3,2 bilhões em nova rodada em setembro (multiplicação de 10x em menos de seis meses, estabelecendo o recorde de empresa mais rápida da Y Combinator a virar unicórnio).
- Scale AI: recebeu aporte da Meta com valuation superior a US$ 29 bilhões.
- Mercor: atingiu valuation de US$ 10 bilhões em rodada realizada em outubro.
- Bespoke Labs: levantou US$ 40 milhões na soma das rodadas Seed e Series A.
He Yunzhong classifica os participantes do mercado de dados em cinco categorias com dinâmicas operacionais distintas:
- Empresas originadas em recrutamento: Mercor (que começou com entrevistas automatizadas por IA e foca na velocidade de mobilização de especialistas) e Handshake.
- Redes tradicionais de crowdsourcing: Scale AI e Surge AI. A Surge AI prioriza especialistas contratados internamente para maior controle de qualidade, perdendo flexibilidade de escala; a Scale AI opera em rede aberta com camadas proprietárias de controle de qualidade sobre dados e avaliadores.
- Empresas de engenharia e dados sintéticos: BigCode e Snorkel AI, com foco em geração de código e ambientes de chamada de ferramentas (tool calling).
- Empresas de IA corporificada (embodied AI): desenvolvedores de modelos de robótica que, antes de monetizarem os modelos finais, comercializam seus acervos brutos de captura física.
- Corretores de dados (data brokers) de nicho: intermediários que possuem direitos proprietários sobre ativos específicos (como acervos protegidos por direitos autorais em Hollywood) e operam apenas o licenciamento.
Da anotação humana ao pós-treinamento: Rubrics e Ambientes de RL
O foco dos laboratórios de pesquisa migrou da escala bruta no pré-treinamento para o pós-treinamento (post-training), impulsionado pelo sucesso de modelos de raciocínio (como a série o da OpenAI):
- Supervisão Fraca para Forte (Weak-to-strong supervision) e Rubrics: Em matemática e código básico, a verificação por Reinforcement Learning (RL) é determinística (resultado binário de acerto/erro). Em domínios como história, medicina e direito, a resposta não é estruturada. A solução adotada foi o rubric data (critérios objetivos detalhados escritos por especialistas). Um modelo menor atua como assistente de correção (teaching assistant), aplicando as regras elaboradas pelo especialista (professor) para pontuar o modelo mais forte.
- Transição para Ambientes de RL (RL Environments): He Yunzhong aponta que o mercado está saturado de rubrics estáticos puramente textuais de rodada única/múltipla. A demanda atual exige ambientes completos de agente (agentic data), compostos por tarefas em sandboxes, ferramentas executáveis, chamadas de sistema, manipulação de bancos de dados e mecanismos de verificação programática (programmatic checks).
Divergência: O esgotamento dos Rubrics e a quantificação do subjetivo
- Posição de He Yunzhong: Rubrics de texto para conhecimento factual já foram amplamente coletados nos principais domínios; o foco migrou para a execução de código e tarefas acionáveis (knowledge work).
- Posição de Sun Yiyou: Os rubrics estão longe de estar esgotados. Na engenharia e em tarefas complexas sem resposta única (como criação de jogos ou resoluções matemáticas alternativas), exigir correspondência estrita com um ground truth engessa a avaliação. Indicadores subjetivos (como "um jogo ser divertido" ou "uma imagem ser bonita") possuem critérios científicos em manuais de design — como suavidade da curva de recompensa dopaminérgica — que ainda não foram convertidos em rubrics públicos de larga escala.
- Solução proposta: Yunzhong aponta para o uso de modelos de recompensa (reward models) treinados para capturar a percepção humana combinados com rubrics mais abertos quando o ambiente for altamente subjetivo.
Benchmarks versus comercialização de dados
- Agents’ Last Exam (ALE): Projeto liderado pela UC Berkeley RDI com mais de 300 especialistas industriais para medir agentes em tarefas complexas, multi-etapas e com valor econômico verificável. A versão pública inicial conta com mais de 150 tarefas em mais de 50 setores; a versão V2 planeja expandir para mais de 1.000 tarefas.
- Relação entre Benchmark e Dados: He Yunzhong afirma que criar benchmarks confere autoridade técnica para vender dados, mas ressalta o risco ético. Sun Yiyou alerta que empresas de dados não podem vender os conjuntos de teste de seus benchmarks para evitar a contaminação dos testes e a degradação da autoridade científica. Para Yiyou, o benchmark deve olhar para o futuro (problemas não resolvidos), enquanto os dados atendem ao presente.
- Bench-maxxing (otimização forçada para subir em rankings): Não é necessariamente prejudicial se o benchmark espelhar com precisão o fluxo de trabalho real do usuário. Caso meça apenas capacidades isoladas ou quebra-cabeças arbitrários sem generalização, torna-se inútil.
- Limitações do Artificial Analysis e do LMArena para Agentes: Plataformas como o LMArena funcionam bem para chat de baixa latência e custo reduzido. Em agentes executando tarefas de horas, é inviável colocar múltiplos modelos rodando em paralelo em testes A/B para o usuário final votar. Por isso, grandes laboratórios (como OpenAI e Anthropic) desenvolvem suítes internas de avaliação proprietárias alinhadas às suas próprias distribuições de uso.
- Caso SWE-Atlas: A Scale AI desenvolveu o conjunto SWE-Atlas em três módulos: Q&A de repositório, refatoração de código e geração de testes. O módulo de Q&A (o mais simples) foi adotado precocemente pelo Artificial Analysis, provocando uma corrida imediata de laboratórios para comprar dados e otimizar especificamente essa métrica básica.
Custos de aquisição de dados e gargalos em setores verticais
Equipes pequenas de 2 a 3 pessoas conseguem altas avaliações desenvolvendo geradores de ambientes sintéticos focados em código aberto ou infraestrutura padronizada (ex.: simuladores completos de AWS para tarefas de DevOps). O limite dessa abordagem surge em áreas proprietárias:
- Custos de licenciamento no projeto ALE V2: Ao tentar adquirir o código-fonte de um jogo MOBA de porte modesto na Steam (base de alguns milhares de jogadores) para criar uma tarefa de desenvolvimento de software, a empresa desenvolvedora cobrou entre 2 e 3 milhões de yuans por uma única entrada de código.
- Escassez em biomedicina e ciências da vida: O ALE mapeou a árvore taxonômica de subdisciplinas da editora Nature; ao expandir a árvore até o terceiro nível hierárquico, identificaram-se cerca de 3.000 nós. Os benchmarks de biologia e ciências da vida existentes no mercado cobrem menos de 5% a 10% desses nós.
- Setores restritos: Medicina (dados de prontuários protegidos por privacidade) e design de semicondutores (ambientes que exigem licenças caras de software comercial EDA).
Por que grandes laboratórios continuam terceirizando dados
- Prazos estritos de pesquisa: Pesquisadores em laboratórios de fronteira trabalham sob prazos curtos de lançamento de modelos e não possuem tempo hábil para gastar seis meses estruturando a cadeia de dados de um único setor.
- Conflito de interesse corporativo: Se um laboratório enviar seus engenheiros de implementação (Forward Deployed Engineers - FDE) para dentro de uma empresa cliente e, simultaneamente, tentar extrair os dados corporativos para treinamento, haverá resistência jurídica e de conformidade. O intermediário neutro (data vendor) contorna esse conflito.
- Entrada de Private Equity (PE): Firmas de private equity passaram a adquirir empresas tradicionais para aplicar corte de custos via IA, reestruturar operações e vender os dados operacionais proprietários dessas empresas diretamente para desenvolvedores de IA.
Receitas de treinamento, ajuste de dificuldade e combate a fraudes
- Ajuste fino de dificuldade: Para benchmarks, a meta é não saturação (alta dificuldade). Para pós-treinamento em RL, o dado precisa estar na zona proximal de aprendizado do modelo: se a tarefa for impossível para o estado atual da rede, o modelo não gera trajetórias válidas de exploração. Fornecedores realizam calibragem entregando tarefas customizadas para checkpoints ainda não lançados dos clientes ou geram trajetórias passo a passo com especialistas para SFT (Supervised Fine-Tuning).
- Autoaperfeiçoamento Recursivo (Recursive Self-Improvement - RSI): Testes de agentes onde modelos passam dias ou semanas treinando e refinando outros modelos em loops fechados de GPU, exigindo restrições de orçamento de tokens, tempo e etapas de execução.
- Controvérsia do SWE-bench Verified: Em fevereiro, a OpenAI anunciou que deixaria de reportar scores no SWE-bench Verified apontando duas causas: defeitos no design dos testes (scripts avaliadores que rejeitavam soluções funcionalmente corretas) e contaminação de dados (modelos reproduzindo patches humanos idênticos sob determinados prompts por terem memorizado repositórios públicos no pré-treinamento).
- Fraude e incentivos na coleta de especialistas: No projeto ALE, a promessa de coautoria científica levou alguns especialistas a utilizarem agentes para forjar dados de simulações químicas e engenharia sem executar o trabalho real. A detecção manual dessas fraudes é lenta e cara. A solução proposta para fornecedores comerciais é o protocolo de Proof of Work (exigir gravação contínua em vídeo de todas as 12 horas do fluxo de trabalho do especialista e registro detalhado de todas as ações no sistema).
