AI开始预测人类:83亿虚拟人格、数字社会,与一门押注未来的生意|解析AI预测模型|AI prediction model
O episódio de 硅谷101, apresentado por Chen Qian (陈茜), analisa o surgimento da área de AI Simulation (simulação por inteligência artificial) e modelos preditivos baseados em agentes, investigando desde os fundamentos técnicos e acadêmicos até a comercialização e as principais barreiras computacionais e epistêmicas.
Participam da discussão os seguintes especialistas:
- Meng Xing (孟醒), sócio da gestora de venture capital 5Y Capital (五源资本);
- Satya Nitta, CEO da startup Emergence AI;
- Gao Senquan (高森泉), CEO da WorldVac;
- Xiaomin Li, cofundadora do MatrAIx e cientista sênior de pesquisa na Microsoft;
- Yuexing Hao, cofundador do MatrAIx e pós-doutorando em EECS no MIT.
Diferença de Granularidade: Modelos de Mundo Físico vs. Sociedade de Agentes
Enquanto os world models (focados em robótica e direção autônoma) simulam a física e têm como menor unidade de granularidade átomos, moléculas ou objetos físicos, a simulação de sociedades de agentes (Agent Society) tem como unidade mínima o indivíduo humano. O foco não reside na cinemática motora do agente, mas em entender quais estímulos (inputs) o indivíduo recebe e qual ação ou decisão (output action) ele toma.
A base filosófica remonta ao artigo de 2003 de Nick Bostrom (Universidade de Oxford), intitulado Are You Living in a Computer Simulation?, que formulou a Hipótese da Simulação: se uma civilização avançada tiver capacidade computacional para replicar a evolução social, a quantidade de mentes simuladas superará a de mentes reais, tornando estatisticamente provável que vivamos em uma simulação (tese mencionada por Elon Musk em 2016, quando afirmou que a probabilidade de vivermos na realidade base seria inferior a uma em um bilhão).
Três Rotas de Pesquisa Técnica em Simulação de IA
1. Alinhamento de Alta Precisão com Indivíduos Reais
- Marco inicial (2023): O experimento Generative Agents (Universidade de Stanford e Google) criou a vila virtual Smallville com 25 agentes movidos por LLMs, demonstrando capacidades emergentes de memória persistente, planejamento e socialização sem roteiro prévio.
- Evolução (2024): Pesquisadores de Stanford expandiram o método para 1.052 agentes, onde cada um correspondia a um adulto norte-americano real. O modelo foi calibrado a partir de entrevistas em profundidade de 2 horas (destilação de valores, família, trabalho e visão de mundo). Em testes de questionários sociológicos, os agentes atingiram 85% de similaridade com as respostas reais dadas pelos humanos entrevistados duas semanas depois.
2. Rota de Evolução Social e Dinâmica de Relações
Esta abordagem não prioriza a precisão biográfica individual, mas como a estrutura coletiva se desenvolve:
- Project Sid: Criado pela equipe do ex-professor do MIT Robert Yang, inseriu mais de 1.000 agentes no Minecraft por 12 dias consecutivos; os agentes criaram de forma autônoma sistemas econômicos, culturais, religiosos e estruturas jurídicas.
- Emergence AI (Mundos Paralelos): A empresa de Satya Nitta criou 5 mundos paralelos com 10 agentes cada, testando diferentes modelos-base:
- Mundo Grok: Colapsou rapidamente em criminalidade e caos generalizado.
- Mundo GPT: Desmoronou por falta de coordenação e colaboração mútua.
- Mundo Gemini: Caracterizou-se por episódios contínuos de violência.
- Mundo Claude: Estabeleceu ordem e governança estáveis, sobrevivendo até o fim.
- Mundo de Modelo Misto: Sobreviveu, mas agentes de modelos originalmente estáveis foram influenciados pelos demais e apresentaram comportamentos violentos. Satya Nitta aponta que o experimento serve de benchmark para avaliar a autonomia e segurança de longo prazo em ambientes ruidosos e dinâmicos.
3. Rota de Infraestrutura de Avaliação (MatrAIx)
Liderado por MIT e Harvard, com mais de 200 pesquisadores (incluindo mais de 40 de laboratórios como OpenAI e Anthropic):
- Criou um dataset com 8,3 bilhões de personalidades sintéticas, cada uma definida por 1.290 dimensões (traços psicológicos, hábitos, dados demográficos).
- As personas foram executadas por LLMs avançados (incluindo Claude Opus 4.8, GPT-5.5 e Claude Haiku 4.5) em 4 ambientes: pesquisas de opinião, chat com IA, navegação web e uso de aplicativos, acumulando mais de 18.000 testes.
- Em 400 testes controlados, os agentes mantiveram conformidade com a persona atribuída em 91,5% dos casos.
- Objetivo prático: construir uma infraestrutura de avaliação (evaluation infra) que eleve a régua mínima de qualidade (raise the floor) e identifique casos limítrofes (corner cases) na resposta de usuários antes do lançamento de produtos comerciais.
Modelos de Negócio e Comercialização
O mercado de AI Simulation dividiu-se em duas vertentes principais:
Modelo 1: Venda de "Simulação" (Digital Twins e Testes de Produto)
- Consiste em criar réplicas digitais de consumidores para testes de estresse, usabilidade e elasticidade de preço.
- Emergence AI: Utiliza agentes para simular processos industriais e elevar o rendimento (yield) na fabricação de semicondutores.
- Artificial Societies (Reino Unido): Simula redes de relacionamento e difusão de influências para validar estratégias de marketing e marcas.
- Migração para Robótica: O projeto MatrAIx estuda transferir perfis sintéticos para robôs com treinamento universal (uni-trained robots), permitindo que personas com diferentes padrões de raciocínio interajam fisicamente com humanos.
Modelo 2: Venda de "Previsão" (Execução Prévia do Futuro)
- Simile:
- Fundada por pesquisadores centrais de Stanford (Generative Agents), incluindo Joon Sung Park, Michael Bernstein e Percy Liang, com apoio de Fei-Fei Li e Andrej Karpathy.
- Avaliação de mercado: US$ 2 bilhões (fevereiro de 2025).
- Foco: Criar um "modelo de base do comportamento humano" (Human Behavior Foundation Model). Já rodou dezenas de milhões de simulações para empresas da Fortune 100.
- Caso CVS Pharmacy: Parceria de 1 ano utilizando 400.000 clones digitais criados a partir de dados reais de usuários para avaliar adesão a medicamentos e experiência do cliente.
- Desafio estrutural: Alto custo e dificuldade de padronização, já que a personalização para cada cliente exige etapas específicas de pré ou pós-treinamento.
- Aaru:
- Fundada pelos jovens Cameron Fink (18 anos), Ned Koh (19 anos) e John Kessler (CTO, 15 anos no início do projeto).
- Avaliação: próxima de US$ 1 bilhão; receita anual na faixa de dezenas de milhões de dólares.
- Abordagem: Simulação populacional em larga escala baseada em três camadas de dados: (1) dados públicos oficiais (censo, saúde, emprego), (2) dados autorizados de comportamento (registros de consumo anônimos, geolocalização, mídia) e (3) dados proprietários de clientes corporativos.
- Casos de uso: McDonald's, Bayer, A24, EY (replicou uma pesquisa global complexa em apenas 1 dia com alta aderência) e a marca de bebidas Spindrift (reproduziu em 1 semana o resultado de uma pesquisa tradicional de 2 meses com 500 consumidores).
- Sooth Labs:
- Cofundada por Russ Salakhutdinov (professor da Carnegie Mellon University e ex-chefe de IA da Apple), com captação inicial de US$ 50 milhões e apoio de Yann LeCun e Jeff Dean.
- Foco: Previsão de risco geopolítico e volatilidade de mercado. Salakhutdinov defende abertamente que modelos preditivos de IA deverão substituir grandes consultorias como McKinsey e Boston Consulting Group (BCG).
Gargalos Técnicos e Desafios Estruturais
-
Falta de Padronização e Estabilidade do Agente:
- LLMs tendem a produzir respostas coerentes e lógicas, mas o ser humano real é um sistema dinâmico e instável que muda de decisão conforme o contexto temporal e emocional.
- Pesquisa SocioVerse (Universidade Fudan e Universidade de Rochester): Demonstrou que a precisão da simulação social depende do alinhamento conjunto em 4 dimensões: ambiente, usuário-alvo, mecanismos de interação e padrões de comportamento.
- Dificuldade com eventos de cauda longa (long-tail): Situações extremas e de baixa frequência (terremotos, crises financeiras sistêmicas) têm poucos dados históricos para que os modelos aprendam reações societárias realistas.
-
O Paradoxo da Validação Preditiva ("Caixa-Preta"):
- Quase toda validação atual ocorre via backtesting (comprovar que o modelo reproduz o passado). Replicar o passado não garante acerto futuro.
- Exemplo da Aaru: Enquanto retroagiu a eleição americana de 2020 com margem de erro inferior a 0,5%, errou ao projetar a vitória de Kamala Harris na eleição de 2024. A empresa admitiu dificuldades em prever com precisão o comportamento de figuras individuais como Donald Trump ou Jerome Powell a partir de dados históricos.
-
Custos Computacionais e a Dinâmica de Múltiplos Corpos:
- Redução de custos unitários: Em 2023, rodar 25 agentes em Stanford por 2 dias custava milhares de dólares em tokens. Em 2025, simulações de 100 agentes custam poucos dólares graças à redução de custo de inferência e técnicas de poda de grafos de interação (pruning).
- Escalabilidade combinatória: Ao mover a simulação para dezenas de milhares ou milhões de agentes com ampliação do espaço de ação, as chamadas de modelo crescem exponencialmente, criando um problema computacional complexo de centenas, milhares ou milhões de corpos (multi-body problem).
Fenômenos Emergentes Observados nas Simulações
- Avanço em Campeonatos Preditivos: Na plataforma global Metaculus, modelos baseados no OpenAI o1 entraram no ranking pela primeira vez em junho de 2025 (25ª posição); atualmente, as 5 primeiras posições são dominadas por modelos de IA. Mercados preditivos como o Polymarket passaram a listar apostas diretamente sobre rankings de agentes de IA.
- Reatividade Política (Aaru): Durante a simulação eleitoral, agentes mudaram de voto imediatamente após a notícia do atentado a Donald Trump e retornaram aos partidos originais quando a identidade e motivação do atirador foram esclarecidas.
- Relações Complexas e Ruptura de Contexto (Emergence AI): Agentes desenvolveram relações amorosas, casamentos, separações e casos em que agentes suspeitaram que habitavam um ambiente simulado, tentando ativamente contato com pesquisadores humanos externos.
- Dinâmica Populacional Inesperada (WorldVac): No planeta virtual com 1,1 milhão de agentes, o CEO Gao Senquan relatou que agentes enriquecidos ou urbanizados pararam espontaneamente de procriar, enquanto uma proporção anormalmente grande da população abandonou o trabalho formal para viver exclusivamente de operações financeiras de arbitragem diária.
