Why World Models Could Change Robotics, 3D, and Creativity
Os cofundadores da World Labs — Fei-Fei Li, Justin Johnson e Ben Mildenhall — juntam-se a Martin Casado, sócio-geral da a16z, para discutir o lançamento do Atlas, o mais recente modelo de mundo da empresa. Fundada há cerca de dois anos e meio, a startup desenvolve tecnologia focada em inteligência espacial, integrando geração, reconstrução 3D e simulação em uma única arquitetura unificada.
O que é o Atlas e a primitiva de "New View Prediction"
O Atlas é definido por seus criadores como um modelo de mundo de nova geração construído sobre uma primitiva fundamental inédita: a predição de novos pontos de vista (new view prediction).
- Analogia de paradigmas: enquanto os grandes modelos de linguagem (LLMs) operam sob a predição do próximo token (next token prediction) e os modelos de vídeo tradicionais utilizam a predição do próximo quadro (next frame prediction), o Atlas prevê como um ambiente físico se parece a partir de qualquer coordenada arbitrária no espaço e no tempo.
- Contexto espacial: o modelo recebe imagens, vídeos ou descrições textuais associadas a parâmetros geométricos e constrói internamente um contexto espacial fundamentado. A partir dele, uma câmera virtual pode navegar livremente pela cena.
- Exemplo de efeito Bullet Time: na produção do filme Matrix, a famosa cena em que Neo desvia de balas em câmera lenta exigiu centenas de câmeras sincronizadas em estúdio com fundo verde e calibração complexa. Com o Atlas, o mesmo efeito pode ser gerado a partir de apenas três iPhones comuns em tripés (como uma gravação casual de alguém arremessando uma bola de basquete ou um morango caindo em uma tigela de leite), permitindo congelar o tempo e navegar a câmera ao redor da cena.
Diferenças arquiteturais: Unificação de Geração e Reconstrução 3D
Ben Mildenhall e Justin Johnson explicam que o Atlas não é um mero escalonamento (scale-up) de modelos de difusão de vídeo, mas uma reformulação arquitetural:
- Fim da divisão histórica: no campo da visão computacional, reconstrução 3D e geração de imagens sempre existiram como disciplinas isoladas e modelos especializados distintos. O Atlas unifica ambas.
- Multimodalidade nativa desde o pré-treinamento: o modelo aceita nativamente texto, imagens, vídeos, poses 3D de câmera (coordenadas e parâmetros de câmera como entrada explícita) e mapas de profundidade (depth maps estruturais acoplados ao RGB).
- Controle determinístico vs. efeito "caça-níquel": modelos generativos de vídeo operam por tentativas aleatórias via comandos de texto (prompts). No Atlas, cada imagem inserida tem ancoragem tridimensional precisa: inserir fotos dos quatro cantos de uma sala gera a geometria exata do espaço, sem alucinações nas posições relativas dos objetos.
- Evolução em relação ao Marble: o primeiro modelo da World Labs, o Marble, gerava mundos 3D limitados à representação de Gaussian Splats (3DGS). Embora eficientes para renderização em dispositivos móveis e motores de jogos, os splats atuavam como um gargalo no modelo anterior. O Atlas desacoplou a representação interna: opera na primitiva de predição de visualizações e mapas de profundidade, podendo exportar para Gaussian Splats apenas quando necessário.
Reconstrução Densa vs. Reconstrução Esparsa
Ben Mildenhall (pioneiro na criação dos NeRFs) contrasta a reconstrução tradicional com a abordagem do Atlas:
- Reconstrução densa tradicional: exige entre 100 e 300+ fotos meticulosas de um único cômodo (ou mais de 2.000 imagens para uma casa inteira), cobrindo cada fresta sob mesas e cadeiras. Qualquer ponto não visto em múltiplos ângulos resulta em buracos pretos na malha 3D.
- Reconstrução esparsa com o Atlas: reduz a necessidade de dados de captura entre 50x e 100x. Cenas completas podem ser reconstruídas a partir de 3 a 25 fotos.
- Exemplo do campus de Stanford: no material demonstrativo da World Labs, a praça principal de Stanford (Stanford Quad) foi reconstruída com visão aérea total utilizando apenas fotografias tiradas por Ben do chão. O modelo triangula as partes visíveis e utiliza sua capacidade generativa contextual para preencher realisticamente as lacunas estruturais que não foram diretamente fotografadas.
- Janela de contexto expansível: o processo funciona de forma autoregressiva, similar ao aumento da janela de contexto em LLMs de código. É possível alimentar capturas de 30 a 64 fotos de uma casa com múltiplos cômodos e gerar sobrevoos contínuos e consistentes.
Leis de Escala e o Experimento Decisivo
Segundo Justin Johnson e Fei-Fei Li, a equipe tinha convicção na hipótese de escala (scaling law) aplicada à inteligência espacial:
- Validação prática: cada iteração com aumento de parâmetros, maior tempo de treinamento e mais nós de computação resultou em saltos qualitativos diretos. O limite do modelo atual foi ditado estritamente pelo orçamento de computação e pelos prazos de entrega do lançamento.
- O momento da virada: durante o verão, a equipe testou um modelo preliminar com a clássica cena da mesa de jardim (conjunto de dados de teste de NeRF). Da noite para o dia, o modelo gerou uma trajetória inédita de câmera passando por baixo da mesa, renderizando com precisão uma bola de futebol que estava no chão. O resultado confirmou a viabilidade do método.
Aplicações Práticas
Indústria Criativa, Arquitetura e Jogos
- Persistência de estado tridimensional: fluxos de trabalho profissionais em cinema, efeitos visuais (VFX) e desenvolvimento de jogos dependem de cenários e objetos fixos. Modelos generativos 2D comuns alteram o arranjo dos objetos a cada novo comando; o Atlas mantém consistência espacial absoluta.
- Iteração em design e arquitetura: atualmente, transferir alterações verbais ou esboços de diretores de arte para modelos 3D em softwares tradicionais consome cerca de 95% do tempo de produção (frequentemente exigindo uma semana inteira de revisões após uma reunião). O modelo permite materializar e editar espacialmente conceitos de forma direta.
Robótica e Simulação Real-to-Sim
- Aquisição da Synnex: a World Labs incorporou a tecnologia da Synnex, focada na transição de dados do mundo real para simulação (real-to-sim) e de volta para o ambiente real (sim-to-real).
- Gargalo de dados: Fei-Fei Li destaca que o maior limitador atual da robótica não é computação, mas a escassez de dados reais de interação física (como cablagem industrial ou manipulação de objetos).
- Randomização de domínio: para treinar políticas de controle de robôs, não basta reconstruir um ambiente; é necessário aplicar randomização (alterar curvatura de cabos, cores, tamanhos de caixas e iluminação). O Atlas acelera a recriação e variação sintética desses ambientes.
- Simuladores neurais como planejadores: Justin Johnson argumenta que, enquanto código tradicional produz artefatos estáticos, políticas robóticas precisam interagir com contingências físicas. Modelos de mundo aprendem a dinâmica de resposta do ambiente, o que permite que o próprio simulador neural evolua para atuar como o planejador de ações (action planner) do robô.
Dinâmica, Editabilidade e Vídeo 4D
- Dinâmica latente (Baby Dynamics): embora o checkpoint público priorize navegação espacial estática, o pré-treinamento do Atlas foi alimentado com dados dinâmicos massivos. Exemplos do modelo já exibem elementos como ondas na água e carros em movimento em tomadas aéreas. A exposição a dados dinâmicos permite ao modelo decompor o movimento temporal da geometria fixa.
- Controle e editabilidade sem perda de fidelidade: Ben Mildenhall enfatiza que o próximo grande desafio é adicionar controle granular (manipulação de objetos específicos, trajetórias temporais e iluminação) sem degradar a qualidade visual do modelo base.
"New View Prediction" como Tarefa IA-Completa
No encerramento, os pesquisadores conectam a inteligência espacial ao conceito de completude em inteligência artificial (AI completeness, por analogia à Turing-completude):
- Uma tarefa é considerada IA-completa se sua resolução em máxima generalidade for suficiente para solucionar a inteligência geral (como a predição de próximo token em LLMs).
- Justin Johnson e Fei-Fei Li defendem que a predição de novos pontos de vista é igualmente IA-completa, pois exige que o modelo compreenda implicitamente a física, a geometria, a causalidade e a estrutura de todo o mundo físico.
- Perspectiva evolutiva: Fei-Fei Li pontua que a evolução biológica concedeu olhos e visão a animais que se movem, mas não a árvores estáticas. O ato de se deslocar no espaço físico requer processar e antecipar continuamente novos pontos de vista — tornando a predição de visualizações o equivalente físico e perceptual do próximo token na linguagem.
