How Real-Time AI Video Is Changing How Creators Work
Jennifer Li, sócia-geral da a16z, entrevista Görkem Yurtseven, cofundador da fal, e Batuhan Taşkaya, head de engenharia da empresa. A discussão detalha o desenvolvimento do H3 Max, versão pós-treinada e otimizada do modelo de pesos abertos H3 da chinesa MiniMax, as técnicas de engenharia que viabilizaram geração de vídeo em tempo real, os mecanismos de memória de cena para transmissões contínuas e a transição do foco de velocidade pura para controlabilidade determinística exigida pelos estúdios de Hollywood.
A Tese do "Token Market Fit" e o Pós-Treinamento de Modelos Abertos
- Gargalo de computação (compute constraint): Segundo Yurtseven, desde abril de 2024 toda a indústria de mídia generativa opera sob restrição de capacidade de hardware. A fal cresce proporcionalmente à quantidade de GPUs adicionadas, o que forçou a empresa a buscar saltos de eficiência por software.
- Conceito de Token Market Fit: A fal define o fenômeno pela capacidade de um único usuário profissional consumir produtivamente cerca de US$ 10.000 por mês em tokens de forma contínua em seu fluxo de trabalho diário — dinâmica comparável apenas ao mercado de agentes de código (coding agents).
- Transição de infraestrutura para pós-treinamento: Otimizações puras de sistemas em modelos fechados geravam ganhos de 2x a 3x, aproximando-se do teto físico do chip (roofline). A fal já havia testado infraestrutura de pós-treinamento em modelos de imagem como Ideogram e Flux. Com o lançamento do H3 da MiniMax — o primeiro modelo de vídeo de última geração verdadeiramente aberto —, a equipe combinou pós-treinamento com kernel engineering para superar a barreira de latência por uma ordem de magnitude.
Engenharia de Sistemas e Otimização do Pipeline (H3 Max e Turbo)
- Aceleração e métricas: O H3 Max alcançou uma aceleração de ~35x em relação ao ponto de partida original da MiniMax, mantendo pontuação de ELO equivalente ou superior.
- Pipeline de difusão e RL: Para reduzir os passos de inferência de 50 para ~20 passos sem degradar a qualidade visual, a fal executou pipelines proprietários de pós-treinamento e aprendizado por reforço (RL) no modelo base antes de aplicar o corte de passos.
- Utilização de hardware (MFU): O trabalho de engenharia de kernels elevou a utilização teórica de hardware (Model Flops Utilization - MFU) de 30%–40% (padrão de mercado para cargas de inferência) para a faixa de 70%–80%.
- Otimização ponta a ponta: Um pipeline de vídeo não é monolítico; ele envolve:
- LLM de expansão de prompt: Operado em lote único (low batch size) e sem cache de decodificação.
- Modelo de difusão: Geração no espaço latente com passos reduzidos.
- VAE (Variational Autoencoder): Decodificação otimizada do espaço latente para pixels brutos.
- Módulos de upscaling: Pós-processamento de resolução.
- Topologia de chips: O modelo roda paralelizado em um único nó de 8 GPUs. Escalar além de 8 GPUs reduz a eficiência devido à sobrecarga de comunicação inter-nós. A transição para arquiteturas como Nvidia Blackwell (GB200) traz ganhos adicionais de 2x a 3x no tempo de execução (wall-clock time).
- H3 Max Turbo: Versão lançada uma semana depois que gera 5 segundos de vídeo em 1,5 segundo, com custo 2x menor e retenção de qualidade no 97º percentil dos benchmarks.
Vídeo Contínuo em Tempo Real e o Modelo "Director"
Logo após a liberação do modelo, projetos espontâneos internos e externos surgiram em menos de 24 horas:
- Experimentos de streaming: O engenheiro Rehan Sheikh, da fal, iniciou transmissões contínuas no Twitch a partir de seu próprio computador usando truques de prompt encadeado; em paralelo, o desenvolvedor levelsio criou uma plataforma web de streaming infinito independente.
- Arquitetura de memória de cena (H3 Max Director):
- Memória de curto prazo (até 2 minutos): O modelo retém a atenção sobre o vídeo bruto gerado em formato altamente comprimido. Isso permite continuidade espacial e temporal (ex.: uma pessoa entra na sala, os personagens olham para ela, e ao girar a câmera de volta para a mesa original, o ocupante permanece no mesmo estado).
- Memória de longo prazo (de 2 a 60 minutos): Manter a atenção bruta além de 2 minutos tornaria o custo computacional exponencial. O sistema adota um system prompt dinâmico que evolui progressivamente, registrando o estado global do cenário e dos personagens para transmissões de até 1 hora contínua.
- Plataforma fal Live: Interface pública baseada em WebRTC onde a audiência votava no chat para ditar as próximas ações da cena em tempo real.
- Adoção: Em três semanas de lançamento, o H3 Max tornou-se o modelo de vídeo mais utilizado na fal, superando o segundo colocado por mais que o dobro do volume de geração.
Demandas de Hollywood e Controlabilidade Determinística
- Crescimento no setor audiovisual: O uso por estúdios de Hollywood saiu de quase zero em 2023 para se tornar o segmento de crescimento mais rápido da fal. O Amazon MGM Studios, por exemplo, construiu sua ferramenta de IA NAR sobre a infraestrutura da fal.
- Workflow híbrido (Blender + LLM + Vídeo AI): Profissionais de VFX renderizam uma cena prévia em baixa resolução no Blender (muitas vezes gerada via código por LLMs como o GPT-4o/Astra) e a utilizam como vídeo de referência no H3 Max, alcançando controle visual determinístico próximo de 100%.
- Meta de confiabilidade de 99,9%: Em vez de aceitar a taxa de 80%–90% típica de interfaces baseadas apenas em texto, estúdios exigem ferramentas pontuais previsíveis:
- Controle de câmera via JSON: A trajetória da câmera é definida por matrizes e coordenadas estruturadas por quadro (ex.: posição
[0, 0, 0]em $T_0$, rotação de90°em $T_1$). O modelo pós-treinado trata o JSON como restrição rígida (source of truth), permitindo reconstruções 3D sem alucinações de perspectiva. - Sincronização labial (Lip Sync): Ajuste labial em personagens gerados a partir de arquivos de áudio e imagens de referência.
- Controle de movimento (Motion Transfer): Aplicação direta do movimento corporal de um ator humano em personagens sintéticos.
- Controle de iluminação: Definição da fonte, intensidade e ângulo da luz na cena.
- Controle de câmera via JSON: A trajetória da câmera é definida por matrizes e coordenadas estruturadas por quadro (ex.: posição
- Segurança jurídica e soberania de dados: A fal implementou isolamento de infraestrutura para que estúdios usem propriedades intelectuais (IPs) proprietárias sem vazamento de dados, além de disponibilizar hospedagem nos Estados Unidos para modelos originalmente desenvolvidos na Ásia (como o Seaweed), eliminando barreiras regulatórias para grandes produtoras.
