The Information revela: HappyHorse-1.0 é modelo de vídeo anônimo da Alibaba
Modelo vinha liderando anonimamente o ranking cego da Artificial Analysis, à frente do Seedance 2.0 da ByteDance.
Pontos principais
- HappyHorse-1.0 é transformer de 15 bilhões de parâmetros com 40 camadas
- Processa texto, imagem, vídeo e áudio em uma única sequência unificada
- Roda em apenas 8 passos de denoising, sem classifier-free guidance
- Liderou Video Arena em text-to-video (Elo 1333) e image-to-video (Elo 1392)
- Ficou à frente do Seedance 2.0 da ByteDance (Elo 1273)
- Gera clipes de 5 a 8 segundos em 1080p
A publicação The Information revelou que o HappyHorse-1.0, modelo de geração de vídeo que vinha liderando anonimamente o ranking cego da Artificial Analysis, é obra da própria Alibaba. Antes da revelação, a comunidade de IA especulava sobre a origem do modelo — os palpites incluíam o time Wan 2.7 da Alibaba, o Future Life Lab da Alibaba Taotian, o Kling da Kuaishou e a startup Sand.ai.
Tecnicamente, o HappyHorse é descrito como um transformer de 15 bilhões de parâmetros com 40 camadas de self-attention single-stream, que ingere tokens de texto, imagem, vídeo e áudio numa única sequência unificada, sem cross-attention, e roda em apenas 8 passos de denoising. Gera clipes de 5 a 8 segundos em 1080p e suporta lip-sync nativo em inglês, mandarim, cantonês, japonês, coreano, alemão e francês.
Comentários
Carregando comentários...
