Daily Journal
Daily Journal

The Information revela: HappyHorse-1.0 é modelo de vídeo anônimo da Alibaba

Modelo vinha liderando anonimamente o ranking cego da Artificial Analysis, à frente do Seedance 2.0 da ByteDance.

Daily Journal
||
09/04 às 09:00

Pontos principais

  • HappyHorse-1.0 é transformer de 15 bilhões de parâmetros com 40 camadas
  • Processa texto, imagem, vídeo e áudio em uma única sequência unificada
  • Roda em apenas 8 passos de denoising, sem classifier-free guidance
  • Liderou Video Arena em text-to-video (Elo 1333) e image-to-video (Elo 1392)
  • Ficou à frente do Seedance 2.0 da ByteDance (Elo 1273)
  • Gera clipes de 5 a 8 segundos em 1080p

A publicação The Information revelou que o HappyHorse-1.0, modelo de geração de vídeo que vinha liderando anonimamente o ranking cego da Artificial Analysis, é obra da própria Alibaba. Antes da revelação, a comunidade de IA especulava sobre a origem do modelo — os palpites incluíam o time Wan 2.7 da Alibaba, o Future Life Lab da Alibaba Taotian, o Kling da Kuaishou e a startup Sand.ai.

Tecnicamente, o HappyHorse é descrito como um transformer de 15 bilhões de parâmetros com 40 camadas de self-attention single-stream, que ingere tokens de texto, imagem, vídeo e áudio numa única sequência unificada, sem cross-attention, e roda em apenas 8 passos de denoising. Gera clipes de 5 a 8 segundos em 1080p e suporta lip-sync nativo em inglês, mandarim, cantonês, japonês, coreano, alemão e francês.

Comentários

Carregando comentários...