Daily Journal
Daily Journal

Moonshot AI propõe Attention Residuals para transformers com 1,25x de eficiência

Troca drop-in das conexões residuais por atenção softmax entre camadas resolve diluição PreNorm no Kimi Linear (48B/3B ativos).

Daily Journal
||
18/03 às 09:00

Pontos principais

  • Attention Residuals substitui conexões residuais fixas por atenção softmax entre camadas
  • Block AttnRes é variante prática com overhead mínimo e compatível drop-in
  • Resolve o problema de diluição PreNorm que dilui progressivamente a contribuição de cada camada
  • Integrado ao Kimi Linear (48B total / 3B parâmetros ativos) e pré-treinado em 1,4T tokens
  • Melhoria de 1,25x em eficiência compute-equivalent

O time Kimi da Moonshot AI propôs Attention Residuals (AttnRes), que substitui as conexões residuais fixas em transformers por atenção softmax sobre outputs de camadas anteriores. A variante prática, Block AttnRes, particiona camadas em blocos e serve como troca drop-in com overhead mínimo. Integrado ao Kimi Linear (48B total / 3B parâmetros ativos) e pré-treinado em 1,4T tokens, o AttnRes resolve a diluição PreNorm e entrega 1,25x de eficiência compute-equivalent.

Comentários

Carregando comentários...