Moonshot AI propõe Attention Residuals para transformers com 1,25x de eficiência
Troca drop-in das conexões residuais por atenção softmax entre camadas resolve diluição PreNorm no Kimi Linear (48B/3B ativos).
||
18/03 às 09:00
Pontos principais
- Attention Residuals substitui conexões residuais fixas por atenção softmax entre camadas
- Block AttnRes é variante prática com overhead mínimo e compatível drop-in
- Resolve o problema de diluição PreNorm que dilui progressivamente a contribuição de cada camada
- Integrado ao Kimi Linear (48B total / 3B parâmetros ativos) e pré-treinado em 1,4T tokens
- Melhoria de 1,25x em eficiência compute-equivalent
O time Kimi da Moonshot AI propôs Attention Residuals (AttnRes), que substitui as conexões residuais fixas em transformers por atenção softmax sobre outputs de camadas anteriores. A variante prática, Block AttnRes, particiona camadas em blocos e serve como troca drop-in com overhead mínimo. Integrado ao Kimi Linear (48B total / 3B parâmetros ativos) e pré-treinado em 1,4T tokens, o AttnRes resolve a diluição PreNorm e entrega 1,25x de eficiência compute-equivalent.
Comentários
Carregando comentários...
