Pesquisadores propõem DeepLoop para estabilizar modelos de IA
Novo método ajusta o escalonamento residual em Transformers com camadas reutilizadas, aumentando a estabilidade e a precisão de modelos de IA.
Pontos principais
- O estudo DeepLoop foi publicado por pesquisadores de Princeton em 15 de julho de 2026.
- Transformers com 'loops' reutilizam camadas para aumentar a profundidade sem adicionar novos parâmetros.
- A técnica resolve a instabilidade causada pelo acúmulo de gradientes em parâmetros compartilhados durante múltiplas passagens.
- O método ajusta o expoente de escalonamento residual de 1/4 para 1/2 conforme o número de loops aumenta.
- Testes em modelos GPT-2 small e medium demonstraram melhorias na perda de validação e na precisão de tarefas downstream.
- A pesquisa sugere que o escalonamento deve considerar o número de visitas aos parâmetros, e não apenas o número nominal de camadas.
Pesquisadores de Princeton apresentaram o DeepLoop, uma nova abordagem para otimizar o treinamento de 'Looped Transformers'. Esses modelos aumentam a profundidade computacional ao reutilizar um conjunto compacto de camadas, mas enfrentam desafios de estabilidade, pois os parâmetros compartilhados recebem gradientes agregados de múltiplas visitas. O método formaliza esse efeito através de um coeficiente de alinhamento de visitas, permitindo um escalonamento residual mais preciso que garante a convergência do modelo.
A relevância da descoberta foi destacada por membros da equipe nas redes sociais, sugerindo que a técnica pode ser aplicada a arquiteturas de modelos de fronteira que utilizam estratégias de repetição de camadas. Ao ajustar as regras de escalonamento, o DeepLoop permite que modelos de linguagem alcancem maior profundidade efetiva sem comprometer o desempenho, oferecendo uma solução técnica para a eficiência em arquiteturas de larga escala.
Comentários
Carregando comentários...
