Daily Journal
Daily Journal

Pesquisadores propõem DeepLoop para estabilizar modelos de IA

Novo método ajusta o escalonamento residual em Transformers com camadas reutilizadas, aumentando a estabilidade e a precisão de modelos de IA.

Daily Journal
||
19/07 às 17:43

Pontos principais

  • O estudo DeepLoop foi publicado por pesquisadores de Princeton em 15 de julho de 2026.
  • Transformers com 'loops' reutilizam camadas para aumentar a profundidade sem adicionar novos parâmetros.
  • A técnica resolve a instabilidade causada pelo acúmulo de gradientes em parâmetros compartilhados durante múltiplas passagens.
  • O método ajusta o expoente de escalonamento residual de 1/4 para 1/2 conforme o número de loops aumenta.
  • Testes em modelos GPT-2 small e medium demonstraram melhorias na perda de validação e na precisão de tarefas downstream.
  • A pesquisa sugere que o escalonamento deve considerar o número de visitas aos parâmetros, e não apenas o número nominal de camadas.

Pesquisadores de Princeton apresentaram o DeepLoop, uma nova abordagem para otimizar o treinamento de 'Looped Transformers'. Esses modelos aumentam a profundidade computacional ao reutilizar um conjunto compacto de camadas, mas enfrentam desafios de estabilidade, pois os parâmetros compartilhados recebem gradientes agregados de múltiplas visitas. O método formaliza esse efeito através de um coeficiente de alinhamento de visitas, permitindo um escalonamento residual mais preciso que garante a convergência do modelo.

A relevância da descoberta foi destacada por membros da equipe nas redes sociais, sugerindo que a técnica pode ser aplicada a arquiteturas de modelos de fronteira que utilizam estratégias de repetição de camadas. Ao ajustar as regras de escalonamento, o DeepLoop permite que modelos de linguagem alcancem maior profundidade efetiva sem comprometer o desempenho, oferecendo uma solução técnica para a eficiência em arquiteturas de larga escala.

Comentários

Carregando comentários...