Daily Journal
Daily Journal

Pesquisa aponta que 'harnesses' melhoram generalização de IAs

Estudo de Alex L. Zhang demonstra que estruturas de suporte permitem que modelos de linguagem resolvam tarefas complexas e inéditas com mais eficácia.

Daily Journal
Foto: alexzhang13.github.io
||
21/07 às 13:41

Pontos principais

  • O estudo propõe que o 'harness' — programa que intermedeia o modelo e o ambiente — é um motor de generalização, não apenas uma interface.
  • Modelos de linguagem recursivos (RLMs) treinados apenas em tarefas curtas generalizaram para problemas 8 a 32 vezes mais longos.
  • A técnica de decomposição recursiva superou o desempenho de Transformers tradicionais com métodos de extensão de contexto, como o YaRN.
  • Testes realizados em seis benchmarks, incluindo LongBenchPro e OOLONG, mostraram transferência superior de aprendizado entre domínios distintos.
  • A abordagem reduz a necessidade de curadoria massiva de dados, permitindo que modelos resolvam problemas complexos através de sub-tarefas simples.
  • O treinamento de RLMs apresentou um tempo de execução de 1,5 a 3 vezes maior em comparação com modelos base.

Uma nova pesquisa publicada pelo pesquisador Alex L. Zhang, do MIT e Databricks, sugere que a capacidade de generalização de modelos de linguagem pode ser significativamente ampliada através do design de 'harnesses' — estruturas de software que gerenciam a interação entre o modelo e o ambiente. Ao invés de forçar o Transformer a processar contextos longos e complexos de forma direta, o harness decompõe problemas em sub-tarefas menores que se alinham com os dados de treinamento originais do modelo.

Os resultados indicam que essa abordagem de 'Modelo de Linguagem Recursivo' (RLM) permite que a IA aplique conhecimentos adquiridos em domínios simples para resolver problemas inéditos e muito mais extensos. Enquanto Transformers convencionais, mesmo com técnicas de extensão de contexto, falham ao extrapolar estratégias de raciocínio, o harness atua como um viés indutivo de alto nível, tornando a generalização composicional uma meta-capacidade prática e escalável para sistemas de IA modernos.

Comentários

Carregando comentários...