Pesquisa aponta que 'harnesses' melhoram generalização de IAs
Estudo de Alex L. Zhang demonstra que estruturas de suporte permitem que modelos de linguagem resolvam tarefas complexas e inéditas com mais eficácia.
Pontos principais
- O estudo propõe que o 'harness' — programa que intermedeia o modelo e o ambiente — é um motor de generalização, não apenas uma interface.
- Modelos de linguagem recursivos (RLMs) treinados apenas em tarefas curtas generalizaram para problemas 8 a 32 vezes mais longos.
- A técnica de decomposição recursiva superou o desempenho de Transformers tradicionais com métodos de extensão de contexto, como o YaRN.
- Testes realizados em seis benchmarks, incluindo LongBenchPro e OOLONG, mostraram transferência superior de aprendizado entre domínios distintos.
- A abordagem reduz a necessidade de curadoria massiva de dados, permitindo que modelos resolvam problemas complexos através de sub-tarefas simples.
- O treinamento de RLMs apresentou um tempo de execução de 1,5 a 3 vezes maior em comparação com modelos base.
Uma nova pesquisa publicada pelo pesquisador Alex L. Zhang, do MIT e Databricks, sugere que a capacidade de generalização de modelos de linguagem pode ser significativamente ampliada através do design de 'harnesses' — estruturas de software que gerenciam a interação entre o modelo e o ambiente. Ao invés de forçar o Transformer a processar contextos longos e complexos de forma direta, o harness decompõe problemas em sub-tarefas menores que se alinham com os dados de treinamento originais do modelo.
Os resultados indicam que essa abordagem de 'Modelo de Linguagem Recursivo' (RLM) permite que a IA aplique conhecimentos adquiridos em domínios simples para resolver problemas inéditos e muito mais extensos. Enquanto Transformers convencionais, mesmo com técnicas de extensão de contexto, falham ao extrapolar estratégias de raciocínio, o harness atua como um viés indutivo de alto nível, tornando a generalização composicional uma meta-capacidade prática e escalável para sistemas de IA modernos.
Comentários
Carregando comentários...
