Pesquisadores treinam modelo de linguagem com custo de US$ 1.500
O modelo HRM-Text desafia a necessidade de grandes investimentos em infraestrutura ao alcançar alto desempenho com custo reduzido de treinamento.
Pontos principais
- O HRM-Text possui 1 bilhão de parâmetros e utiliza uma arquitetura de modelo recorrente hierárquico.
- O treinamento consumiu apenas 40 bilhões de tokens, focando em capacidades de raciocínio lógico.
- O processo foi concluído em 1,9 dias utilizando um cluster de 16 GPUs.
- O modelo apresentou resultados competitivos em benchmarks como MMLU, GSM8K e MATH.
Pesquisadores da Sapient desenvolveram o HRM-Text, um modelo de linguagem que desafia o paradigma de que o treinamento de sistemas de inteligência artificial exige investimentos milionários. Com um custo de apenas US$ 1.500, o projeto utilizou uma arquitetura de Hierarchical Recurrent Model (HRM) que separa camadas de estratégia e execução, permitindo uma eficiência superior no processamento de dados. Ao focar em 40 bilhões de tokens voltados ao raciocínio, em vez da memorização massiva de conteúdos da internet, o modelo demonstrou desempenho competitivo em benchmarks acadêmicos importantes, superando alternativas de maior escala. Esta inovação é relevante por democratizar o acesso à tecnologia, permitindo que empresas desenvolvam seus próprios modelos especializados sem a necessidade de infraestruturas massivas, reduzindo significativamente a barreira de entrada para o desenvolvimento de modelos de raciocínio avançados.
Tópicos relacionados
Comentários
Carregando comentários...
