Projeto Marin cria conjunto de 25 trilhões de tokens com dados abertos
A equipe do projeto Marin desenvolveu uma infraestrutura escalável para processar dados do Hugging Face, gerando 25 trilhões de tokens.
Pontos principais
- O projeto Marin foca no uso de infraestrutura escalável para processar dados de código aberto.
- O fluxo de trabalho envolve etapas de deduplicação, descontaminação e mistura de dados.
- O processamento resultou em um conjunto de dados totalizando 25 trilhões de tokens.
O projeto Marin anunciou o desenvolvimento de uma infraestrutura escalável voltada para o processamento de dados disponíveis na plataforma Hugging Face. A iniciativa busca aproveitar o potencial da comunidade de código aberto para a criação de grandes volumes de dados para treinamento.
O processo técnico aplicado pela equipe inclui etapas rigorosas de deduplicação, descontaminação e mistura de informações. Como resultado dessa operação, foi gerado um conjunto de dados composto por 25 trilhões de tokens.
Comentários
Carregando comentários...
