Daily Journal
Daily Journal

CoreWeave lança RL Rollouts para otimizar modelos de aprendizado

Nova ferramenta da CoreWeave permite carregar pesos em modelos de aprendizado por reforço sem redeploy, aumentando a eficiência e a performance.

Daily Journal
Foto: x.com
||
06/10 às 16:40

Pontos principais

  • O RL Rollouts possibilita carregar novos pesos 15 vezes mais rápido que um redeploy convencional.
  • A tecnologia foi aplicada pela Nvidia e pela You.com no treinamento do modelo Nemotron 3.5 Lightning.
  • A implementação elevou a precisão do BrowseComp de 36,97% para 45,45%.
  • O uso da ferramenta reduziu em 30,24% o número de chamadas de ferramentas.

A CoreWeave anunciou o lançamento do RL Rollouts, uma solução desenvolvida para otimizar o treinamento de modelos de aprendizado por reforço. A ferramenta permite que novos pesos sejam carregados em uma implantação ativa sem a necessidade de um ciclo de redeploy, processo que anteriormente exigia pausas no treinamento.

O sistema já foi utilizado pela Nvidia e pela You.com na criação do modelo Nemotron 3.5 Lightning, demonstrando ganhos operacionais significativos. Além da maior velocidade de atualização, a tecnologia elevou a precisão do BrowseComp para 45,45% e reduziu em 30,24% a quantidade de chamadas de ferramentas durante a execução.

Comentários

Carregando comentários...