CoreWeave lança RL Rollouts para otimizar modelos de aprendizado
Nova ferramenta da CoreWeave permite carregar pesos em modelos de aprendizado por reforço sem redeploy, aumentando a eficiência e a performance.
Pontos principais
- O RL Rollouts possibilita carregar novos pesos 15 vezes mais rápido que um redeploy convencional.
- A tecnologia foi aplicada pela Nvidia e pela You.com no treinamento do modelo Nemotron 3.5 Lightning.
- A implementação elevou a precisão do BrowseComp de 36,97% para 45,45%.
- O uso da ferramenta reduziu em 30,24% o número de chamadas de ferramentas.
A CoreWeave anunciou o lançamento do RL Rollouts, uma solução desenvolvida para otimizar o treinamento de modelos de aprendizado por reforço. A ferramenta permite que novos pesos sejam carregados em uma implantação ativa sem a necessidade de um ciclo de redeploy, processo que anteriormente exigia pausas no treinamento.
O sistema já foi utilizado pela Nvidia e pela You.com na criação do modelo Nemotron 3.5 Lightning, demonstrando ganhos operacionais significativos. Além da maior velocidade de atualização, a tecnologia elevou a precisão do BrowseComp para 45,45% e reduziu em 30,24% a quantidade de chamadas de ferramentas durante a execução.
Comentários
Carregando comentários...
