Pesquisador apresenta TailRL para otimizar aprendizado por reforço
O novo método TailRL estende o aprendizado por reforço de máxima verossimilhança para recompensas contínuas, focando em amostras de alto desempenho.
Pontos principais
- O TailRL prioriza amostras raras de alta recompensa ao maximizar o logaritmo esperado das probabilidades da cauda superior.
- A técnica é compatível com pipelines existentes por meio de uma modificação na função de vantagem.
- O método foi testado com sucesso em navegação, localização de objetos, fundamentação de GUI e otimização de código.
- O gradiente do TailRL pode ser interpretado como uma mistura de gradientes do tipo Best-of-(k).
O pesquisador Russ Salakhutdinov anunciou o desenvolvimento do Tail-Likelihood Reinforcement Learning (TailRL), uma abordagem que amplia o aprendizado por reforço de máxima verossimilhança para lidar com recompensas contínuas. O método funciona priorizando amostras raras de alta recompensa através da maximização do logaritmo esperado das probabilidades da cauda superior, sendo integrável a sistemas atuais via ajuste na função de vantagem. Testes práticos demonstraram a eficácia do TailRL em tarefas como navegação em labirintos, localização de objetos, otimização de código e fundamentação de interfaces gráficas. Além disso, o gradiente resultante do modelo oferece uma interpretação técnica como uma mistura de gradientes do tipo Best-of-(k).
Comentários
Carregando comentários...
